这份报告写给把 Fireworks 当作对标对象的国内团队。前九章讲清楚 Fireworks 是谁、怎么赚钱、护城河在哪里、正在担心什么;第十章把它和国内市场逐项对照,列出哪些可以照搬、哪些必须改写,以及投资人听到「中国版 Fireworks」时一定会问的十个问题。
Fireworks 是一家不持有任何服务器的推理公司。它从二十多家供应商租 GPU,用自研的推理软件把租来的卡变成更多 token,按 token 或按卡时卖给 AI 应用公司。2026 年 7 月,它的年化收入突破 10 亿美元,估值 175 亿美元。
Fireworks 的前半程是「更快、更便宜的开源模型推理」。这个优势大约两年就被开源引擎和同行追平了。它能值 175 亿美元,靠的是后半程:借推理流量进入客户的业务,再用后训练和强化学习替客户造专属模型,让客户离不开它。
2022 年 10 月,Meta 的 PyTorch 负责人带着六位同事创办了 Fireworks。创始团队七人,六人来自 Meta,一人来自 Google。
| 创始人 | 职务 | 此前(官网团队页原文) | 补充 |
|---|---|---|---|
| Lin Qiao(乔琳) | CEO | Head of PyTorch at Meta | 复旦本硕、UCSB 博士,曾任职 IBM、LinkedIn;在 Meta 把 Caffe2/PyTorch 团队从 5 人带到 300 多人45,10 |
| Dmytro Dzhulgakov | CTO | PyTorch core maintainer at Meta | 乌克兰哈尔科夫人,2011 年加入 Facebook48 |
| Dmytro Ivchenko | 联合创始人 | PyTorch for ranking lead at Meta | 基辅理工;LinkedIn → Meta |
| James Reed | 联合创始人 | PyTorch compiler at Meta | — |
| Benny Chen | 联合创始人 | Meta ads infra lead | — |
| Chenyu Zhao | 联合创始人 | Google Vertex AI Lead | 唯一非 Meta 出身 |
| Pawel Garbacki | 联合创始人 | Meta Newsfeed core ML lead | — |
来源:fireworks.ai/team(2026-09-30 访问)9;Index Ventures 投资文章列出的七人名单与此一致50。
这个团队的构成说明了 Fireworks 从哪里起步:框架(PyTorch)、编译器、推荐与广告系统的线上推理。广告和信息流排序是互联网公司里 QPS 最高、对延迟和成本最敏感的推理负载。团队先在 Meta 内部把「让模型在大规模生产流量下跑得又快又省」做到了极致,再把这套能力卖给外部。
「我们不相信『一种尺寸适合所有人』,我们相信『一种尺寸只适合一个人』(one size fits one)。」
「我们的商业模式主要围绕开源模型,因为它给了企业透明度和控制权。」
「推理随消费者和开发者规模扩张,上限是全世界的人口。」——Turing Post 访谈,2025-08-2315
「每家公司都拥有别人没有的知识:它的数据、流程、客户,以及它对『好』的定义。」——D 轮通稿,2026-07-162
「公司可以一路扩张到破产。」(Companies can scale into bankruptcy.)——20VC 播客,2026-07;指的是用闭源 API 扩张、token 成本随用户数线性增长的应用公司14
四轮定价融资累计约 18.3 亿美元。估值从 A 轮约 1.3 亿美元涨到 D 轮 175 亿美元,其中 C 轮到 D 轮只用了 9 个月,涨了 4.4 倍。
| 轮次 | 公布时间 | 金额 | 领投 | 其他参与方 | 投后估值 |
|---|---|---|---|---|---|
| A 轮 | 2024-03(实际 2022 年完成) | 2,500 万美元 | Benchmark | Sequoia、Databricks Ventures、天使 | ≈1.27 亿美元 Forge 推算 |
| B 轮 | 2024-07-11 | 5,200 万美元 | Sequoia | NVIDIA、AMD、MongoDB Ventures | 5.52 亿美元 |
| C 轮 | 2025-10-28 | 2.5 亿美元(含老股) | Lightspeed、Index、Evantic | Sequoia;战略方 NVIDIA、AMD、MongoDB、Databricks | 40 亿美元 |
| D 轮 | 2026-07-15/16 | 15.05 亿美元 | Atreides(Gavin Baker)、Index、TCV | 20VC、Bessemer、Evantic、Insight、Lone Pine、Lightspeed、Menlo、NVIDIA、安大略教师养老金(OTPP)等 | 175 亿美元 |
来源:各轮官方博客与通稿1,3,4,5;Bloomberg6;Forge8。Forge 按每股价格推算的 D 轮投后估值是 155.4 亿美元,与公开报道的 175 亿美元不一致,可能源于股份口径差异。
NVIDIA 和 AMD 从 B 轮就一起进来了。Fireworks 专门为 AMD MI300 重写过内核,还和 AMD 签了多年供货协议。对芯片厂来说,Fireworks 的作用是把卡变成可以直接卖的推理服务。国内对标者可以去找国产卡厂谈同样的合作。
领投的 Atreides、TCV,以及 Lone Pine、OTPP 这类养老金和对冲基金,都是投 IPO 前阶段的资本。它们关心的是收入规模和增速,不是技术本身。
截至 2026-09-30,没有递表或 IPO 公告,也没查到老股收购要约(tender offer)8。同赛道里 Cerebras 已在 2026-05 上市,首日市值约 950 亿美元。
两年里 ARR 从约 650 万美元涨到 10 亿美元以上,日均 token 从 1,400 亿涨到 40 万亿以上。但 token 数不等于收入:按公开数字倒算,每百万 token 的平均收入只有约 7 美分。
2024-05 与 2025-05:scroll.media 引 Horizon Capital(「一年 20 倍到 1.3 亿」)48。2025-07:The Information 报道(月收入约 1,700 万美元)13。2025-10:C 轮官方3。2025-12、2026-02:Sacra 估算11。2026-05:Sacra 估算,CEO 在 20VC 播客中也提到「约 8 亿」14。2026-07:D 轮官方1。中金《Token 启示录(六)》图表 7 给出的序列与此一致:1.3 亿 → 约 2 亿 → 约 2.8 亿 → 约 8 亿 → 约 10 亿42。
来源:B 轮博客(1,400 亿)4、官方博客(2025-06 约 5 万亿)、C 轮博客(10 万亿+)3、D 轮通稿(「从 15 万亿增至 40 万亿+」)2、投资界 2026-05-30 引 Bloomberg(30 万亿)45。CEO 在播客里说 40 万亿/日「超过 OpenAI API 和 Gemini API 之和」,这是她本人的说法,无法核实。
平均单价比挂牌价低一到两个数量级,说明 40 万亿 token 里的绝大部分:①是缓存命中的输入 token(Fireworks 的缓存输入价约为输入价的 2%–10%);②来自小模型和嵌入模型;③跑在按卡时计费的专属部署上,客户自己把卡压满,折算下来每 token 很便宜。中金给出的同行数字也是同一种形态:Baseten 日均 30 万亿 token 对应约 6 亿美元 ARR,Together 日均 13 万亿 token 对应约 10 亿美元 ARR42。
国内材料常用「日均 token 调用量」证明规模,但 token 数和收入之间差着单价、缓存比例和计费方式三个变量。和投资人谈 Fireworks 对标时,要拿 ARR 比,不要拿 token 数比。token 数只能说明技术上撑得住多大流量。
| 时间 | 客户/开发者 | 来源 |
|---|---|---|
| 2024-03 | 1.2 万用户 | TechCrunch5 |
| 2024 年末 | 2.3 万开发者;B 轮时约 1,000 家公司 | scroll.media / Sacra |
| 2025-10 | 1 万家以上公司、「数十万开发者」 | C 轮博客3 |
| 2026-07 | 平台上 200 多个模型 | D 轮通稿2 |
Sacra 用 2025-10 的数字算过,平均每家公司约 2.8 万美元 ARR11。但这个平均数没有意义:收入是典型的长尾分布,头部几家大客户贡献了大部分收入,1 万家里的绝大多数是小额 serverless 用户(见第 07 章)。
Fireworks 的产品是一个转化漏斗:开发者先用 serverless API 按 token 付费试用,量大了转专属部署按卡时付费,再往上是企业私有化和后训练。中金的描述是:「通过多层产品将早期 API 用户逐步转化为专属算力和企业客户」42。
来源:官方定价页与文档18,19、Virtual Cloud20、Training API21、RFT22、Multi-LoRA23、Ember-125、Nexus26。另有音频转写(Whisper v3,约 0.0009–0.0015 美元/分钟)和嵌入模型;图像生成已不在当前定价页上。
对比 Fireworks 首页口号的变化最直观。2024 年主打「最快的推理」,2026 年改成「Own your specialized intelligence」(拥有你的专属智能)。D 轮通稿给出的数字是:日均 40 万亿 token 中,超过 95% 来自基于客户专有数据专门化、并针对特定任务优化的模型2。
这个转向背后有三层逻辑:
Fireworks 的技术栈可以按中金的成本公式拆开看:每百万 token 成本 ∝ GPU 单价 ÷(理论吞吐 × 引擎达成率 η × 利用率 U)。Fireworks 不碰 GPU 单价,因为它是租户;它做的全部工作都在 η 和 U 上。
| 技术 | 是什么 | 公开数字 | 作用于 |
|---|---|---|---|
| FireAttention v1–v4 | 自研 CUDA / ROCm 注意力与推理内核,逐代适配新精度:v1 FP8(Hopper)→ v2 长上下文 → v3 AMD MI300 → v4 NVFP4(Blackwell) | v1 比 vLLM 快 4 倍;v2 长上下文快 12 倍;v3 在 MI300 上比 H100 上的 NIM 吞吐高 1.4–1.8 倍;v4 比 H200 上的 SGLang 高 3.5 倍,R1 从 FP8 降到 FP4 后 MMLU 只掉约 0.1%27,28,29 | η |
| 自适应投机解码(FireOptimizer) | 用客户自己的流量训练专属草稿模型,而不是用通用草稿模型 | 接受率 76%,通用草稿模型只有 29%;约 2 倍加速,最高 3 倍24 | η |
| PD 分离(Disaggregated serving) | prefill 和 decode 分池部署,KV cache 独立管理,按提示词路由 | 「吞吐最高提升 4 倍」(官方) | η、U |
| 多级提示缓存 | 会话亲和路由(session affinity)加跨层缓存 | 命中率 60%–90%20 | η |
| Multi-LoRA | 一个基座部署同时挂几百到几千个 LoRA 适配器 | 「100 倍成本效率」;Cresta 跑着上千个 LoRA23 | U |
| Virtual Cloud 调度 | 跨 8 家云、20+ 算力供应商统一调度,自动故障切换 | 10 万+ 请求/秒20 | U |
| 多硬件 | NVIDIA 全系加 AMD MI300X / MI325X / MI350X | AMD 多年供货协议30 | GPU 单价(议价能力) |
| RL 训练基础设施 | 异步 RL、训练与推理引擎一致性(KL 散度校验)、权重增量压缩(XOR diff + zstd,最高小 10 倍) | 为 Cursor 在 4 个集群上跑分布式 RL,权重增量压缩到约 1/2021 | 训练侧 |
Artificial Analysis 在 2026-09 的测速32:
中金在《Token 启示录》里泼过三盆冷水,都已应验:vLLM / SGLang 已经把大部分通用优化沉淀成公共基线;原厂最懂自家模型;第三方「长期需要向硬件或向模型靠拢」42。开源引擎团队也开始商业化了:vLLM 的 Inferact 种子轮估值 8 亿美元,SGLang 的 RadixArk 估值 4 亿美元(第 08 章)。Fireworks 自己的应对是向模型靠拢:做后训练,出自有模型。推理引擎优势大约两年就会被追平,这是 Fireworks 用自己的战略转向承认的事实。
标准档 serverless 价格已经和模型原厂的官方价、同行价拉平。Fireworks 的溢价集中在三处:专属部署的卡时价、Priority / Fast / US 这类 SLA 分档,以及后训练。
| 模型(每百万 token,输入 / 输出,美元) | Fireworks 标准档 | Fireworks 高档 | 原厂官方 | Together | Baseten |
|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 0.30 / 1.20 | Priority 0.375 / 1.50;US 0.45 / 1.80 | 高峰 0.30 / 1.20 低谷 0.15 / 0.60 | 0.30 / 1.20 | 0.30 / 1.20 |
| DeepSeek V4 Pro | 1.74 / 3.48 7 月第三方 | — | 高峰 1.32 / 3.96 低谷 0.66 / 1.98 | 1.32 / 3.96 | 1.32 / 3.96 |
| Kimi K3 | 3.00 / 15.00 | Fast / US 4.50 / 22.50 | — | 3.00 / 15.00 | 3.00 / 15.00 |
| GLM-5.3 | 1.40 / 4.40 | Fast / US 2.10 / 6.60 | — | 1.40 / 4.40 | 1.40 / 4.40 |
| gpt-oss-120B | 0.15 / 0.60 | Priority 0.18 / 0.72 | — | 0.15 / 0.60 | 0.10 / 0.50 |
| Ember-1(Fireworks 自有) | 3.00 / 15.00 | Priority 3.75 / 18.75 | — | — | — |
来源:Fireworks serverless 定价文档、Together 与 Baseten 定价页、DeepSeek 官方定价(均为 2026-09-30 访问)18,46,47。「deepseek-flash」对应 V4.1 Flash 是本报告的推断。V4 Pro 的 Fireworks 价格出自 2026-07 第三方页面,与中金(六)p.17 图 19 中「三家 1.74 / 3.48」的口径一致。
两个变化:①2026 年 8 月中金写报告时,第三方 API 价格还是 DeepSeek 官方的约 4 倍,到 9 月底,Together 和 Baseten 的 V4 Pro 价格已经降到官方高峰价,溢价消失了。②DeepSeek 官方有低谷半价,第三方没有。所以在标准档上,第三方已经拼不过原厂价格,只能靠速度档、区域合规档(US)和批处理来区分。这正是中金说的「第三方从来不是靠价格赢,是靠吞吐、SLA 与私有化」。
Fireworks 按需专属部署的 H100 挂牌价是 8 美元/小时,约为市场裸租价(1.17–1.78 美元)的 4.5–6.8 倍,也比 Together(3.99 美元)和 Baseten(约 6.5 美元)贵。客户多付的这部分,买的是跑在卡上的推理引擎、多区域容灾、自动扩缩容和合规。这就是「软件溢价」在账面上的样子:卖的是卡时,价格按软件定。2026-09-01,Fireworks 还把全系卡时价上调了 7%–30%(H100 从 7 涨到 8 美元,B200 从 10 涨到 13 美元)搜索摘要。在 GPU 供给紧张的时候,它选择把成本转给客户,而不是打价格战。
注:Together 的价格可能是 GPU 集群产品而非专属推理产品,横向比较时要打折扣。按需挂牌价也不等于大客户合同价。
| 口径 | 数字 | 来源 | 可信度 |
|---|---|---|---|
| The Information 报道 | 约 50%,目标 60%(靠 GPU 优化和利用率) | The Information 2025 年中,经 Sacra / Contrary 转述13,11 | 较高,但数据可能已过时 |
| 国金证券研报 | 综合毛利率「稳定在 50%+」 | 《Token 计费重塑 AI 产业链》2026-07-1744 | 研报引用,来源未注明 |
| CEO 播客(二手摘要) | 30%–40%,远期可到 70%–80%;「可以更高,但选择了增长」 | 20VC 播客 2026-07 的 BigGo 摘要14 | 二手摘要,未见原文 |
| SemiAnalysis 理论测算 | 不计缓存:输入 token 最高 83%,输出 token 最高 45% | InferenceMAX / InferenceX v2 | 模型测算,不是公司数据 |
合理的读法是:Fireworks 的毛利率大约在 40%–50%,并且公司有意把它压在低于潜力的位置换增长。作为对照,Together 约 45%(Sacra),Baseten 未披露。这个毛利率水平和第 03 章的平均单价放在一起看才有意义:每百万 token 只收 7 美分还能有 40%–50% 毛利,说明它的有效成本已经压得很低,也就是 η × U 做得很高。
SemiAnalysis38 指出,H100 一年期租约价格已比 2025-10 的低点上涨约 40%。Fireworks 的算力全部靠租,租金上涨会直接挤压毛利。它 9 月的涨价就是在应对这件事。
Fireworks 的收入曲线和 Cursor 的收入曲线高度重合。两家开始合作时 Cursor 的 ARR 只有几百万美元,后来涨了 100–1000 倍14。据 CNBC 报道,2025 年 Fireworks 约一半收入来自 Cursor12。
Cursor 也做了多源采购,Together 的客户名单里同样有 Cursor34。另据 CNBC(经转载)报道,SpaceX 于 2026-06 同意以 600 亿美元股票收购 Cursor转载,待核实。如果属实,Fireworks 最大客户的控制权会发生变化,这是一个需要持续关注的变量。
| 客户 | 场景 | 自报效果 |
|---|---|---|
| Cursor | Fast Apply 代码编辑;Composer 训练 | 见上 |
| Notion | 1 亿+ 用户的 AI 功能 | 延迟从 2 秒降到 350 毫秒 |
| Cresta | 呼叫中心实时知识助手 | 比 GPT-4 便宜 100 倍;上千个 LoRA |
| Vercel | v0 复合模型(RL 微调) | 无错误率 93% |
| Genspark | Agent(RFT)、Gen-1 Slides | 成本降 50% |
| Harvey | 基于 Kimi K3 的法律模型 Harvey Tenet | 19.7% vs 基线 10.8% |
| Quora(Poe)、Sourcegraph、Upwork、UiPath | 对话、编程助手、提案生成、RPA Agent | Poe 响应快 3 倍 |
| Uber、DoorDash、Shopify、Samsung、Verizon、Geico、Revolut、Doximity、GitLab、Elastic、MongoDB、Perplexity | 融资通稿与媒体报道中列出的客户 | — |
来源:fireworks.ai/customers33,各轮融资通稿1,3,4,Contrary10,Sacra11。
客户画像:绝大多数是AI 原生应用公司和 SaaS 公司。它们的产品本来就跑在公有云上,流量变化快,需要随时扩容,对延迟敏感,也愿意为速度付钱。这和国内推理平台的大客户画像完全不同(第 10 章)。
美国推理层在 2026 年同时出现两件事:独立平台估值暴涨,赛道快速整合。Fireworks 面对五类对手,而其中好几家同时是它的投资人、渠道或供应商。
来源:Fireworks1;Baseten F 轮与 2026-03 年化收入约 6 亿美元35;Together C 轮与年化 bookings 超过 11.5 亿美元34;Fal(The Information 2026-03 报道洽谈 80 亿美元,Sacra 估算 ARR 约 4 亿美元);Modal C 轮与 ARR 超过 3 亿美元36。
| 类型 | 代表与最新数字 | 和 Fireworks 的关系 |
|---|---|---|
| 独立推理平台 | Together(83 亿美元估值,毛利约 45%,GPU 出租占收入大头,正在自建数据中心);Baseten(130 亿美元,年化约 6 亿美元);Modal(46.5 亿美元,按 GPU 秒计费);Fal(媒体生成);DeepInfra(1.07 亿美元 B 轮,OpenRouter 上的价格领先者) | 正面竞争。Together 更像 neocloud,Fireworks 更偏软件 |
| 开源引擎公司 | Inferact(vLLM,种子轮 1.5 亿美元、估值 8 亿美元,a16z / Lightspeed);RadixArk(SGLang,1 亿美元、估值 4 亿美元,Accel;为 Google、Microsoft、xAI 等服务每日数万亿 token)39 | 在削弱「我们的推理栈更好」这个卖点 |
| Neocloud 向上走 | CoreWeave(Q2 收入 25.7 亿美元,储备订单 1,042 亿美元);Nebius Token Factory(60+ 模型,99.9% SLA);Nscale 以 16.5 亿美元收购 Anyscale(Ray) | 它们自己有卡,从卡时层往 token 层走,和 Fireworks 的 serverless 直接重叠 |
| 云厂商 | AWS Bedrock(开源模型通常贵 10%–40%,但默认进企业采购);Azure Foundry(转售 Fireworks,2026-08 GA);Google Vertex | 既是渠道,也是替代者。微软拥有客户关系 |
| 芯片厂与模型厂 | NVIDIA(收购 OctoAI 约 1.65 亿美元、Lepton → DGX Cloud Lepton;以约 200 亿美元授权加收编 Groq 团队)40;Cerebras(2026-05 上市,OpenAI 承诺 200 亿美元以上采购);DeepSeek、Moonshot 等原厂 API(低谷半价) | NVIDIA 既是投资人也是竞争者;原厂 API 在价格上压制第三方 |
| 被收购方 | 收购方 | 时间 | 对价 | 说明 |
|---|---|---|---|---|
| OctoAI | NVIDIA | 2024-09 | 约 1.65 亿美元 | 推理优化公司 |
| Lepton AI | NVIDIA | 2025-04 | 未披露(估 3–5 亿美元) | 贾扬清团队;改名 DGX Cloud Lepton,聚合 25+ 云 |
| Replicate | Cloudflare | 2025-11 | 未披露 | 5 万+ 模型并入 Workers AI |
| Groq(团队 + 授权) | NVIDIA | 2025-12 | 约 200 亿美元 | 非独家授权加收编团队;GroqCloud 保留 |
| Anyscale | Nscale | 2026-07 | 16.5 亿美元 | neocloud 收购软件层 |
这张表对国内对标者的意义是:推理软件公司的退出路径不只有 IPO,被芯片厂、云厂或 neocloud 收购也是常见结局。估值区间从 1.65 亿美元到 200 亿美元不等,取决于收购方拿到的是团队、技术,还是客户和流量。
看空 Fireworks 的理由集中在六点。这些也是国内对标者在路演中会被逐条追问的问题。
17.5 倍 ARR 的估值建立在高速增长上。Newcomer(2026-05-29)37引用一位怀疑派投资人的话:「VC 只是在按收入倍数估值,并假设毛利率不重要。」推理平台必须 7×24 小时保持 GPU 在线以保证可用性,而云厂商和模型厂不用付同样的租金。
2025 年约一半收入来自 Cursor。CEO 说现在「已经分散得多了」,但没有给出数字。而 Cursor 自己在训练模型、也在多源采购,控制权还可能变更。
SemiAnalysis(2026-05-01,「AI Value Capture – The Shift To Model Labs」)38指出,Anthropic 的 ARR 从 90 亿美元涨到 440 亿美元以上,推理毛利从 38% 升到 70% 以上。它承认 Fireworks、Baseten、Fal 的毛利在扩大,但结论是价值主要流向模型厂。
H100 一年期租金比低点上涨约 40%,NVIDIA 同时是投资人和竞争者,供给紧张时优先级难以保证。AMD 是 Fireworks 的对冲筹码。
平台主力模型大量来自中国:DeepSeek、Kimi、GLM、Qwen、MiniMax。Cursor Composer 和 Ember-1 都以 Kimi 为基座。美国一旦限制中国开源权重,或授权条款收紧(例如 Kimi 的修改版 MIT 协议要求大规模商用时展示署名),Fireworks 首当其冲。公司没有披露中国模型的 token 占比。
测速已经跌到中游(第 05 章),开源引擎公司在商业化,neocloud 在往 token 层走。Fireworks 的应对是转向后训练,但 Together 和 Baseten 也在做同样的事:Baseten 称领先的应用公司把 30%–50% 的模型支出投向了定制化和后训练42。
公开检索中没有发现 2026 年 Fireworks 的重大故障、诉讼或裁员报道。
「对标 Fireworks」这句话里其实混着三种对标,投资人和客户会分别追问:技术对标(推理引擎做得一样好)、商业模式对标(租卡加软件、按 token 卖、往后训练延伸)、估值对标(按收入倍数定价)。前两种都能成立,但需要改写;第三种最容易被戳穿。
| 维度 | Fireworks 所在的美国市场 | 国内市场 | 对对标者的含义 |
|---|---|---|---|
| 客户 | AI 原生公司、SaaS 公司,产品跑在公有云上,流量变化快,要求随用随扩 | 中金:国内中立平台的大客户「往往自有算力资源,更关注数据安全,更倾向于私有部署」。硅基流动前五大客户占收入 45%,其中四家买的是本地部署42 | 利润来自私有化和本地部署,不来自公有云 API |
| 价格 | 第三方与原厂同价,溢价靠速度和 SLA 档位;客户付得起 | 价格战加免费券。硅基流动公有云毛利 2024 年 −271.6%、2025 年 −119.0%,免费 token 券花了 5,421 万元43 | 公有云 serverless 在国内是亏钱的获客入口,不能指望它赚钱 |
| 硬件 | 以 NVIDIA 为主,AMD 为辅;同构,代际清晰 | 国产卡多品牌、多代并存,软件栈不统一;实际可用算力明显低于标称 | 异构适配是真实需求,也是规模化负担。中金:壁垒在于「适配能力能否沉淀为可复用能力」42 |
| 模型 | 拿中国开源模型卖给美国客户,原厂不在美国直接竞争 | 模型厂自营 API 且价格激进;大厂「自研模型 + 云生态打包卖」,第三方没有生态可以交叉补贴43 | 纯 MaaS 转售的空间被原厂和云厂两头挤压 |
| 资本 | 约 17.5 倍 ARR,投资人认可 | 澎湃测算硅基流动 77 亿元估值对应约 140 倍 PS,是海外同行的 3–4 倍,并因此受到质疑43 | 在国内按 Fireworks 的收入倍数估值很难成立,要拿利润和现金流说话 |
在美国,serverless 是能赚钱的入口;在国内,它是烧钱的入口。硅基流动的本地部署毛利是 82.5%,公有云是 −119%43。国内版本的主力收入应该是私有化和本地部署加运营服务。
国内 token 单价没有地板,按 token 转售等于参与价格战。中金算过,聚合层只分到产业价值的约 5%42。更可行的是「同样的卡多跑出多少有效算力」这种结果口径,按节省额分成,或按产出计价。
Fireworks 只需要面对两家芯片厂。国内要面对十来个品牌、好几代卡。如果每接一种卡就要重做一遍,规模化就会被拖垮。要把适配能力沉淀成可复用的层,并且明确哪些代次不接。
| # | 问题 | Fireworks 的答案(可作为参照) |
|---|---|---|
| 1 | 你的收入是按 token、按卡时还是按项目?各占多少? | 三者都有;专属部署和企业合同贡献主要收入,serverless 负责获客 |
| 2 | 毛利率多少?是哪个口径?公有云和私有化分别是多少? | 约 40%–50%,目标 60%;有意压低换增长 |
| 3 | 最大客户占比多少?它会不会自己做? | 2025 年 Cursor 约占一半;靠后训练把它留住 |
| 4 | 同一张卡,你比 vLLM / SGLang 最新版快多少?有第三方测速吗? | 有 Artificial Analysis 公开测速,但领先幅度在缩小 |
| 5 | 两年后开源引擎追上你,你靠什么留住客户? | 专属模型、RL 基础设施、驻场研究员 |
| 6 | 算力从哪来?租金上涨时毛利怎么办? | 20+ 供应商、8 朵云,AMD 对冲,把涨价转给客户 |
| 7 | 和模型厂自营 API、云厂 MaaS 相比,客户为什么选你? | 多模型选择、速度档、合规档(US)、定制化 |
| 8 | token 数和收入怎么对应?每百万 token 收多少钱? | 约 0.07 美元,远低于挂牌价(第 03 章) |
| 9 | 支持哪些卡?哪些不接?每接一种新卡要多少人月? | NVIDIA 全系加 AMD 三代;为 MI300 从零重写内核 |
| 10 | 如果不 IPO,谁会收购你? | 同类公司先后被 NVIDIA、Cloudflare、Nscale 收购(第 08 章) |
Fireworks 值得对标,但要对标它现在的样子:一家借推理流量入场、靠后训练留住客户、用 SLA 分档和软件溢价赚钱的「专属智能」公司。它两年前那个「最快的开源模型推理 API」已经不是它的核心了。国内对标者如果只讲推理加速,讲的就是 Fireworks 已经放弃的那部分故事。
| 数据 | 冲突或风险 | 本报告的处理 |
|---|---|---|
| D 轮估值 | 公开报道 175 亿美元;Forge 按每股 61.65 美元推算为 155.4 亿美元 | 采用 175 亿美元,注明差异 |
| A 轮时间 | 2024-03 公布,TechCrunch 称 2022 年已完成 | 记为 2022 年完成、2024 年公布 |
| 毛利率 | 约 50%(The Information,2025 年中) vs 30%–40%(播客二手摘要) | 取 40%–50% 区间,两个来源都列出 |
| Cursor 收入占比 | 「约一半」出自 CNBC,原文无法直接访问(403),经转载核对 | 标注为报道口径 |
| SpaceX 收购 Cursor | 只在 CNBC 的转载中看到 | 标注「待核实」 |
| 员工数 | 约 200 人(CNBC,2026-07)/ 304 人(Contrary,2026-08)/ 第三方追踪数据互相矛盾 | 写作 200–300 人 |
| 2025-12、2026-02、2026-05 的 ARR | Sacra 估算;约 8 亿美元与 CEO 播客口径一致 | 图中用浅色标为估算 |
| GPU 涨价前的价格与生效日期 | 当前价格已在官网核实;此前价格和 9-01 生效日期出自搜索摘要 | 标注「搜索摘要」 |
| 微软 Foundry 时间 | 2026-03 宣布合作,2026-08-04 GA | 两个时间都列出 |
| 累计融资 | 约 18.3 亿美元(Forge / Sacra) vs 21 亿美元以上(ValueAddVC) | 采用约 18.3 亿美元(四轮之和) |
| 每百万 token 平均收入 | 本报告用 ARR 除以年化 token 量得出,未计入专属部署客户自有流量等因素 | 只作量级参考 |
| 未找到的数据 | GPU 机队规模、OpenRouter 份额、中国模型 token 占比、GB200 价格 | 未使用 |
CNBC、Business Wire、The Information 等原文在检索时返回 403 或需要付费,相关内容来自正规转载(Yahoo / Quartz、OTPP 通稿、Tekedia)或搜索摘要,已在正文逐条标注。