对标研究 · FIREWORKS AI

Fireworks AI 深度研究:
四年做到 175 亿美元的推理公司,以及「对标它」意味着什么

这份报告写给把 Fireworks 当作对标对象的国内团队。前九章讲清楚 Fireworks 是谁、怎么赚钱、护城河在哪里、正在担心什么;第十章把它和国内市场逐项对照,列出哪些可以照搬、哪些必须改写,以及投资人听到「中国版 Fireworks」时一定会问的十个问题。

数据截至 2026-09-30 一手来源 Fireworks 官网与博客、融资通稿、官方定价页 二手来源 Bloomberg / CNBC / TechCrunch / The Information 转述、Sacra、Contrary、中金《Token 启示录》 篇幅 10 章 + 2 个附录

SECTION 00一页看懂

Fireworks 是一家不持有任何服务器的推理公司。它从二十多家供应商租 GPU,用自研的推理软件把租来的卡变成更多 token,按 token 或按卡时卖给 AI 应用公司。2026 年 7 月,它的年化收入突破 10 亿美元,估值 175 亿美元。

175 亿美元
D 轮投后估值(2026-07,融资 15.05 亿美元)1
>10 亿美元
年化收入(ARR),同比约 5 倍1
40 万亿+
日均 Token;其中 95% 以上来自为客户定制的模型2
≈50%
毛利率(2025 年中报道,目标 60%;口径有争议,见第 06 章)13
200–300 人
员工(2026 年中);计划年底约 600 人12,10
0 台
自有服务器;算力来自 20+ 供应商、8 朵云12,20

五个判断

  1. Fireworks 卖的不是卡,而是同一张卡上多出来的 token。它一张 GPU 都不买,按需专属部署的 H100 挂牌价却是每小时 8 美元,约为市场裸租价的 4.5–6.8 倍。这部分溢价来自软件,它的毛利也来自软件。
  2. 「最快的推理」这个卖点正在失效,Fireworks 已经换了故事。第三方测速显示,它在 Kimi K3 等前沿模型上已排在中游。标准档 serverless 价格和模型原厂的官方价基本一致。2026 年,它的主口号从「最快」改成了「拥有你自己的专属智能」,主推后训练、强化学习和自有模型。「95% 的 token 来自定制模型」是这次转型的核心数字。
  3. 它是靠一个客户起飞的。2025 年约一半收入来自 Cursor(报道口径)。合作从用投机解码 API 做 Cursor 的 Fast Apply 开始,后来 Fireworks 替 Cursor 跑 Composer 模型的分布式 RL 训练。这就是「推理进门、训练锁客」的实际路径。
  4. 估值按收入倍数算,不按利润算。175 亿美元对应约 17.5 倍 ARR。同行里 Baseten 约 22 倍,Together 约 7.5 倍。怀疑者的原话是:「VC 只是在按收入倍数估值,并假设毛利率不重要。」
  5. 对国内对标者来说,Fireworks 的打法能抄,它所在的市场抄不来。产品漏斗、定制化路线、和明星客户共建都可以照搬。美国 AI 原生公司愿意付的 token 溢价、以公有云为主的客户结构,国内没有。国内同层的硅基流动,公有云毛利率是 −119%43。中金的判断是,国内大客户自有算力、偏好私有化部署42。
一句话版

Fireworks 的前半程是「更快、更便宜的开源模型推理」。这个优势大约两年就被开源引擎和同行追平了。它能值 175 亿美元,靠的是后半程:借推理流量进入客户的业务,再用后训练和强化学习替客户造专属模型,让客户离不开它。

SECTION 01公司速写:PyTorch 团队出走

2022 年 10 月,Meta 的 PyTorch 负责人带着六位同事创办了 Fireworks。创始团队七人,六人来自 Meta,一人来自 Google。

创始团队

创始人职务此前(官网团队页原文)补充
Lin Qiao(乔琳)CEOHead of PyTorch at Meta复旦本硕、UCSB 博士,曾任职 IBM、LinkedIn;在 Meta 把 Caffe2/PyTorch 团队从 5 人带到 300 多人45,10
Dmytro DzhulgakovCTOPyTorch core maintainer at Meta乌克兰哈尔科夫人,2011 年加入 Facebook48
Dmytro Ivchenko联合创始人PyTorch for ranking lead at Meta基辅理工;LinkedIn → Meta
James Reed联合创始人PyTorch compiler at Meta—
Benny Chen联合创始人Meta ads infra lead—
Chenyu Zhao联合创始人Google Vertex AI Lead唯一非 Meta 出身
Pawel Garbacki联合创始人Meta Newsfeed core ML lead—

来源:fireworks.ai/team(2026-09-30 访问)9;Index Ventures 投资文章列出的七人名单与此一致50。

这个团队的构成说明了 Fireworks 从哪里起步:框架(PyTorch)、编译器、推荐与广告系统的线上推理。广告和信息流排序是互联网公司里 QPS 最高、对延迟和成本最敏感的推理负载。团队先在 Meta 内部把「让模型在大规模生产流量下跑得又快又省」做到了极致,再把这套能力卖给外部。

创始人怎么描述这门生意

「我们不相信『一种尺寸适合所有人』,我们相信『一种尺寸只适合一个人』(one size fits one)。」
「我们的商业模式主要围绕开源模型,因为它给了企业透明度和控制权。」
「推理随消费者和开发者规模扩张,上限是全世界的人口。」——Turing Post 访谈,2025-08-2315

「每家公司都拥有别人没有的知识:它的数据、流程、客户,以及它对『好』的定义。」——D 轮通稿,2026-07-162

「公司可以一路扩张到破产。」(Companies can scale into bankruptcy.)——20VC 播客,2026-07;指的是用闭源 API 扩张、token 成本随用户数线性增长的应用公司14

大事记

SECTION 02融资与估值

四轮定价融资累计约 18.3 亿美元。估值从 A 轮约 1.3 亿美元涨到 D 轮 175 亿美元,其中 C 轮到 D 轮只用了 9 个月,涨了 4.4 倍。

轮次公布时间金额领投其他参与方投后估值
A 轮2024-03(实际 2022 年完成)2,500 万美元BenchmarkSequoia、Databricks Ventures、天使≈1.27 亿美元 Forge 推算
B 轮2024-07-115,200 万美元SequoiaNVIDIA、AMD、MongoDB Ventures5.52 亿美元
C 轮2025-10-282.5 亿美元(含老股)Lightspeed、Index、EvanticSequoia;战略方 NVIDIA、AMD、MongoDB、Databricks40 亿美元
D 轮2026-07-15/1615.05 亿美元Atreides(Gavin Baker)、Index、TCV20VC、Bessemer、Evantic、Insight、Lone Pine、Lightspeed、Menlo、NVIDIA、安大略教师养老金(OTPP)等175 亿美元

来源:各轮官方博客与通稿1,3,4,5;Bloomberg6;Forge8。Forge 按每股价格推算的 D 轮投后估值是 155.4 亿美元,与公开报道的 175 亿美元不一致,可能源于股份口径差异。

值得注意的三点

两家芯片厂同时入股

NVIDIA 和 AMD 从 B 轮就一起进来了。Fireworks 专门为 AMD MI300 重写过内核,还和 AMD 签了多年供货协议。对芯片厂来说,Fireworks 的作用是把卡变成可以直接卖的推理服务。国内对标者可以去找国产卡厂谈同样的合作。

D 轮投资人换成了成长基金

领投的 Atreides、TCV,以及 Lone Pine、OTPP 这类养老金和对冲基金,都是投 IPO 前阶段的资本。它们关心的是收入规模和增速,不是技术本身。

还没有 IPO 计划

截至 2026-09-30,没有递表或 IPO 公告,也没查到老股收购要约(tender offer)8。同赛道里 Cerebras 已在 2026-05 上市,首日市值约 950 亿美元。

SECTION 03规模:收入、Token、客户

两年里 ARR 从约 650 万美元涨到 10 亿美元以上,日均 token 从 1,400 亿涨到 40 万亿以上。但 token 数不等于收入:按公开数字倒算,每百万 token 的平均收入只有约 7 美分。

图 1 · 年化收入(ARR)轨迹
单位:百万美元。颜色区分数据来源的可信度:官方 > 媒体报道 > 第三方估算
1,1508625752880.06.52024-051302025-052002025-072802025-103052025-123152026-028002026-051,0002026-07
公司官方披露媒体报道第三方估算

2024-05 与 2025-05:scroll.media 引 Horizon Capital(「一年 20 倍到 1.3 亿」)48。2025-07:The Information 报道(月收入约 1,700 万美元)13。2025-10:C 轮官方3。2025-12、2026-02:Sacra 估算11。2026-05:Sacra 估算,CEO 在 20VC 播客中也提到「约 8 亿」14。2026-07:D 轮官方1。中金《Token 启示录(六)》图表 7 给出的序列与此一致:1.3 亿 → 约 2 亿 → 约 2.8 亿 → 约 8 亿 → 约 10 亿42。

图 2 · 日均 Token 处理量
单位:万亿 token / 日
4634.52311.500.142024-0752025-06102025-1015D 轮前302026-05402026-07
公司官方披露媒体报道第三方估算

来源:B 轮博客(1,400 亿)4、官方博客(2025-06 约 5 万亿)、C 轮博客(10 万亿+)3、D 轮通稿(「从 15 万亿增至 40 万亿+」)2、投资界 2026-05-30 引 Bloomberg(30 万亿)45。CEO 在播客里说 40 万亿/日「超过 OpenAI API 和 Gemini API 之和」,这是她本人的说法,无法核实。

Token 数不是收入口径:每百万 token 只收约 7 美分

10 亿美元 ARR ÷(40 万亿 token/日 × 365 日)≈ 0.068 美元 / 百万 token 本报告测算。作为对照,Fireworks 标准档 serverless 上 Kimi K3 挂牌价是输入 3 美元、输出 15 美元/百万 token;DeepSeek V4.1 Flash 是 0.30 / 1.20 美元。

平均单价比挂牌价低一到两个数量级,说明 40 万亿 token 里的绝大部分:①是缓存命中的输入 token(Fireworks 的缓存输入价约为输入价的 2%–10%);②来自小模型和嵌入模型;③跑在按卡时计费的专属部署上,客户自己把卡压满,折算下来每 token 很便宜。中金给出的同行数字也是同一种形态:Baseten 日均 30 万亿 token 对应约 6 亿美元 ARR,Together 日均 13 万亿 token 对应约 10 亿美元 ARR42。

对国内对标者的提醒

国内材料常用「日均 token 调用量」证明规模,但 token 数和收入之间差着单价、缓存比例和计费方式三个变量。和投资人谈 Fireworks 对标时,要拿 ARR 比,不要拿 token 数比。token 数只能说明技术上撑得住多大流量。

客户规模

时间客户/开发者来源
2024-031.2 万用户TechCrunch5
2024 年末2.3 万开发者;B 轮时约 1,000 家公司scroll.media / Sacra
2025-101 万家以上公司、「数十万开发者」C 轮博客3
2026-07平台上 200 多个模型D 轮通稿2

Sacra 用 2025-10 的数字算过,平均每家公司约 2.8 万美元 ARR11。但这个平均数没有意义:收入是典型的长尾分布,头部几家大客户贡献了大部分收入,1 万家里的绝大多数是小额 serverless 用户(见第 07 章)。

SECTION 04产品栈:五层漏斗

Fireworks 的产品是一个转化漏斗:开发者先用 serverless API 按 token 付费试用,量大了转专属部署按卡时付费,再往上是企业私有化和后训练。中金的描述是:「通过多层产品将早期 API 用户逐步转化为专属算力和企业客户」42。

① Serverless按 token 计费
共享 GPU,开箱即用,200 多个开源模型。分 Standard / Priority(约 1.25 倍)/ Fast / 「US 专属」(1.5 倍)四档;Batch 五折;缓存输入单独计价,约为输入价的 2%–10%。这一层用来获客,不是利润中心。
Kimi K3
$3 / $15 每百万
② On-demand 专属部署按 GPU·小时计费
独占 GPU,默认多区域部署,单区域加价 1.5 倍。可选 A100 / H100 / H200 / B200 / B300 / GB300,AMD MI325X / MI350X 也可选但不公开价格。24 个单区域,覆盖美国、加拿大、法兰克福、冰岛、马来西亚、澳洲、东京。
H100 $8/时
B200 $13/时
③ 企业 / Virtual Cloud预留容量与 BYOC
跨 8 家云、20 个数据中心统一调度,自动故障切换;多级提示缓存命中率 60%–90%。支持客户自带 GPU(BYOC)、客户自有存储和密钥(S3 / GCS / Azure,KMS)。认证:SOC 2 Type II、HIPAA、ISO 27001/27701/42001;开源模型默认零数据留存。
合同价
④ 后训练2026 年的主推层
SFT / DPO(LoRA 与全参)→ 强化微调 RFT + 开源 Eval Protocol → Training API(2026-08-31 GA):客户写自己的 Python 训练循环,Fireworks 托管 trainer 和 rollout 集群,支持异步 RL、权重热加载、训练与推理引擎的一致性校验。再往上是 Fireworks Lab:研究员驻场,模型、评测和配方归客户所有。Multi-LoRA 让训练出来的上千个 LoRA 按基座价格上线。
LoRA SFT ≤16B
$0.5 / 百万训练 token
⑤ 自有模型与路由2026 年下半年新增
Ember-1(2026-09-23):在 Kimi K3 基础上后训练,输出 token 少约 40%,和 K3 同价。Nexus(2026-07-26):给 Claude Code、Codex 这类编程 Agent 加一层难度感知路由,把常规任务从闭源模型转到开源模型,号称成本降 3–5 倍。另有 Specialized Intelligence Index(7 个行业评测)。
Ember-1
$3 / $15 每百万

来源:官方定价页与文档18,19、Virtual Cloud20、Training API21、RFT22、Multi-LoRA23、Ember-125、Nexus26。另有音频转写(Whisper v3,约 0.0009–0.0015 美元/分钟)和嵌入模型;图像生成已不在当前定价页上。

2026 年的战略重心:从「跑得快」转向「帮客户造模型」

对比 Fireworks 首页口号的变化最直观。2024 年主打「最快的推理」,2026 年改成「Own your specialized intelligence」(拥有你的专属智能)。D 轮通稿给出的数字是:日均 40 万亿 token 中,超过 95% 来自基于客户专有数据专门化、并针对特定任务优化的模型2。

这个转向背后有三层逻辑:

  1. 挂着通用模型卖 token 没有粘性。同一个 Kimi K3,Fireworks、Together、Baseten 挂的是同一个价(第 06 章),客户换一行 base_url 就能走。
  2. 定制过的模型客户搬不走。客户用自己的数据在 Fireworks 上做了 RL,权重、评测集和推理优化(草稿模型、量化配方)都在这个平台上打磨过,迁移成本很高。
  3. 训练会带来推理。每训出一个专属模型,就多一份长期运行的推理负载。CEO 的说法是:「世界将是数以百万计的专属模型,每个应用、每个场景一个。」14
客户效果(官方案例,均为自报)

Harvey 在 Kimi K3 上做法律领域后训练,任务得分 19.7%,基线是 10.8%。Vercel v0 用 RL 微调把无错误率做到 93%,延迟降到原来的 1/40。Genspark 做 RFT 后质量比闭源 SOTA 高 10%、工具调用多 33%、成本降约 50%。Heidi Health 延迟降到 1/3.521,22。

SECTION 05技术:它到底优化了什么

Fireworks 的技术栈可以按中金的成本公式拆开看:每百万 token 成本 ∝ GPU 单价 ÷(理论吞吐 × 引擎达成率 η × 利用率 U)。Fireworks 不碰 GPU 单价,因为它是租户;它做的全部工作都在 η 和 U 上。

技术是什么公开数字作用于
FireAttention v1–v4自研 CUDA / ROCm 注意力与推理内核,逐代适配新精度:v1 FP8(Hopper)→ v2 长上下文 → v3 AMD MI300 → v4 NVFP4(Blackwell)v1 比 vLLM 快 4 倍;v2 长上下文快 12 倍;v3 在 MI300 上比 H100 上的 NIM 吞吐高 1.4–1.8 倍;v4 比 H200 上的 SGLang 高 3.5 倍,R1 从 FP8 降到 FP4 后 MMLU 只掉约 0.1%27,28,29η
自适应投机解码(FireOptimizer)用客户自己的流量训练专属草稿模型,而不是用通用草稿模型接受率 76%,通用草稿模型只有 29%;约 2 倍加速,最高 3 倍24η
PD 分离(Disaggregated serving)prefill 和 decode 分池部署,KV cache 独立管理,按提示词路由「吞吐最高提升 4 倍」(官方)η、U
多级提示缓存会话亲和路由(session affinity)加跨层缓存命中率 60%–90%20η
Multi-LoRA一个基座部署同时挂几百到几千个 LoRA 适配器「100 倍成本效率」;Cresta 跑着上千个 LoRA23U
Virtual Cloud 调度跨 8 家云、20+ 算力供应商统一调度,自动故障切换10 万+ 请求/秒20U
多硬件NVIDIA 全系加 AMD MI300X / MI325X / MI350XAMD 多年供货协议30GPU 单价(议价能力)
RL 训练基础设施异步 RL、训练与推理引擎一致性(KL 散度校验)、权重增量压缩(XOR diff + zstd,最高小 10 倍)为 Cursor 在 4 个集群上跑分布式 RL,权重增量压缩到约 1/2021训练侧

速度领先正在缩小

Artificial Analysis 在 2026-09 的测速32:

这说明什么

中金在《Token 启示录》里泼过三盆冷水,都已应验:vLLM / SGLang 已经把大部分通用优化沉淀成公共基线;原厂最懂自家模型;第三方「长期需要向硬件或向模型靠拢」42。开源引擎团队也开始商业化了:vLLM 的 Inferact 种子轮估值 8 亿美元,SGLang 的 RadixArk 估值 4 亿美元(第 08 章)。Fireworks 自己的应对是向模型靠拢:做后训练,出自有模型。推理引擎优势大约两年就会被追平,这是 Fireworks 用自己的战略转向承认的事实。

SECTION 06定价与单位经济

标准档 serverless 价格已经和模型原厂的官方价、同行价拉平。Fireworks 的溢价集中在三处:专属部署的卡时价、Priority / Fast / US 这类 SLA 分档,以及后训练。

Serverless:挂牌价已经趋同

模型(每百万 token,输入 / 输出,美元)Fireworks 标准档Fireworks 高档原厂官方TogetherBaseten
DeepSeek V4.1 Flash0.30 / 1.20Priority 0.375 / 1.50;US 0.45 / 1.80高峰 0.30 / 1.20
低谷 0.15 / 0.60
0.30 / 1.200.30 / 1.20
DeepSeek V4 Pro1.74 / 3.48 7 月第三方—高峰 1.32 / 3.96
低谷 0.66 / 1.98
1.32 / 3.961.32 / 3.96
Kimi K33.00 / 15.00Fast / US 4.50 / 22.50—3.00 / 15.003.00 / 15.00
GLM-5.31.40 / 4.40Fast / US 2.10 / 6.60—1.40 / 4.401.40 / 4.40
gpt-oss-120B0.15 / 0.60Priority 0.18 / 0.72—0.15 / 0.600.10 / 0.50
Ember-1(Fireworks 自有)3.00 / 15.00Priority 3.75 / 18.75———

来源:Fireworks serverless 定价文档、Together 与 Baseten 定价页、DeepSeek 官方定价(均为 2026-09-30 访问)18,46,47。「deepseek-flash」对应 V4.1 Flash 是本报告的推断。V4 Pro 的 Fireworks 价格出自 2026-07 第三方页面,与中金(六)p.17 图 19 中「三家 1.74 / 3.48」的口径一致。

两个变化:①2026 年 8 月中金写报告时,第三方 API 价格还是 DeepSeek 官方的约 4 倍,到 9 月底,Together 和 Baseten 的 V4 Pro 价格已经降到官方高峰价,溢价消失了。②DeepSeek 官方有低谷半价,第三方没有。所以在标准档上,第三方已经拼不过原厂价格,只能靠速度档、区域合规档(US)和批处理来区分。这正是中金说的「第三方从来不是靠价格赢,是靠吞吐、SLA 与私有化」。

专属部署:卡时价是市场裸租的 4–7 倍

图 3 · 按需专属部署的 GPU 卡时价格
橙色竖带为 H100 市场裸租区间(中金《Token 启示录(五)》p.8:1.17–1.78 美元/卡时)
$0$4$8$12$16H100Fireworks $8Together $3.99Baseten $6.5H200Fireworks $8Together $5.99Baseten:未公开B200Fireworks $13Together $8.19Baseten $9.98B300Fireworks $15Together $9.99Baseten:未公开← H100 市场裸租 1.17–1.78美元 / GPU·小时(按需专属部署挂牌价,2026-09-30 官网)

Fireworks 按需专属部署的 H100 挂牌价是 8 美元/小时,约为市场裸租价(1.17–1.78 美元)的 4.5–6.8 倍,也比 Together(3.99 美元)和 Baseten(约 6.5 美元)贵。客户多付的这部分,买的是跑在卡上的推理引擎、多区域容灾、自动扩缩容和合规。这就是「软件溢价」在账面上的样子:卖的是卡时,价格按软件定。2026-09-01,Fireworks 还把全系卡时价上调了 7%–30%(H100 从 7 涨到 8 美元,B200 从 10 涨到 13 美元)搜索摘要。在 GPU 供给紧张的时候,它选择把成本转给客户,而不是打价格战。

注:Together 的价格可能是 GPU 集群产品而非专属推理产品,横向比较时要打折扣。按需挂牌价也不等于大客户合同价。

毛利率:50% 还是 30–40%?

口径数字来源可信度
The Information 报道约 50%,目标 60%(靠 GPU 优化和利用率)The Information 2025 年中,经 Sacra / Contrary 转述13,11较高,但数据可能已过时
国金证券研报综合毛利率「稳定在 50%+」《Token 计费重塑 AI 产业链》2026-07-1744研报引用,来源未注明
CEO 播客(二手摘要)30%–40%,远期可到 70%–80%;「可以更高,但选择了增长」20VC 播客 2026-07 的 BigGo 摘要14二手摘要,未见原文
SemiAnalysis 理论测算不计缓存:输入 token 最高 83%,输出 token 最高 45%InferenceMAX / InferenceX v2模型测算,不是公司数据

合理的读法是:Fireworks 的毛利率大约在 40%–50%,并且公司有意把它压在低于潜力的位置换增长。作为对照,Together 约 45%(Sacra),Baseten 未披露。这个毛利率水平和第 03 章的平均单价放在一起看才有意义:每百万 token 只收 7 美分还能有 40%–50% 毛利,说明它的有效成本已经压得很低,也就是 η × U 做得很高。

利空:GPU 租金在涨

SemiAnalysis38 指出,H100 一年期租约价格已比 2025-10 的低点上涨约 40%。Fireworks 的算力全部靠租,租金上涨会直接挤压毛利。它 9 月的涨价就是在应对这件事。

SECTION 07客户:Cursor 与集中度

Fireworks 的收入曲线和 Cursor 的收入曲线高度重合。两家开始合作时 Cursor 的 ARR 只有几百万美元,后来涨了 100–1000 倍14。据 CNBC 报道,2025 年 Fireworks 约一半收入来自 Cursor12。

Cursor 案例:从推理进门到训练锁定

  1. 进门:Fast Apply。Cursor 的代码修改要把模型给出的改动快速「应用」到整个文件里,输出和输入高度相似,非常适合投机解码。Fireworks 专门开放了 Speculative Decoding API,Cursor 用它做出了 Fast Apply42。
  2. 扩大:专属推理资源。Cursor 的主力流量跑在 Fireworks 的专属部署上,中金称之为「稳定的专属推理资源 + 围绕具体模型和业务负载的性能适配」42。
  3. 锁定:Composer 的 RL 训练。Cursor 的自研模型 Composer 2 以 Kimi K2.5 为基座(经 Moonshot 商业授权、通过 Fireworks 调用),最终模型只有约 1/4 的算力来自基座。Fireworks 在 4 个集群上为它跑全球分布式 RL 训练41。

Cursor 也做了多源采购,Together 的客户名单里同样有 Cursor34。另据 CNBC(经转载)报道,SpaceX 于 2026-06 同意以 600 亿美元股票收购 Cursor转载,待核实。如果属实,Fireworks 最大客户的控制权会发生变化,这是一个需要持续关注的变量。

官方客户名单与用法

客户场景自报效果
CursorFast Apply 代码编辑;Composer 训练见上
Notion1 亿+ 用户的 AI 功能延迟从 2 秒降到 350 毫秒
Cresta呼叫中心实时知识助手比 GPT-4 便宜 100 倍;上千个 LoRA
Vercelv0 复合模型(RL 微调)无错误率 93%
GensparkAgent(RFT)、Gen-1 Slides成本降 50%
Harvey基于 Kimi K3 的法律模型 Harvey Tenet19.7% vs 基线 10.8%
Quora(Poe)、Sourcegraph、Upwork、UiPath对话、编程助手、提案生成、RPA AgentPoe 响应快 3 倍
Uber、DoorDash、Shopify、Samsung、Verizon、Geico、Revolut、Doximity、GitLab、Elastic、MongoDB、Perplexity融资通稿与媒体报道中列出的客户—

来源:fireworks.ai/customers33,各轮融资通稿1,3,4,Contrary10,Sacra11。

客户画像:绝大多数是AI 原生应用公司和 SaaS 公司。它们的产品本来就跑在公有云上,流量变化快,需要随时扩容,对延迟敏感,也愿意为速度付钱。这和国内推理平台的大客户画像完全不同(第 10 章)。

SECTION 08竞争格局

美国推理层在 2026 年同时出现两件事:独立平台估值暴涨,赛道快速整合。Fireworks 面对五类对手,而其中好几家同时是它的投资人、渠道或供应商。

图 4 · 美国独立推理平台:估值与收入倍数
估值为最近一轮投后(Fal 为洽谈价);ARR 取最接近融资时点的公开或报道数字
最近一轮投后估值(亿美元)ARR | 估值/ARR 倍数Fireworks2026-07 D 轮17510 亿美元 | 17.5×Baseten2026-06 F 轮1306 亿美元 | 21.7×Together AI2026-07 C 轮8311 亿美元 | 7.5×Fal2026-03 洽谈中804 亿美元 | 20.0×Modal2026-05 C 轮463 亿美元 | 15.5×

来源:Fireworks1;Baseten F 轮与 2026-03 年化收入约 6 亿美元35;Together C 轮与年化 bookings 超过 11.5 亿美元34;Fal(The Information 2026-03 报道洽谈 80 亿美元,Sacra 估算 ARR 约 4 亿美元);Modal C 轮与 ARR 超过 3 亿美元36。

五类对手

类型代表与最新数字和 Fireworks 的关系
独立推理平台Together(83 亿美元估值,毛利约 45%,GPU 出租占收入大头,正在自建数据中心);Baseten(130 亿美元,年化约 6 亿美元);Modal(46.5 亿美元,按 GPU 秒计费);Fal(媒体生成);DeepInfra(1.07 亿美元 B 轮,OpenRouter 上的价格领先者)正面竞争。Together 更像 neocloud,Fireworks 更偏软件
开源引擎公司Inferact(vLLM,种子轮 1.5 亿美元、估值 8 亿美元,a16z / Lightspeed);RadixArk(SGLang,1 亿美元、估值 4 亿美元,Accel;为 Google、Microsoft、xAI 等服务每日数万亿 token)39在削弱「我们的推理栈更好」这个卖点
Neocloud 向上走CoreWeave(Q2 收入 25.7 亿美元,储备订单 1,042 亿美元);Nebius Token Factory(60+ 模型,99.9% SLA);Nscale 以 16.5 亿美元收购 Anyscale(Ray)它们自己有卡,从卡时层往 token 层走,和 Fireworks 的 serverless 直接重叠
云厂商AWS Bedrock(开源模型通常贵 10%–40%,但默认进企业采购);Azure Foundry(转售 Fireworks,2026-08 GA);Google Vertex既是渠道,也是替代者。微软拥有客户关系
芯片厂与模型厂NVIDIA(收购 OctoAI 约 1.65 亿美元、Lepton → DGX Cloud Lepton;以约 200 亿美元授权加收编 Groq 团队)40;Cerebras(2026-05 上市,OpenAI 承诺 200 亿美元以上采购);DeepSeek、Moonshot 等原厂 API(低谷半价)NVIDIA 既是投资人也是竞争者;原厂 API 在价格上压制第三方

整合潮:两年内被收购的推理公司40,49

被收购方收购方时间对价说明
OctoAINVIDIA2024-09约 1.65 亿美元推理优化公司
Lepton AINVIDIA2025-04未披露(估 3–5 亿美元)贾扬清团队;改名 DGX Cloud Lepton,聚合 25+ 云
ReplicateCloudflare2025-11未披露5 万+ 模型并入 Workers AI
Groq(团队 + 授权)NVIDIA2025-12约 200 亿美元非独家授权加收编团队;GroqCloud 保留
AnyscaleNscale2026-0716.5 亿美元neocloud 收购软件层

这张表对国内对标者的意义是:推理软件公司的退出路径不只有 IPO,被芯片厂、云厂或 neocloud 收购也是常见结局。估值区间从 1.65 亿美元到 200 亿美元不等,取决于收购方拿到的是团队、技术,还是客户和流量。

SECTION 09风险与争议

看空 Fireworks 的理由集中在六点。这些也是国内对标者在路演中会被逐条追问的问题。

① 估值只看收入,不看利润

17.5 倍 ARR 的估值建立在高速增长上。Newcomer(2026-05-29)37引用一位怀疑派投资人的话:「VC 只是在按收入倍数估值,并假设毛利率不重要。」推理平台必须 7×24 小时保持 GPU 在线以保证可用性,而云厂商和模型厂不用付同样的租金。

② 客户集中

2025 年约一半收入来自 Cursor。CEO 说现在「已经分散得多了」,但没有给出数字。而 Cursor 自己在训练模型、也在多源采购,控制权还可能变更。

③ 价值向模型厂转移

SemiAnalysis(2026-05-01,「AI Value Capture – The Shift To Model Labs」)38指出,Anthropic 的 ARR 从 90 亿美元涨到 440 亿美元以上,推理毛利从 38% 升到 70% 以上。它承认 Fireworks、Baseten、Fal 的毛利在扩大,但结论是价值主要流向模型厂。

④ 算力全靠租

H100 一年期租金比低点上涨约 40%,NVIDIA 同时是投资人和竞争者,供给紧张时优先级难以保证。AMD 是 Fireworks 的对冲筹码。

⑤ 依赖中国开源模型

平台主力模型大量来自中国:DeepSeek、Kimi、GLM、Qwen、MiniMax。Cursor Composer 和 Ember-1 都以 Kimi 为基座。美国一旦限制中国开源权重,或授权条款收紧(例如 Kimi 的修改版 MIT 协议要求大规模商用时展示署名),Fireworks 首当其冲。公司没有披露中国模型的 token 占比。

⑥ 技术领先会被追平

测速已经跌到中游(第 05 章),开源引擎公司在商业化,neocloud 在往 token 层走。Fireworks 的应对是转向后训练,但 Together 和 Baseten 也在做同样的事:Baseten 称领先的应用公司把 30%–50% 的模型支出投向了定制化和后训练42。

公开检索中没有发现 2026 年 Fireworks 的重大故障、诉讼或裁员报道。

SECTION 10对标 Fireworks:国内团队的启示

「对标 Fireworks」这句话里其实混着三种对标,投资人和客户会分别追问:技术对标(推理引擎做得一样好)、商业模式对标(租卡加软件、按 token 卖、往后训练延伸)、估值对标(按收入倍数定价)。前两种都能成立,但需要改写;第三种最容易被戳穿。

10.1 中美市场的五个结构差异

维度Fireworks 所在的美国市场国内市场对对标者的含义
客户AI 原生公司、SaaS 公司,产品跑在公有云上,流量变化快,要求随用随扩中金:国内中立平台的大客户「往往自有算力资源,更关注数据安全,更倾向于私有部署」。硅基流动前五大客户占收入 45%,其中四家买的是本地部署42利润来自私有化和本地部署,不来自公有云 API
价格第三方与原厂同价,溢价靠速度和 SLA 档位;客户付得起价格战加免费券。硅基流动公有云毛利 2024 年 −271.6%、2025 年 −119.0%,免费 token 券花了 5,421 万元43公有云 serverless 在国内是亏钱的获客入口,不能指望它赚钱
硬件以 NVIDIA 为主,AMD 为辅;同构,代际清晰国产卡多品牌、多代并存,软件栈不统一;实际可用算力明显低于标称异构适配是真实需求,也是规模化负担。中金:壁垒在于「适配能力能否沉淀为可复用能力」42
模型拿中国开源模型卖给美国客户,原厂不在美国直接竞争模型厂自营 API 且价格激进;大厂「自研模型 + 云生态打包卖」,第三方没有生态可以交叉补贴43纯 MaaS 转售的空间被原厂和云厂两头挤压
资本约 17.5 倍 ARR,投资人认可澎湃测算硅基流动 77 亿元估值对应约 140 倍 PS,是海外同行的 3–4 倍,并因此受到质疑43在国内按 Fireworks 的收入倍数估值很难成立,要拿利润和现金流说话

10.2 可以照搬的六件事

  1. 不买卡,靠软件拿溢价。Fireworks 自有服务器为零,却能把 H100 卡时卖到裸租价的 5 倍以上。国内同层硅基流动的物业厂房设备净值只有 92.7 万元,同样不买卡43。区别在于它没能把溢价收回来。要学的不是「不买卡」,而是让客户为软件付费的计价方式。
  2. 按 SLA 分档定价,不在标准价上拼。Standard、Priority、Fast、区域专属、Batch,每档对应不同的服务承诺。国内可以直接照搬这套思路:数据不出域、国产化部署、专属集群,都可以做成加价档。
  3. 做成转化漏斗。serverless 获客 → 专属部署 → 企业私有化 → 后训练。每一层的计费单位都不同(token → 卡时 → 合同 → 项目),单价逐层抬高。
  4. 推理进门,训练锁客。这是 Fireworks 2026 年最重要的一步:95% 的 token 来自定制模型,Training API 加驻场研究员。推理优化能帮你拿到第一单,客户留下来是因为专属模型搬不走。
  5. 绑定一个高速增长的明星客户共建。Cursor 从几百万美元 ARR 起和 Fireworks 一起长大。国内对应的做法是找一个正在起量、对成本和延迟都敏感的应用公司,用一个具体场景切进去(类似 Fast Apply 这样的投机解码场景),再一路做到它的模型训练。
  6. 让芯片厂站到你这边。NVIDIA 和 AMD 都投了 Fireworks,AMD 还专门供卡。国内的对应对象是国产卡厂和持有国产卡的出资方。「为某款国产卡重写内核」相当于 Fireworks 做 FireAttention v3 的那一步。

10.3 必须改写的三件事

公有云 API 不是利润中心

在美国,serverless 是能赚钱的入口;在国内,它是烧钱的入口。硅基流动的本地部署毛利是 82.5%,公有云是 −119%43。国内版本的主力收入应该是私有化和本地部署加运营服务。

计价口径要改成「按节省额」

国内 token 单价没有地板,按 token 转售等于参与价格战。中金算过,聚合层只分到产业价值的约 5%42。更可行的是「同样的卡多跑出多少有效算力」这种结果口径,按节省额分成,或按产出计价。

异构适配要做成可复用的产品

Fireworks 只需要面对两家芯片厂。国内要面对十来个品牌、好几代卡。如果每接一种卡就要重做一遍,规模化就会被拖垮。要把适配能力沉淀成可复用的层,并且明确哪些代次不接。

10.4 投资人听到「中国版 Fireworks」时一定会问的十个问题

#问题Fireworks 的答案(可作为参照)
1你的收入是按 token、按卡时还是按项目?各占多少?三者都有;专属部署和企业合同贡献主要收入,serverless 负责获客
2毛利率多少?是哪个口径?公有云和私有化分别是多少?约 40%–50%,目标 60%;有意压低换增长
3最大客户占比多少?它会不会自己做?2025 年 Cursor 约占一半;靠后训练把它留住
4同一张卡,你比 vLLM / SGLang 最新版快多少?有第三方测速吗?有 Artificial Analysis 公开测速,但领先幅度在缩小
5两年后开源引擎追上你,你靠什么留住客户?专属模型、RL 基础设施、驻场研究员
6算力从哪来?租金上涨时毛利怎么办?20+ 供应商、8 朵云,AMD 对冲,把涨价转给客户
7和模型厂自营 API、云厂 MaaS 相比,客户为什么选你?多模型选择、速度档、合规档(US)、定制化
8token 数和收入怎么对应?每百万 token 收多少钱?约 0.07 美元,远低于挂牌价(第 03 章)
9支持哪些卡?哪些不接?每接一种新卡要多少人月?NVIDIA 全系加 AMD 三代;为 MI300 从零重写内核
10如果不 IPO,谁会收购你?同类公司先后被 NVIDIA、Cloudflare、Nscale 收购(第 08 章)
结论

Fireworks 值得对标,但要对标它现在的样子:一家借推理流量入场、靠后训练留住客户、用 SLA 分档和软件溢价赚钱的「专属智能」公司。它两年前那个「最快的开源模型推理 API」已经不是它的核心了。国内对标者如果只讲推理加速,讲的就是 Fireworks 已经放弃的那部分故事。

APPENDIX A口径冲突与数据说明

数据冲突或风险本报告的处理
D 轮估值公开报道 175 亿美元;Forge 按每股 61.65 美元推算为 155.4 亿美元采用 175 亿美元,注明差异
A 轮时间2024-03 公布,TechCrunch 称 2022 年已完成记为 2022 年完成、2024 年公布
毛利率约 50%(The Information,2025 年中) vs 30%–40%(播客二手摘要)取 40%–50% 区间,两个来源都列出
Cursor 收入占比「约一半」出自 CNBC,原文无法直接访问(403),经转载核对标注为报道口径
SpaceX 收购 Cursor只在 CNBC 的转载中看到标注「待核实」
员工数约 200 人(CNBC,2026-07)/ 304 人(Contrary,2026-08)/ 第三方追踪数据互相矛盾写作 200–300 人
2025-12、2026-02、2026-05 的 ARRSacra 估算;约 8 亿美元与 CEO 播客口径一致图中用浅色标为估算
GPU 涨价前的价格与生效日期当前价格已在官网核实;此前价格和 9-01 生效日期出自搜索摘要标注「搜索摘要」
微软 Foundry 时间2026-03 宣布合作,2026-08-04 GA两个时间都列出
累计融资约 18.3 亿美元(Forge / Sacra) vs 21 亿美元以上(ValueAddVC)采用约 18.3 亿美元(四轮之和)
每百万 token 平均收入本报告用 ARR 除以年化 token 量得出,未计入专属部署客户自有流量等因素只作量级参考
未找到的数据GPU 机队规模、OpenRouter 份额、中国模型 token 占比、GB200 价格未使用

CNBC、Business Wire、The Information 等原文在检索时返回 403 或需要付费,相关内容来自正规转载(Yahoo / Quartz、OTPP 通稿、Tekedia)或搜索摘要,已在正文逐条标注。

APPENDIX B参考来源