AI Token工厂战争:每赚一元亏六块,资本还在排队送钱

七颜百科 °C 栏目:生活百科
AI Token工厂战争:每赚一元亏六块,资本还在排队送钱

  来源:秦川晚风

  2026年7月13日,一家叫趋境科技的清华系公司宣布完成A轮融资。至此,它半年内累计融资超过10亿元。

  两天后,硅基流动正式向港交所递交招股书,有望成为港股市场首只“Token工厂”概念股。招股书披露了一组令人窒息的数字:2025年营收5533万元,净亏损3.45亿元。

  每实现1元营业收入,对应亏损约6.2元。

  这还不是最魔幻的部分。最魔幻的是——明知在亏,资本仍在疯狂涌入。硅基流动B轮融资超20亿元,无问芯穹累计融资突破22亿元,趋境科技半年10亿元。短短半年,这条赛道吸金超过50亿。

  为什么?因为所有人都看到了同一个数字:2026年3月,中国日均Token调用量突破140万亿,相比2024年初的1000亿,增长了1000倍

  高盛预计,到2030年,这个数字将达到日均4600万亿。

  这不是一个关于“谁做得好”的故事,而是一个关于“谁能在亏损中活到最后”的故事。

  - - -

  一、从“卖显卡”到“卖Token”:一场静默的范式转移

  训练的时代结束了

  过去三年,AI产业的核心叙事是“训练”——谁的参数大、谁的卡多、谁的集群猛。英伟达市值飙到3万亿美元,靠的就是这场军备竞赛。

  但2026年,风向变了。

  中国工程院院士邬贺铨在WAIC 2026上给出判断:全球推理算力将占AI算力总负载的70%至80%。IDC预计到2028年,推理工作负载占比将达到73%。

  一位行业资深人士的表述更直白:“2026年AI推理计算需求已达到训练需求的4至5倍。”

  这意味着什么?

  意味着买GPU不再是为了“教AI学东西”,而是为了“让AI干活”。训练是一次性的,推理是持续的。训练结束,卡就闲了;推理不停,卡就永远在转。

  而推理的计量单位,就是Token。

  Token成了AI时代的“度电”

  国家数据局的数据显示,截至2026年3月,中国日均Token调用量已超过140万亿,相比2024年初的1000亿增长了1000多倍。

  王东在WAIC 2026上给出了更激进的预测:2026年中国MaaS Token调用量将达40000万亿次

  高盛的预测则给出了完整的增长曲线:

  

年份 日均Token消耗量 API及订阅收入
2026 350万亿 350亿元
2028 ~2000万亿 ~3000亿元
2030 4600万亿 8790亿元

  从350亿到8790亿,四年25倍。

  这就是为什么资本在亏钱也要冲——他们赌的不是今天的利润,而是明天的基础设施。

  当Token成为AI时代的“度电”,Token工厂就是新时代的“发电厂”。

  - - -

  二、三层格局:芯片、平台、服务

  芯片层:没有万能GPU

  王东在WAIC 2026上做了一个重要判断:推理市场没有“万能芯片”

  原因很简单——推理场景高度碎片化。一个对话机器人和一个代码生成工具,对算力、显存、带宽的需求完全不同。不存在任何一家公司能够垄断所有细分应用场景。

  这直接打破了英伟达在训练时代的垄断逻辑。

  清微智能CTO欧阳鹏提出,AI芯片将走向多元化,过去由通用GPU主导的格局会发生变化,非通用GPU芯片将获得更大市场空间。

  在这个逻辑下,国产GPU厂商找到了新机会。摩尔线程在WAIC 2026上展示了PD异构分离方案——将高算力需求的Prefill计算池与高带宽的Decode生成池分离部署,在基于Kimi K2.5模型的推理测试中,混合部署方案相比纯国际主流GPU方案,平均TGS(Tokens/GPU/S)提升1.87倍,首字延迟降低56.9%

  这意味着:同样的卡,经过深度优化后,Token产出量可以提升2-3倍。

  平台层:Token工厂的混战

  这是目前竞争最激烈的层。

  

企业 最新融资 核心数据 特点
**硅基流动** B轮超20亿元 2025年营收5533万、亏损3.45亿;170+模型、千万用户、13000+企业 港股“Token工厂第一股”,市场份额1.5%
**趋境科技** A轮,半年累计超10亿元 6月单月收入超2025全年;产能增长30倍 清华系,“少模型、深优化”路线
**无问芯穹** 累计融资22亿元 日均Token调用量较2025年底增长超20倍 Agentic MaaS平台
**Open Router** B轮1.13亿美元 800万用户、月处理100万亿Token、年化收入5000万美元 全球最大API聚合平台,正在寻求卖身

  四家公司的命运截然不同:

  硅基流动走的是“大卖场”路线——170+模型、千万用户、全品类覆盖。但代价是,公有云业务陷入“卖得越多,亏得越狠”的怪圈。一位业务负责人对南方周末记者坦言:“整个API行业都在亏。”

  趋境科技走的是“精品专卖”路线——不追求模型数量,只深耕少数头部模型。CEO艾智远的比喻是:相比打造一家什么都卖的“大卖场”,趋境更希望成为一家“精品专卖”。这种策略带来了更健康的经营质量——部分成熟业务已跨过成本线,打破了AI Infra企业普遍“增收不增利”的困局。

  无问芯穹则押注Agentic MaaS——面向Agent时代的推理需求,日均Token调用量增长超20倍。

  Open Router的故事则是一个警示。这家全球最大的AI大模型API聚合平台,聚合超400款AI大模型,坐拥800万用户,每月处理约100万亿Token。但即便如此,年化收入仅5000万美元,现在正在寻求卖身。

  Open Router的困境说明了一个残酷的现实:在北美,算力集中在英伟达,大模型由少数闭源巨头垄断,中间商长期独立生存很难。

  服务层:尚未成形

  王东预判,随着推理市场碎片化,将涌现大量第三方推理服务提供商(ISP),为MaaS服务商或终端客户提供更具性价比、更灵活的定制化推理服务。

  这一层目前还处于萌芽期,但未来可能成为最大的市场。

  - - -

  三、技术破局:以存换算与PD分离

  “存储墙”才是真正的瓶颈

  大模型推理的核心矛盾,不是算力不够,而是显存不够

  以H20运行32B参数的DeepSeek-R1为例:模型权重占用64GB显存,剔除运行开销后,仅剩余22GB空间留给KVCache,折算仅能容纳88K左右Token缓存。短请求场景尚可支撑,高并发+超长上下文落地时,显存迅速打满,集群吞吐量断崖下滑。

  这就是行业普遍遇到的“AI推理内存墙”

  XSKY的测试数据显示,KVCache卸载到SSD后,可以在不增加GPU的情况下将并发能力提升3-5倍。但这只是权宜之计——根本解决方案是“以存换算”。

  PD分离:把工厂拆成两个车间

  趋境科技提出的“国产Prefill-Decode异构协同”方案,是目前最具代表性的技术路线。

  原理很简单:把推理过程拆成两个阶段——

  • Prefill(预填充)阶段:一次性处理输入文本,并行计算,生成初始KVCache。这个阶段需要高算力。
  • Decode(解码)阶段:逐Token自回归生成,依托KVCache复用历史计算结果。这个阶段需要高带宽。

  传统做法是一个GPU同时干两件事,结果两边都做不好。PD分离的做法是——用高算力芯片跑Prefill,用高带宽芯片跑Decode,各司其职。

  摩尔线程的实测数据:在Kimi K2.5模型上,混合部署方案相比纯国际主流GPU方案,平均TGS提升1.87倍,首字延迟降低56.9%

  KVCache池化:让显存从“独占”走向“共享”

  更前沿的突破来自KVCache池化。

  曦望芯片完成了月之暗面Mooncake的深度适配——Mooncake Store将分散在各实例的显存、主机内存乃至SSD汇聚成统一的KVCache缓存池:

  - 实例间可复用同一份KVCache,避免重复计算

  - 流量高峰时可弹性扩容、低谷时缩容而不丢失缓存

  - 模型迭代时可原地升级,保留已积累的缓存

  在Agent多轮对话、长上下文推理成为常态的今天,这种池化能力直接决定了推理服务能不能在有限硬件下扛住更高的并发、更长的上下文、更复杂的交互链路。

  池化的本质,是把每一份算力都用在刀刃上。

  - - -

  四、中美分野:两种命运

  同样是Token中间商,中美企业走向了完全不同的命运。

  三大差异

  第一,算力生态不同。

  北美AI基础设施高度标准化,Open Router不需要关注底层硬件怎么跑,它更像是一个轻资产的“API路由与清算管道”。这种模式技术门槛较低,容易被AWS、Google或OpenAI的自建功能降维打击。

  国内算力生态则呈现出异构分散的格局——英伟达、华为、壁仞、沐曦、寒武纪等多家芯片并存,同一个开源模型在不同芯片上的性能和代码并不兼容。中国的Token工厂需要做跨芯片适配、推理引擎优化、异构算力调度等工作,存在真正的工程能力壁垒。

  第二,竞争生态不同。

  美国市场里,算力集中在英伟达,大模型由OpenAI、Anthropic、Google等少数闭源巨头高度垄断。中间商中长期独立生存很难——Open Router就是前车之鉴。

  中国市场则不同。大模型格局尚未完全收敛,国产芯片百花齐放,中间商有更大的生存空间。

  第三,商业模式不同。

  硅基流动走的是“API聚合”模式——接入大量模型,面向开发者和企业提供标准化API。但公有云业务陷入价格战,“卖得越多,亏得越狠”。

  趋境科技走的是“共建模式”——与拥有算力资源的客户(如地方智算中心)联合建设AI Token工厂。这精准承接了各地智算中心从“卖算力”向“卖高品质AI Token”转型的需求。

  一位投资人的总结:“早期看项目更看重增速与规模,现在则更关注单位Token成本、客户留存率、毛利改善曲线等经营质量指标。”

  - - -

  五、投资坐标

  第一层:确定性的基础设施

  无论哪家大模型最终胜出,推理都需要算力。无论哪种芯片最终胜出,推理都需要优化。

  这意味着:

  • AI服务器市场:IDC预测2026年中国AI服务器市场规模达3500亿元,且推理工作负载占比持续攀升
  • 推理算力租赁:2026年推理算力租赁价格半年涨幅近40%,供不应求
  • 存储硬件:2026年一季度存储硬件价格翻倍上涨,直接受益于KVCache需求爆发

  第二层:平台层的残酷淘汰

  Token工厂赛道目前处于“百团大战”阶段,但终局必然走向集中。

  关键判断标准有三条:

  • 技术壁垒:能否实现跨芯片适配和深度推理优化——硅基流动有规模但缺深度,趋境科技有深度但缺规模
  • 客户结构:是卖API给散户(低粘性、高价格敏感),还是服务大客户(高粘性、定制化需求)——趋境科技的共建模式更有优势
  • 盈利路径:能否在规模扩张的同时改善毛利——趋境科技部分业务已跨过成本线,硅基流动仍在“培养用户习惯”

  第三层:被忽视的服务层

  王东预判的“第三方推理服务提供商”可能是最大的机会。

  推理场景碎片化意味着,没有一家公司能服务所有场景。垂直领域的推理优化服务——比如专门服务医疗AI、金融AI、工业AI的推理服务商——可能比通用Token工厂更容易盈利。

  - - -

  六、终局判断

  Token工厂的故事,本质上是一个关于“基础设施”的故事。

  每一次技术革命都会催生新的基础设施:电力革命催生了发电厂,互联网革命催生了数据中心,AI革命催生了Token工厂。

  但基础设施生意有一个铁律:先亏后赚,赢者通吃

  发电厂亏了二十年才开始赚钱,数据中心亏了十五年。Token工厂的亏损周期可能更短——因为需求增长太快了。从1000亿到140万亿,只用了一年半。

  但活到最后的前提是,你得有真正的技术壁垒。

  硅基流动有规模但没有壁垒,Open Router有用户但没有壁垒。趋境科技有技术但还在追赶规模。无问芯穹有融资但还在寻找定位。

  Token工厂的终局不是“谁的模型多”,而是“谁的单位Token成本低”。在这个赛道里,最危险的事情不是亏钱——而是亏了钱还建立不起壁垒。

  2026年7月,WAIC展馆里,“Token工厂”几乎随处可见。摩尔线程、无问芯穹、是石科技,全都在讲Token的生产、优化和调度。

  很多公司不再只讲“我有多少卡、接了多少模型”,而是开始讲“我能不能用同样算力,生产出更多有效Token”。

  这是一个好信号。因为当所有人都在问“效率”而不是“规模”的时候,行业就真的成熟了。

  只是,成熟的过程会很疼。

  - - -

  数据来源:高盛研究报告、国家数据局、IDC、硅基流动招股书、WAIC 2026公开演讲、南方周末、投资界、新浪财经、每日经济新闻等公开渠道。