炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
Token经济,中国账本|《财经》封面
工业时代,电力有一套成熟的计量和定价体系。它的价格相对固定,交易规则清晰。AI时代,Token的“度量衡”还远未成形。在目前的中国市场,Token经济的账本明细已经开始变得复杂
文|《财经》主笔 吴俊宇 研究员 周源
编辑|谢丽容
2026年初,中国、美国的科技公司都担心员工不使用Token(词元),组织就无法提效。今年1月,Token冲量(Token Maxxing)现象,在美国硅谷和中国科技公司中流行开来——员工Token用量越高,越被认为效率高。一些公司甚至制定了员工Token排行榜。
但从今年6月开始,越来越多公司开始担心账单失控。员工Token排行榜在很多公司消失了,各个公司开始按部门、按人头分配Token。腾讯非研发部门员工年初每月Token额度超过1500元,到了6月初大部分员工的额度被砍掉了60%以上。小米从鼓励员工无限量使用自研MiMo模型,变成设置个人上限。
这些变化发生在短短半年之内。
Token是大模型处理信息的最小单位。它就像工业时代的“一度电”。但Token和电力不同——一度电的价格相对稳定。受模型能力等因素影响,一个Token价格可能相差百倍。
Token消耗无处不在。用DeepSeek、字节跳动的豆包问一个问题,用阿里的千问点一份外卖,一次对话要消耗几百到几千Token。用腾讯WorkBuddy安排一项工作,智能体(Agent)会自主工作持续数十分钟,一次消耗数百万或千万Token。用Codex或Claude Code写一个应用,要持续数小时甚至数十小时,要消耗数亿或数十亿Token。
今年3月GTC大会上,英伟达创始人黄仁勋甚至提出“Token经济”这个概念。他认为,Token是AI时代的基础货币。生成Token的成本与效率,将决定科技企业的营收与生死。
过去三年,Token单位价格下降了90%以上,但Token总支出却在指数级增长。这被称为算力的“杰文斯效应”——模型、芯片进步让Token变得更便宜,资源总消耗不但不会减少,反而会大幅增加。
在中国,Token消耗量正在以每年数十倍的速度增长。国家数据局数据显示,截至今年3月,中国日均Token调用量超过140万亿,比2024年初的1000亿增长1400倍。国际市场调研机构IDC预测,2026年中国Token调用次数将比2025年增长20倍。
这种增长落在个人身上是什么概念?《财经》一位研究员今年5月-7月使用了229亿Token,仅7月就达到125亿,日均超过4亿。这些Token订阅成本超过1万元。它们被用于辅助研究,制作图表,分析财报和论文,开发个人应用,对国内外模型进行测试。
Token需求正以十倍、百倍速度增长,供给却严重不足。这是因为背后的算力基础设施——如芯片、存储、网络、数据中心每年只能以几十个百分点的速度增长(报道详见《从芯到云,算力为何全线短缺?|《财经》封面》)。
算力短缺进一步推高了Token成本。《财经》了解到,截至8月,中国的头部科技公司,单家的月度Token消耗量普遍超过了数十万亿,费用高达数亿元。一个研发工程师单月至少要花掉价值超过2万元的Token。企业甚至已经把Token成本作为人力成本的一部分。
对于这些企业来说,Token成本不再是可有可无的可忽略成本,这让越来越多企业开始思考:这些Token到底创造了多少价值?
《财经》了解到,中国的政策部门正在密集调研,希望就Token的质量、成本、定价建立一套评价体系。按照设想,Token最终会像电一样,被计量、交易、管理。
工业时代,电力有一套成熟的计量和定价体系。价格相对稳定,交易规则清晰。AI时代,Token经济刚刚萌芽。它的“度量衡”远未成形,技术、成本与商业模式仍在剧烈演进。
Token经济,企业层面关心的问题是:生产一个Token需要多少成本?不同能力的Token要如何选择?有限的算力应该如何分配?一个员工消耗更多Token之后,能否创造更高的人均产出? Token创造的价值,能否覆盖它消耗的算力、资本和人力?
国家层面,这个问题会变得更宏大。政策研究者更关心的是:一个国家拥有多少能源、算力、资本,能生产多少Token?这些Token最终能够转化成多少生产力?能否催生新的企业和应用?能否提高劳动生产率?能否创造新的就业和经济增长?
这些问题暂时都很难有真正的答案。但我们可以尝试逼近一个问题:中国市场,Token经济的账本究竟是怎样的?
谁决定了Token成本?
不同的Token,定价可以相差百倍。全球最贵的Claude Fable 5,在典型的智能体场景下1亿Token综合使用成本(未命中输入3%,输出1%,缓存占比96%)约1200元,最便宜的DeepSeek-V4-Flash不到7元,两者相差170倍。
那么,Token成本受哪些因素影响?黄仁勋把AI产业分成能源、芯片、基础设施、模型、应用五块蛋糕。他认为,能源、芯片、模型、基础设施共同影响着Token成本。
但这四个因素影响程度不同。野村中国科技及电讯行业分析师段冰今年4月对《财经》表示,芯片、算法在更大层面上决定了Token成本,能源、基础设施等因素更多是现有基础上做优化。
芯片是决定Token供给的核心因素。芯片越强,单位时间能够生产的Token越多,单位Token成本也会随之下降。
国际半导体市场研究机构SemiAnalysis数据显示,英伟达B300(2026年出货)运行DeepSeek-V4-Pro时,单卡Token吞吐量是H200(2024年出货)的5倍-28倍,单位Token成本仅为H200的7%-37%。
国际市场上,B300八卡服务器售价约65万-67万美元,是H200服务器的两倍左右。但更贵的芯片,反而能生产更便宜的Token。因为,芯片、存储、网络、数据中心等固定投入会被摊薄到更多Token上。
模型迭代,同样能降低单位Token成本。更强的模型,实际使用成本反而可能更低。
《财经》测算发现,在典型智能体场景下(未命中输入3%,输出1%,缓存占比96%),DeepSeek-V4-Pro 1亿Token综合使用成本约17元,比DeepSeek-R1的124元低86%。
算法创新影响了定价结构。在智能体任务中,缓存命中Token通常占总Token的90%以上。DeepSeek-V4-Pro的缓存命中价格很低,这足以抵消模型参数变大带来的基础推理成本,最终使用成本大幅下降。
软件层面的优化,如优化推理调度、提升缓存命中等,都会继续降低Token成本。不过这些因素无法起到决定作用。
芯片和模型不变,通过推理框架软件,仅三个月每秒Token吞吐量就可以提升超过20%。SemiAnalysis测试显示,英伟达B300今年4月26日运行DeepSeek-V4-Pro的吞吐速度是5920 Token/秒,但7月12日提升到7153 Token/秒。单位Token成本随之摊薄。
提高缓存命中率也能降低成本。缓存命中相当于模型的记忆。一位中国模型公司技术人士对《财经》解释,输入/输出部分主要消耗GPU(图形处理器)算力,缓存命中减少了重复计算,主要消耗存储和网络带宽资源。
以DeepSeek-V4-Pro为例,智能体任务中提升1个百分点的缓存命中,1万亿Token实际成本会从17.4万元降至14.4万元,降幅达17.1%。
能源是算力建设的前置条件,但电力成本对Token成本有影响。
电力决定了算力集群的规模和选址,建设数据中心需要能评审批,还需要选择低电价的区域。比如,北京、深圳等东部地区的电费价格是乌兰察布、大同等西部地区的2倍-3倍。
但电力在Token成本中的影响权重有限。多位数据中心从业者对《财经》表示,电力成本通常占GPU数据中心的资本支出、运营支出综合成本的10%或以下。
《财经》粗略统计,阿里、腾讯2025年的综合电力成本分别都为数十亿元。单家资本支出均在1000亿元上下。电力成本不到资本支出的十分之一。
在中国市场,Token成本里还有两个技术之外的隐性变量——美国政府的出口管制、地方城市智算中心的芯片利用率(报道详见《中国算力,以何强壮?|《财经》封面》)。
简单理解,一旦GPU服务器采购成本攀升、利用率走低,经济账就会迅速恶化。因此,芯片出口管制、智算中心芯片利用率会深刻影响中国市场的Token成本。
GPU服务器折旧周期一般是5年。一位中国云厂商资深架构师给《财经》算了一笔账,理想状态下,一台H200服务器按每月12万-15万元租赁价格,平均回本周期约3年。如果用于卖Token,它能不能在折旧期回本,服务器采购成本、GPU实际负载率影响很大。
《财经》按照英伟达今年4月官方技术博客中的Token吞吐测试数据,计算了一台H200服务器运行智谱GLM-5.2的理论回本周期(计入电力、运维成本,但不计人力、网络成本)。
结果是,如果早期以360万元/台购买,GPU利用率保持70%,理论回本周期只要17.8个月。但如果按500万元/台购买,GPU利用率仅有30%,理论回本周期将长达65.6个月——芯片报废前都无法回本。
美国政府长期对中国实施芯片出口管制。这导致中国市场芯片价格持续上涨,单位Token成本也随之走高。这就是2026下半年正在发生的事。
英伟达的芯片无法通过合规渠道进入中国市场。国际市场,H200八卡服务器价格32万-35万美元,B300八卡服务器65万-67万美元。
但这只是理论价格,转运市场往往要溢价60%-100%,甚至更高。《财经》从多位服务器渠道商了解到,H200服务器今年4月价格约360万元/台,7月超过400万,8月超过500万元,目前溢价超过80%。今年4月B300服务器价格400万-500万元,6月涨至800万-900万元,8月涨至1300万-1500万元。B300服务器目前几乎有价无市。
GPU利用率不足,单位Token成本同样会变高。空转的芯片,会产出最贵的Token。
中国市场目前算力供不应求,但部分地方城市的智算中心仍存在闲置算力。一位中国服务器厂商CEO(首席执行官)5月在一场小规模沟通中对《财经》提到,过去三年,各地方城市的算力中心,单个项目起步投入超过2亿元,大型项目超过10亿元。2026年这一轮AI需求爆发前,很多地区智算中心利用率不到50%,甚至只有30%-40%。
“数据中心建完了,商也没招来,算力也没卖出去。”他在面对地方城市客户时,经常建议不要重复建设,而是通过算力调度平台,从新疆、青海、宁夏等地调用已有算力。
芯片采购成本不断变高的大环境下,提高算力利用率变得意义重大。《财经》了解到,云厂商和模型厂商凭借更大的用户规模,可将GPU利用率维持在50%以上。
中国的Token真的便宜么?
2026年初,“Token出海”成为一种新现象,越来越多中国模型正在被全球开发者使用(报道详见《关于Token出海,三个事实和三个误解》)。
《财经》统计OpenRouter数据发现,它在今年1月-7月被调用902万亿Token。中国模型占369万亿Token,占比41%。OpenRouter是一家美国的模型中转站,覆盖全球1000多万用户和400多个模型,每月Token调用超过200万亿,占全球调用量不到1%。这虽然不多,但代表了相当一部分开发者、创业公司的偏好。
“中国Token更便宜”,被认为是中国模型出海的关键因素。事实上,这需要放在三种场景分别讨论:企业调用API(应用接口)、个人和开发者订阅、单个任务的综合成本。
在企业调用API这个市场,中国模型的价格的确更便宜。
《财经》统计了全球16款模型官网API价格,并估算了智能体场景下各家1亿Token综合使用价格(未命中输入3%,输出1%,缓存占比96%)。
中国旗舰模型(如月之暗面Kimi K3、阿里Qwen3.8 Max、智谱GLM 5.2)价格仅有美国旗舰模型(GPT-5.6 Sol)的30%-60%。中国入门模型(如DeepSeek-V4-Flash)综合使用价格甚至不到美国中端模型的3%。
中国云厂商、模型厂商还在补贴战略客户。多位中国云厂商销售对《财经》表示,包括阿里云、腾讯云、字节跳动旗下火山引擎在销售智谱GLM-5.2时,可以给战略客户五折低价。这几乎是贴着成本价卖。
但在个人用户和中小开发者市场,中国公司的Token套餐(Token Plan)实际价格,高于OpenAI、Anthropic。
《财经》今年7月-8月订阅了国内外主流Token套餐,通过开源智能体框架OpenCode重复运行同一项任务(统计谷歌24个季度财报中的10项财务指标)直至耗尽一周Token额度。最终根据周额度估算套餐中实际可用的月额度,并计算1亿Token均价。
OpenAI旗下的ChatGPT/Codex,200美元/月套餐月额度109亿Token,1亿Token均价12.5元,远低于大部分中国厂商的Token套餐。实际使用成本不到官网API列表价的2%。
国内Token套餐运行各家旗舰模型对应的1亿Token均价,阿里云是101元、火山引擎是50元、智谱25元、月之暗面95元。DeepSeek-V4-Pro是17.5元,DeepSeek-V4-Flash是6.2元。绝大部分厂商的Token使用成本都比ChatGPT/Codex更贵。
OpenAI、Anthropic的Token套餐超低定价现象也得到了SemiAnalysis的验证。SemiAnalysis今年6月耗尽OpenAI、Anthropic多个档位的套餐后,按官网API价格折算实际Token价值。
结果显示,200美元/月订阅套餐,OpenAI旗下Codex对应的Token价值是1.4万美元,Anthropic旗下Claude对应的Token价值是8000美元。实际使用成本远低于列表价格。
为什么OpenAI、Anthropic的订阅套餐,最终Token均价比中国企业还便宜?
答案是,这两家公司仍在大规模融资,短期无需盈利,补贴成本由投资人承担。它们希望低价订阅吸引重度开发者。重度开发者容易影响企业采购决策,也是潜在的创业者,他们未来可能会带来更大规模的Token消耗。
OpenAI、Anthropic还在赌,用户用不完套餐中的Token。一位中国模型公司人士对《财经》表示,真正能把上百亿Token彻底耗尽的重度开发者只是少数。大部分普通用户每月消耗量可能不到总额度的10%。但低定价策略可以吸引更多用户,带来稳定的订阅收入。
与之相反,中国企业的算力采购成本更贵,回本周期更短,收入压力更大。结果是,中国公司更多通过低价API争夺企业调用量,美国公司则通过低价订阅争夺消费者和开发者。
不过,Token定价依然不能反映真实问题。企业更关心,完成一次任务要付出多少成本。
为理清这个问题,《财经》进行了一项测试:通过OpenCode接入全球20款主流模型完成同一项任务——统计谷歌2021年-2025年20个季度的10个财务指标共200个数据,并生成一份Excel表格。每款模型独立执行3次,共完成60次任务。
选择财报统计作为任务,有三个原因。第一,它有标准答案,结果能被客观验证。第二,它是开放任务,模型要自主思考规划路径。第三,它的Token消耗大且任务时间跨度大。
三个特点叠加,不同模型的能力差距(Token消耗量、任务时长、成本等)会充分显现。需要强调,这次测试并非严格的性能基准测试,结论只适用财务统计这类重度办公场景。
《财经》最终记录了20个模型每次任务的准确率、Token消耗、任务时长、API折算成本。60次测试显示,9款模型达到100%准确率。其中包括3款海外模型,6款国产模型。
海外模型的平均任务成本更高。Claude Opus 5是9.38元,GPT-5.6 Sol是7.06元,GPT-5.5是10.16元。
国产模型的平均任务成本更低。阿里Qwen 3.8-Max(预览版)是7.74元,阿里Qwen 3.8-Max(正式版)是6.21元,智谱GLM-5.3是3.76元,月之暗面Kimi K3是2.89元,DeepSeek-V4-Pro(正式版)是0.48元,DeepSeek-V4-Flash(正式版)仅0.25元。
至少在重度办公场景,国产模型具备接近海外旗舰模型的能力,且Token成本更低。DeepSeek-V4-Flash(正式版)成本甚至只有Claude Opus 5的不到3%。
《财经》同时测试发现,面对复杂代码任务,比如半个月都难以修复的Bug时,DeepSeek-V4-Flash(正式版)和Claude Opus 5、GPT-5.6 Sol差距会被拉大。在处理这类工作时,更强、更贵的模型,可能Token消耗更少,最终成本更低。便宜的模型,反而会反复试错消耗更多Token,要花更长时间、更高成本解决问题。
60次测试过后,《财经》发现并不存在一个模型能在成本、效率、准确率三个维度同时领先。这就像是“不可能三角”:最快、最准的模型通常并不便宜,便宜的模型往往要用更长的时间完成任务。
滴普科技是一家企业级大模型解决方案服务商。滴普科技创始人赵杰辉的看法是,大多数企业面临的挑战是,Token依然没有创造足够的价值。这道题要算平,只靠Token价格下降是不够的。第一性原理是,企业要在业务中提升Token的价值密度。
事实上,企业采购AI时,通常也不会寻找某一个维度的绝对第一。时间敏感型任务,企业可能更愿意用贵而强模型。大规模批量任务,模型的成本低变得重要。审计合规等高风险任务,准确率、稳定性是不可妥协的底线。
对内,把Token用到刀刃上
模型选择影响成本。但对大多数企业来说,Token账单失控的根源,主要在于缺乏管理。
今年2月,Token冲量现象流行时,一位中国市场的模型平台高管曾在腾讯、美团、百度等科技公司分享,号召企业内每人每天消耗10亿Token。
在他看来,企业不应该时刻担心Token消耗量。像拥有“无限弹药”一样使用Token,员工才会探索出过去无法想象的应用和工作模式。“这就像打仗,用小米加步枪,和拥有无限弹药,打法完全不同。”
三个月后,这场试验逐渐回归理性。
企业逐渐意识到,Token增长并不等于生产力提升。一名员工一天消耗3亿Token,可能修复了一个长期存在的Bug(程序错误),可能完成了过去一个月才能完成的工作。但也可能没有任何产出。其中浪费的Token,远多于真正产生价值的部分。
上述中国市场的模型平台高管解释,这场试验在落地过程中逐渐变味,“一些公司的员工为了登上Token消耗排行榜,选择用各种无意义的任务刷高用量。这已经走向形式化,脱离了我当时提倡的创新工作方式的本意。”
《财经》和一些科技公司一线员工交流发现,有人把公司免费提供的Token用于和工作无关的个人项目,例如为自己的机器人编写程序,或者为孩子制作个人网页。
在这种情况下,企业随之开始收紧Token额度。越来越多公司的员工Token消耗排行榜正在消失,取而代之的是按部门、按员工核算的Token账单。
腾讯非研发部门(如行政、市场、销售等)员工今年年初每月Token额度从1500元-8000元不等。但进入6月,腾讯非研发部门员工的Token额度普遍被砍掉60%以上。小米非研发员工最初使用小米MiMo不限额度,如今一些一线员工被设置了每月500元上限。
企业的Token管理逻辑正在发生变化:从一开始鼓励员工无限量用Token,转向建立Token核算体系。这背后首先是一笔越来越无法忽视的昂贵成本。
《财经》近期密集调研了华为、阿里、腾讯、小米、美团以及部分创业公司的多位一线产研、销售、运营人员。这些企业一线员工日均Token消耗量已经达到了1000万-4亿的规模。其中销售、运营人员日均Token消耗量通常在千万级别;产研人员中等强度开发的日均Token消耗量达到了2亿-4亿,高强度开发可达5亿以上。
金山办公CEO章庆元今年7月对《财经》表示,金山办公6000多名员工今年6月消耗了4万亿Token,每月Token成本数百万元。
章庆元算了一笔账:给一名员工每月1000美元Token额度,放在单个员工身上看似不高。但在阿里、腾讯、字节跳动这类拥有至少10万名员工的公司,如果按照这个标准计算,每月Token成本就会超过1亿美元。
“CEO拿到账单,第一反应是问CFO(首席财务官),每月1亿美元Token花到哪里去了?哪些部门在用?哪些员工在用?解决了什么问题?节约了多少成本?创造了多少收入?”章庆元说,他和很多企业负责人交流后发现,大家都开始希望管好Token账单。
美的集团美云数智数字运营总经理魏晓刚今年6月对《财经》表示,美的对AI投入产出的评估已经形成了一套统一的衡量方式,由财务、人力资源、业务和IT等多个部门共同参与制定。这套体系可以按照场景算清楚,人工完成某个任务,与Token完成任务之间的效率差异。美的可以算清每一个Token的投入产出比。
《财经》了解到的情况是,阿里、腾讯这种规模的公司,每月Token消耗量高达数十万亿。研发部门,单个员工每月Token成本通常在2万元以上。
企业正在面临一个全新的问题:Token正在成为人力成本的一部分。
企业计算人力成本时,除了工资、社保、奖金等支出,还出现了一项过去不存在的支出——Token。企业愿意承担这笔新增成本的前提是,它能换来更高的人均产出。
现实中已经有这样的案例。腾讯2026年走红的AI办公产品WorkBuddy,最初的第0.01版本就是由技术产品专家汪晟杰用一个晚上写完的。今年1月15日,汪晟杰在业余时间用AI Coding(AI编码)的方式写出这套原型。他最初只是希望做一个简单干净的工具满足自己日常办公需求。没想到,这款产品快速在公司内外流行。
《财经》一位没有专业编程基础的研究员,今年5月业余时间通过Codex搭建了一套研究工作流。这套系统包含254个文件、61289行代码。一位软件工程师对《财经》表示,在2023年之前,如果完全依靠人工开发,同等规模的系统通常需要三五人花数月才能完成。如果由一个人从零开始设计、开发、调试和上线,至少需要半年。
一个人能完成过去需要一个团队才能完成的工作量,也导致企业正在改变对人的要求,甚至重新调整组织的形态。
中国科技公司产品研发团队的原有专业分工正在被打破。过去软件研发往往需要产品、设计、前端、后端、架构、测试等多个岗位协作完成。AI Coding普及之后,很多工作开始由一个人借助智能体独立完成,全栈工程师重新变得流行。
腾讯部分产品团队的形态开始从大团队协作转向“三五成群”的小编队。他们根据项目组合在一起,每个人身兼多职推进工作。
在章庆元看来,2026年金山办公在组织管理层面最重要的工作就是,全员转型全栈工程师,公司组织结构要扁平化。他说,“我们不奢望自己能变成像创业公司一样AI Native(AI原生),但是至少不要变成老登公司。”
《财经》近期与多家大型科技公司管理者和一线员工交流发现,Token正在改变企业的组织结构——只承担信息传递、部门协调的中层管理者,核心价值在削弱;只重复执行任务,缺乏业务判断能力的基层初级员工也面临压力。
中层管理层正在被要求进入业务一线,找回具体事务的“手感”。初级员工则被要求尽快建立业务判断能力,而不只是等待分配任务。
过去企业关心的是一个岗位需要多少人、每人支付多少工资。现在需要考虑的是,给一个人配置更多Token之后,他能否完成过去几个人的工作,能否探索新的业务可能性。
Token在改变企业对员工的要求,也在改变组织管理形态,甚至在改变企业的成本结构。
对外,让每个Token产生收入
算清内部的Token账单,只解决了一半问题。对于掌握大量算力的科技公司来说,更重要的问题是:如何用有限的芯片,获得更多Token收入,进而更快收回算力采购成本。
这是一个艰难的权衡问题。一台GPU服务器可以拿去训练下一代模型,也可以用于推理。如果用于推理,它既可以支持消费者聊天,也用来支持日常办公,还可以用于重度代码、智能体任务。不同选择,背后的用户规模和商业价值完全不同。
《财经》查阅英伟达官方技术博客今年4月披露的B300运行DeepSeek-V4-Pro的吞吐数据发现,一台八卡B300服务器可以同时支撑520个并发用户用于聊天,也可以同时支撑70个并发用户用于文档、总结、分析等办公任务,还可以同时支撑17个并发用户用于代码和智能体任务。
当一家科技公司拥有一台GPU服务器时,到底要怎么用?在算力有限的情况下,这是一道选择题:卖给普通消费者聊天,用户规模大但付费的人少;卖给企业和开发者,客户规模更小但付费的人多;或者用于训练模型,短期没有直接收入,但这决定未来的竞争力。
这也是今天阿里、字节跳动、腾讯等一批科技公司正在面临的问题。每一枚GPU都存在机会成本。给某个业务多分算力,另一个业务就要少分算力。
“显而易见,免费聊天很难直接产生足够的商业回报”,一位阿里技术人士对《财经》表示,任何企业拥有一台GPU服务器时,最快、最直接获得收入方式就是——部署更贵、更强,更容易收回算力采购成本的模型,而不是给用户免费聊天。
过去两年,中国科技厂商普遍依靠免费Token换取用户规模。但随着用户规模变大,Token消耗继续增长,免费模式开始收缩。字节跳动、阿里、腾讯都在控制免费用户的规模,或是尽量把他们转化成付费用户。
字节跳动旗下的豆包App拥有超过1亿日活跃用户。它仍然提供免费对话,但今年6月开始推出付费订阅,标准版68元/月、加强版200元/月、专业版500元/月。
阿里变化更明显。2026年1月,阿里通过千问App发放至少30亿元补贴,鼓励用户通过AI点外卖。这是典型的用Token和补贴换用户的打法。但到下半年,阿里就转向了——千问App开始面向消费者收费,并推出千问办公智能体直接向个人和企业收费。
《财经》了解到,微信智能体迟迟未能全量上线的一个重要原因就是,算力不够充裕,很难完全免费提供给14亿用户。
《财经》按照英伟达官网技术博客中H200运行DeepSeek-V4-Flash的吞吐效率(201.9 Token/秒/卡)测算,如果微信智能体拥有1亿日活用户,每人每天消耗5000 Token,在保持70%的集群有效利用率情况下,至少需要2万枚H200等效芯片。如果考虑波峰波谷和备用冗余等情况,实际算力需求只会更大,甚至是数倍的规模。
相比个人用户,企业客户更容易带来直接收入。因此,中国科技公司正在把更多算力资源投向云计算等To B(企业级)市场。
Token在阿里已经成了一项独立的收入指标。阿里管理层今年5月财报电话会披露,计划在2027财年末将AI相关年度经常性收入(ARR)做到300亿元。
阿里云近半年连续启动了围绕Token收入增长的“515战役”和“830战役”。“515战役”目标,是5月15日之前日均Token收入比4月初增长5倍。“830战役”,目标是8月30日之前日均Token收入再增长10倍。
阿里公共云事业部总裁刘伟光今年5月对《财经》表示,2025下半年,大部分公司的Token支出在其IT支出中的占比不到1%。2026年情况变了。据他粗略估算,一些AI创业公司的Token支出可能占其IT总支出的100%。互联网公司Token支出占比普遍达到15%-20%,其他步伐相对更慢的企业则仍在5%以下。
字节跳动也在沿着同一条路径加速。截至今年6月,豆包大模型日均Token使用量达到180万亿。《财经》多方了解到,截至5月末,火山引擎月度Token收入超过15亿元,2026年Token收入目标超过150亿元,且仍在多次上调。
独立模型公司的收入也在快速增长。截至今年6月,月之暗面ARR达到3亿美元,三个月内增长约3倍。截至7月,智谱ARR达到10亿美元,提前半年实现年初目标。
中国市场Token的商业化还在继续向更多场景下沉。中国公司正在尝试在每一个角落找到变现的方式,它甚至已经进入此前难以想象的领域——AI玩具(报道详见《深圳,把算力塞进AI玩具里》)。
《财经》今年6月走访深圳AI玩具产业链发现,一颗不到10元的芯片、一个不到14元的4G通信模组、一套20多元的喇叭、电池和电路板,再加上一份不到20元的Token买断授权,就可以让一个售价不到100元的毛绒玩具开口对话。
Token就像芯片、电池、通信模组一样,进入了很多硬件公司的物料成本表。百度智能云泛科技解决方案部行业解决方案总监张东锦对《财经》表示,对于硬件厂商来说,这种模式更容易计算成本,也更符合用户购买消费电子的习惯。
AI玩具只是中国企业寻找Token商业化的缩影。这种化学反应还在更多领域发生。深圳及其周边庞大高效的电子制造产业链,正在把Token嵌进越来越多的AI硬件——AI眼镜、AI录音卡片等一批新兴消费电子由此诞生。
从用户订阅,到企业API,再到AI硬件,中国科技公司几乎在寻找一切能够把Token转化成收入的场景,让每一个Token产生收入。
中美:两种逻辑,两套账本
中国市场是勤俭持家,用更少的资本支出,尽快实现商业正循环。美国市场还在烧钱试错,用大量免费Token补贴个人开发者,在浪费中探索可能性。
中美两个市场的Token经济,账本完全不同。这从两个市场的算力巨头资本支出差距就能看出端倪。2025年,美国主流算力巨头的资本开支规模是中国的4.7倍。
中国七家科技/算力巨头(阿里、字节跳动、腾讯、百度、中国移动、中国联通、中国电信)2025年资本支出约6586亿元,同比增长16%。保守估算,2026年资本支出在6836亿元以上,至少增长4%。
美国五家科技/算力巨头(包括亚马逊、微软、谷歌、Meta、甲骨文)2025年资本支出4500亿美元(约合3.1万亿元),同比增长70%。预计2026年资本支出7600亿美元(约合5.2万亿元),增长69%。
资本投入相差数倍,这最终改变了两个市场Token资源的分配和使用方式。美国市场在用冗余的算力扩大探索空间,中国市场在用有限的算力提高生产效率。
美国科技公司的算力资本开支更高,有成熟庞大的企业服务市场。因此它们更有意愿用便宜甚至亏损的Token培养开发者、消费者的习惯。
OpenAI、Anthropic这两家美国模型公司的低价补贴,建立在这些条件之上。今年7月-8月,OpenAI的Codex甚至几乎每周都在给用户赠送Token重置卡。
Codex产品负责人蒂博·索蒂奥(Thibault Sottiaux)每次在社交媒体X宣布重置Token额度,总会附上一句“玩得开心”(Have Fun)。开发者和消费者每次都会在社区狂欢。
在不断鼓励用户大胆使用Token的过程中,Codex用户快速增长。Codex 6月周活跃用户500万,到8月迅速突破1500万。但与此同时,OpenAI 2025年营收130.7亿美元,营业亏损209.2亿美元。换句话说,它每赚1美元,就要亏损1.6美元。
OpenAI、Anthropic虽然都尚未盈利,但千亿美元规模的融资足以支撑这套烧钱换习惯的打法,它们背后还有美国科技巨头的资本和算力支持。
中国科技公司的算力投入远小于美国科技公司。在芯片出口管制的影响下,算力供给紧张,采购成本更高,大规模补贴无从谈起。尽快获得正向现金流才更符合商业逻辑。
无论是阿里云、火山引擎激进的Token收入目标,还是豆包、千问转向收费,本质上都是这个背景下的结果。智谱今年7月Token套餐全线涨价,涨价幅度超过130%。月之暗面在推出Kimi K3后不久宣布,由于算力资源紧张暂停C端新用户订阅。
在中国市场,补贴消费者和开发者,这条不确定的路太过漫长。因此,找到能够自我造血的应用场景才更符合现实。
近三个月,多位中国服务器厂商高管、云厂商高管在小规模沟通中均向《财经》表达了一个事实——中国市场目前算力供不应求,2027下半年之后才可能有所缓解。
今年6月,浪潮信息董事长彭震对《财经》表示,短期内算力紧张没有根本解法。因为,模型算法高度依赖芯片供给。但他同时认为,创新是在资源有限的环境下诞生的。缺算力,也许会让中国的技术创新走出一条完全不同的路。
事实上,在芯片出口管制和算力供应不足的压力下,中国市场依旧在不断诞生领先的模型——比如,智谱GLM-5.2、月之暗面的Kimi K3。
有模型训练工程师对《财经》表示,智谱GLM-5.2在后训练层面做了大量创新,这让它能够以7440亿参数规模跑出万亿参数规模的效果。月之暗面的Kimi K3创新了模型的注意力机制,这让它在2.8万亿参数规模下,仍然能保持相对低廉的价格。
资源不足,让中国AI产业走上了另一条发展逻辑。技术上,用算法创新弥补算力不足,降低每一个Token的生产成本;经营上,尽量减少每一个Token的浪费;商业上,让有限的Token尽快产生收入。
当然,目前这些选择都只是阶段性的。未来两年可能还有两个变量。
如果中国芯片供不应求的情况得以缓解,华为昇腾等国产芯片持续迭代,国产芯片性能逼近国际领先水平,中国科技公司是否会开启新一轮价格补贴?
如果美国资本市场对模型公司长期亏损的容忍度触及上限,OpenAI、Anthropic被迫加速走向盈利,烧钱换规模的打法是否还能持续?
这两个变量都将影响中美两个市场的Token经济走向。
在滴普科技创始人赵杰辉看来,AI产业化想走通,归根到底要回答一道经济学题——每一个Token创造的生产力价值,能否大于它所消耗的算力、人力、运营成本。
野村中国科技及电讯行业分析师段冰今年4月曾对《财经》提到,Token经济能否健康持续发展,取决于是否能够不断涌现新的应用场景。一旦需求增长放缓,它的可持续性也将受到挑战。
工业时代,电和煤的度量衡花了几十年才成形。AI时代,Token这个度量衡的完善才刚刚开始。