在经历近半年的狂热追逐后,不少科技公司对Token的态度正在重回理性。
Token(词元)是人工智能大模型处理文本的最小原子单位,过去一段时间,Token消耗量被不少企业视为衡量AI参与度和转型决心的硬指标。然而Silicon Data发布的大模型Token支出指数( LLM Token Expenditure Index)显示,Token的市场价格在今年上半年一路飞涨后,于6月开始掉头向下,已从峰值时的每百万Token 2.2美元下降了约40%。

Silicon Data 发布的大模型 Token支出指数。
不少分析师将这一价格指数的回落视为AI泡沫破裂的先兆,但中央财经大学中国互联网经济研究院副院长欧阳日辉认为,这并不意味着AI技术本身走到了“边际收益等于边际成本”的衰退拐点,而是市场在供需调节、技术替代效应及成本优化策略的共同作用下,进行的一场健康的“挤水分”运动。
“水分”从何而来?
“水分”注入可以追溯到今年上半年的Token竞赛。据《纽约时报》今年3月报道,在Meta、OpenAI及Shopify等硅谷巨头内部,管理层曾奖励重度依赖AI的员工,甚至将Token调用量作为绩效评估的重要指标。一周调用2100亿个Token、单月花费15万美元Token,这些极端案例折射出程序员的Token焦虑,不少人为了在内部排行榜上争名或证明自身价值,开始无节制地刷量。
这股狂热同样席卷国内。不少互联网公司高调宣布All in AI,为员工开放无上限的调用权限。需求的快速膨胀推动Token价格一路水涨船高,据中国信息通信研究院监测,2026年上半年国内公有云大模型Token服务均价,相比2025年下半年涨幅达51%。
短暂狂欢后,企业在复盘时猛然发现:Token消耗占公司运营成本的比例越来越大,实际带来的业务转化和效率增幅却远不如预期。Entelligence AI的调查显示,企业每花费1美元购买的Token中,仅0.18美元对产出有直接贡献,其余0.44美元用于修复Bug,0.27美元用于重写AI生成代码,另有0.11美元在审查等环节中被消耗。
清醒过来的管理者开始收紧投入策略。优步(Uber)早在4月份就用尽了2026年人工智能预算,并设定员工每月支出上限为1500美元;Meta、亚马逊、沃尔玛和特斯拉等也纷纷引入支出上限,或引导员工转向更便宜的模型。
国内企业的态度也在微妙转变。记者在采访中了解到,部分科技企业对价格昂贵的国外模型设置了调用上限,而国内模型则相对宽松。有程序员表示,Token调用量过高如今被视为“太烧钱没干正事”,因为这部分支出要计入部门成本,超额部分需额外申请。
“当前,企业成本管控已进入价值验证阶段。”中国信息通信研究院人工智能研究所高级工程师秦思思告诉《中国报道》记者,AI的行业应用正从早期的创新试点向场景深耕演进。从前企业通过宽松的Token额度推动AI与业务创新融合,而2026年以来,企业更关注真实应用价值。
秦思思表示,一个显著的变化是,应用方开始建立起清晰的“任务—模型”匹配意识:简单的文本处理使用极低成本的开源模型或本地小模型,只有高难度的逻辑推理才调用昂贵的前沿模型。这种分级路由策略显著优化了Token支出结构,但并未降低实际业务价值。
美国公司Telnyx是一个典型例子。该公司1400个智能体使用中国智谱AI管理,Anthropic最强大的模型Fable充当指挥者的角色,负责规划工作,OpenAI的Sol负责审查开源模型的执行结果。
“这种向低客单价、高性价比模型的结构性迁移,直接拉低了整体支出指数,体现了买方市场的精细化运营,是技术周期内极为健康的理性校准。”欧阳日辉告诉《中国报道》记者。
中国大模型成为“性价比优选”

Artificial Analysis 制作的 AI 模型“斩杀线”,DeepSeek-V4-Flash 站在最优位置,所有落在它右下方的模型(性能不如它、价格还比它贵)都进入了所谓的“斩杀区”。
在这场结构性迁移中,中国大模型成为受益者。外媒报道,越来越多的印度科技初创企业悄然转向使用中国的开源大语言模型,因为使用中国大模型使得其成本直接降低了一个数量级。
《财富》报道,购买约75万字的AI输出,Anthropic的Claude Fable模型需要花费50美元,而DeepSeek的V4-Pro只需约87美分,智谱AI的GLM-5.2需4.40美元,月之暗面的Kimi K3需要15美元。
国内开发者的选择同样印证了这一趋势。多位受访程序员表示,目前正搭配使用中外模型,且国产模型使用频率更高。尽管Anthropic等公司的模型性能仍具优势,但巨大的价格差使性价比成为首要考量,而国产模型的日常性能也在迅速提升。
国产模型与硅谷领先模型的差距正在迅速缩小。智谱AI的GLM 5.2在一项智能体基准测试中,与Anthropic的Opus 4.8模型差距仅为一个百分点,成本却仅为后者的五分之一左右。中国信息通信研究院最新数据显示,国内公有云Token服务可用性(调用成功率)持续维持在99%以上。
国产大模型的崛起也在倒逼全球AI市场调整定价机制。7月31日,DeepSeek-V4-Flash正式版API上线公测后,外媒称“DeepSeek斩杀线”正在形成,因为完成一项复杂现实任务时,使用DeepSeek-V4-Flash的成本以美分计,而使用Claude Fable 5和GPT-5.6 Sol等模型的成本则是以美元计。
巧合的是,同一天,OpenAI宣布其发布仅三周的中端模型GPT-5.6 Terra降价20%,另一款模型GPT-5.6 Luna降价80%,以迎合价格敏感用户。
虽然DeepSeek于8月6日发布公告称,计划近期整体上调DeepSeek API服务定价,“预计涨幅较大”,但从当前价格和用户反馈来看,即使价格有较大涨幅,其产品仍有竞争力。多模型聚合平台OpenRouter发布的全球AI大模型调用量周榜单(7月27日至8月2日)显示,DeepSeek V4 Flash以7.22万亿Token的调用量位居第一。
“这一轮模型闪电战中,供给端的技术红利充分释放。”欧阳日辉指出,大模型推理的技术栈,如算子优化、模型量化、投机采样等,在过去半年取得了突破,加之云厂商和模型提供商之间的价格战,这些因素也使得单Token的生产和供给成本大幅下降。
价格已变得越来越不可忽视,OpenAI首席执行官萨姆·奥特曼预见到了这种情绪转变,他在接受CNBC采访时指出,“今年是人工智能支出首次成为一个热门话题,而且突然之间,它就成了一个非常重要的话题。”
《华尔街日报》将这一新趋势命名为“节俭最大化”(thrift-maxxing),取代已成为过去式的“Token最大化”(token-maxxing)。
“Token性价比将成为绝对的关注焦点。”秦思思展望,未来用户会根据场景和价值的不同去路由不同的Token服务,就像企业用车不再为了面子全部配备百万豪车,而是根据接待规格和日常通勤需求精准匹配车型。
临界点未至:AI经济的“规模不经济”困境
与Token价格一同回落的,还有人们对AI经济的狂热想象。市场开始反思:为何AI投入规模的扩大,并未带来预期中的成本降低和利润增长,甚至出现了“规模不经济”的现象?
欧阳日辉分析,当前的AI发展在算力基础设施层(如数据中心、芯片制造)具备极强的规模经济属性,但在应用和交付层的成本并没有想象中那么低。包括Meta在内的科技巨头调整投入节奏,以及“裁员潮回撤”等科技行业劳动力结构优化现象,都深刻反映出AI在应用层尚未形成预期的强规模效应,临界点尚未到来。
多重因素堵塞了规模效应的释放通道。欧阳日辉表示,其一,公开高质量数据正趋耗尽,后续模型能力提升必须依赖壁垒极高的私有数据、高成本的人类反馈或合成数据,边际获取成本陡峭上升。其二,互联网时代的规模经济在于“一份代码,无限复制”,而AI落地制造、金融、医疗等场景时,面临极度的碎片化和个性化,更像是一种高级的专家服务。其三,算力与电力构成了物理意义上的天花板,AI的规模效应被牢牢锁死在GPU供应、电网负载、散热极限等基础设施上,边际扩张面临着能源价格上涨、数据中心建设周期长等非线性成本的制约。
这或许也解释了为何马斯克等企业家正重金押注芯片、数据中心等AI硬件基础设施。在“AI一天,人间一年”的超速迭代中,巨头们不得不将目光投向进化相对缓慢的物理世界,在那里寻找打破规模效应瓶颈的钥匙。
撰文:《中国报道》记者 李士萌
责任编辑:柴晶晶
版权所有 中国外文局亚太传播中心(人民中国杂志社、中国报道杂志社) 举报电话: 010-68995855 举报邮件: chinareport@foxmail.com 法律顾问:北京岳成律师事务所
广播电视节目制作经营许可证:(京)字第07311号 互联网出版许可证:新出网证(京)字 189号 京ICP备14043293号-10 京公网安备:110102000508