Token均价三个月腰斩至0.97美元,大模型的“聪明”正在贬值?

9月15日消息,据Silicon Data编制的LLM Token支出指数(衡量市场每百万大语言模型Token的平均支付价格),8月该指数单月暴跌29%,降至0.97美元/百万Token,首次跌破1美元心理关口。对比今年5月该指数尚在2美元以上,短短三个月便经历了一次“腰斩”。

价格下行由供需两端合力驱动。在需求端上,部分企业AI账单飙升后开始主动控制支出,微软已收紧内部Token使用管理并切换至更低成本模型。而在供给端上,国内开源模型密集降价直接拉低了市场均价。5月,DeepSeek宣布将V4 Pro价格永久下调75%,缓存命中输入价格低至0.025元/百万tokens;9月10日,DeepSeek进一步下调V4.1 Flash系列价格,缓存输入降幅达60%。摩根大通数据显示,OpenRouter平台8月Token使用量环比增长约47%,但美元支出仅增长约7%,呈现典型的“量升价跌”格局。

事实上,价格战的底气来自推理成本的系统性下降。中国厂商普遍采用混合专家架构与注意力机制优化,配合低精度训练和自研推理引擎,同等智能水平的推理成本被大幅压缩。无问芯穹CEO夏立雪透露,最近一年公司已实现推理成本下降90%,并判断未来仍可再下降90%。MiniMax披露,2026年2月其M2系列模型每百万词元推理算力成本较2025年12月下降超过50%。

据悉,价格压力迅速传导至海外厂商。 OpenAI于7月30日将GPT-5.6 Luna永久降价80%,不到一个月又将旗舰模型GPT-5.6 Sol输入降价20%、输出降价三分之一。谷歌Gemini 3.7 Flash在年底前以3.6 Flash一半的价格促销,每百万输入Token定价0.75美元。高盛One-Delta部门负责人Rich Privorotsky指出,AI大模型已来到下半场,竞争焦点正从“技术是否可行”转向“成本是否可承受”。

也需看到的是,价格通缩对不同类型企业的冲击并不均匀。基础大模型厂商盈利压力最为显著,单纯依靠售卖Token API的模式面临毛利率压缩;中端通用模型因易被开源替代,生存空间受到挤压;而具备多元价值的顶尖旗舰模型仍能保持一定溢价能力。应用层企业则明显受益——推理成本断崖式下降正在推动AI应用从概念验证走向商业化落地,办公、内容生产、行业垂类工具等场景的规模化部署节奏有望加快。

“AI模型能力在通胀,Token价格在通缩”,这一剪刀差正在重塑行业格局。对资本市场而言,模型层的价格竞争越激烈,应用层与基础设施层的受益越确定,云计算与算力服务的需求扩容逻辑进一步强化。但短期内,大量新增Token未能带来同比例的美元收入,如何将用户规模转化为可持续的盈利模型,仍是大模型厂商需要回答的核心命题。