腾讯混元127天“猛踩油门”:从重建地基到追平头部,AI竞速进入“实战时代”

7f8a283c-ab55-11f1-901a-867459904d8f_00000_large

8月28日,腾讯混元发布并开源新一代大语言模型Hy4 preview。从2026年2月重建预训练与强化学习基建算起,到Hy4 preview亮相,恰好127天。这127天里,腾讯混元将大版本迭代周期压缩至两个月左右,已接近Anthropic、OpenAI、智谱等头部模型厂商的更新频率。

据悉,Hy4 preview总参数达770B,是Hy3的2.6倍;激活参数从21B提升至49B,上下文从256K扩展至1M。更值得关注的是其在真实生产力任务上的表现:7月初,Hy3在软件工程实战基准DeepSWE上仅拿到28.0分,同期Claude Opus 4.8为58.0。不到两个月,Hy4 preview在同一测试中拿到64.3分,超过DeepSeek V4 Pro的62.7。同日公布的Terminal-Bench 2.1上,Hy4 preview以85.4分与Claude Opus 5持平。

混元整体仍在追赶阶段,但在长上下文任务、代码库重构、专业科学推理等更接近真实生产力的场景中,已实打实追了上来。

就在Hy4 preview发布当天,WorkBuddy和CodeBuddy同步开启两周免费体验。混元团队明确表示:“如同Hy3 preview,我们希望通过Hy4 preview的尽快发布获得广泛的真实反馈,从而显著提升Hy4正式版。”

事实上,这套流程已在Hy3身上得到验证。4月23日Hy3 preview开源上线,同步接入元宝、WorkBuddy、CodeBuddy、ima和QQ等多个业务。三个月后Hy3正式版发布,preview已在50多个业务中获得广泛反馈,正式版在此基础上进一步提升后训练数据质量与多样性,并扩大强化学习算力规模。对比preview版,Hy3正式版幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮对话问题率从17.4%降至7.9%。

腾讯内部将这种机制称为Co-Design,让产品反馈和专家判断共同参与模型训练。Hy3时期重点与CodeBuddy、WorkBuddy等产品深度协同;Hy4阶段则将各领域专家共建放到更靠前的位置。混元内部已建立50多套评测体系,用真实考题、人工评测和产品众测进行验收。

Hy3 preview上线两周,Token调用量较上代Hy2增长超10倍,代码与智能体场景增长尤为突出。Hy3正式版发布一周后,总调用量较Hy2增长超68倍。

组织层面,2026年3月腾讯撤销AI Lab,部分人员调整至大语言模型部加入混元团队。7月,混元合并大语言、多模态团队,成立基础模型部。首席AI科学家姚顺雨自年初加入后,已主导Hy3 preview、Hy3正式版、Hy4 preview连续三次发布。

尽管混元在技术指标上快速追赶,但与头部模型的全方位差距依然存在。更大的挑战在于商业化。Hy3 preview已在50多个业务中落地,但如何从内部赋能走向外部创收,仍是腾讯必须回答的命题。在C端,元宝App的市场份额与字节豆包仍有差距;在B端,混元API已上线腾讯云TokenHub及多个海外平台,但定价策略和生态建设仍在探索中。

从127天前的基建重建,到Hy4 preview跻身开源模型第一梯队,腾讯混元用一场“猛踩油门”的追赶,证明了自己在AI竞赛中并未掉队。但当技术差距逐步缩小,真正的考验才刚刚开始。