2026年8月28日,腾讯混元团队正式发布并开源新一代旗舰大语言模型Hy4 Preview。该模型采用MoE架构,总参数770亿(770B),每个token激活49B参数,上下文窗口突破100万token。在代码与软件工程方向,Hy4 Preview在Terminal Bench 2.1命令行编程基准中得分85.4,超越DeepSeek V4 Pro,与Claude Opus 5持平;在聚焦真实软件工程任务的DeepSWE基准中,分数从前代Hy3的28.0大幅跃升至64.3。这是腾讯混元自2026年2月重建基础设施以来,平均每两个月一次大版本迭代节奏中的第三个节点。
参数翻倍背后的架构取舍
770B的规模意味着从前代Hy3的295B实现了参数总量的2.6倍增长,激活参数也从28B翻至49B。但真正体现工程取舍的不是绝对规模,而是激活比例:770B总量中每次推理仅启用49B,激活率约6.4%,这是MoE稀疏激活的核心逻辑——用大量“休眠”专家换取合理的单次推理算力消耗。
模型本身也被用于优化腾讯自身的训练与推理系统。据腾讯官方披露,Hy4 Preview参与了训练方法、数据策略和评测框架的自动化优化,端到端推理吞吐量相比基线提升31.8%。这种“模型优化系统、系统训练模型”的闭环,是本次发布中技术含量最高的部分之一,但31.8%的数字来自腾讯内部测量,尚无第三方复现数据。
训练数据的构建策略由软件工程、游戏、金融、安全等领域的腾讯内部专家协同创建,并通过与WorkBuddy等产品的深度共设计来持续校准。这种“产品反哺模型”的策略,是腾讯拥有海量真实业务场景这一资产的变现方式。
十二项基准的全景分布
单看Terminal Bench 2.1的85.4和DeepSWE的64.3容易产生选择性乐观。把腾讯公布的12项基准放在一起观察,会发现一个更完整的图景。据explainx.ai整理,Hy4 Preview在SWE-Bench Pro上得分65.7,MCP-Atlas工具调用评测得分83.7,GPQA Diamond学术推理得分92.3,Toolathlon-Verified工具调用马拉松得分74.1(据腾讯科技报道,超越千问3.8 Max和GPT-5.6 Sol)。在测试智能体一次性成功率的APEX-Agents(pass@1)中,Hy4 Preview得分37.1,仅次于Kimi K3的37.2。
这份成绩单的亮点是“没有明显短板”——腾讯官方表示该模型在12项基准中无一垫底,即便其参数规模远低于部分一线竞品。但这种“均衡”特征本身也是一种信号:Hy4 Preview更接近“全能型实用选手”而非某一方向的极限突破者。
腾讯还进行了一次内部盲测:163名内部专家在203个WorkBuddy工程任务中对模型输出进行4分制评分。结果显示Hy4 Preview均分2.99,略高于Kimi K3的2.94和GLM-5.3的2.92。据explainx.ai的分析,0.05分的领先幅度在统计意义上接近噪声,三款模型在同类生产力任务上的表现差距已趋近于“可互换”级别。
已知短板:无视觉、慢交付
腾讯混元团队在发布时主动披露了两项已知缺陷。其一是Hy4 Preview目前不支持视觉输入,多模态能力缺失,需等待后续正式版补齐。其二更值得实际用户注意:模型在复杂任务中存在“过度自我验证倾向”——即任务执行过程中反复校验而非直接交付,导致整体响应时长明显偏长。据腾讯科技的实测描述,“眼看要出结果了,但模型会反复验证,给用户带来较长等待”。据explainx.ai对OpenRouter实测数据的记录,P50延迟下推理速度约为36 tokens/秒,耗时3.19秒才开始输出。
这两个问题的性质不同。视觉缺失是功能缺位,官方已明确会在正式版补全。但过度自验是推理行为问题,腾讯将其定性为“preview版本的已知问题”,归因于后训练阶段仍有提升空间。对于需要大量并发调用或对响应延迟敏感的企业场景,这是一个需要在实际压测中量化的风险点。
定价与开放策略的双重信号
Hy4 Preview的定价延续了混元的“普惠”路线。据腾讯混元团队公布的价格,API调用费用为输入6元/百万token,输出18元/百万token,缓存命中0.3元/百万token。折合美元,OpenRouter挂牌价为输入$0.834/百万token,输出$2.501/百万token。
开源范围覆盖HuggingFace、ModelScope和GitCode三个平台,权重完整公开。API接入渠道包括腾讯云TokenHub和OpenRouter,WorkBuddy与CodeBuddy提供两周免费试用期。与此同时,前代Hy3在上述平台的免费访问期延长至9月30日——这一安排为开发者提供了新旧版本并行测试的时间窗口,也可以理解为腾讯对Hy4 Preview“preview身份”的主动声明:当前版本并非最终形态,不必急于切换。
腾讯本季度研发支出同比增长35%至273亿元(约合41亿美元),资本支出同比增长176%至528亿元(约合79亿美元)。这两个数字来自finance.biggo.com引用的腾讯季报数据,为Hy4 Preview的算力投入提供了财务背景——尤其是资本支出近乎翻倍的涨幅,指向大规模GPU基础设施扩建。
竞争格局:三强并立的结构已初步成形
在代码与Agent能力维度,Hy4 Preview的登场让国产开源模型的竞争格局从“DeepSeek一家领跑”变成多方接近的阶段。Terminal Bench 2.1的85.4分与Claude Opus 5持平、超越DeepSeek V4 Pro,这个数字的意义不在于精确的排名,而在于它标志着国产模型首次在这一代码能力核心基准上进入国际第一梯队区间。
对于企业用户,当前格局提供的选择逻辑可以这样梳理:DeepSeek V4 Pro在推理速度和部分通用任务上仍有竞争力;Kimi K3在工具调用(Toolathlon)和Agent一次成功率上与Hy4 Preview差距极小;GLM-5.3在内部盲测中得分与Hy4 Preview仅相差0.07分。三款模型在纯文字生产力任务上已趋近“性能天花板”,差异正在向推理速度、部署成本、生态集成三个维度转移。
对于开发者的选型建议:如果当前项目依赖代码生成与命令行任务,Hy4 Preview的Terminal Bench和DeepSWE成绩值得重点测试,但必须在真实负载下评估其过度验证问题带来的延迟影响。如果项目涉及多模态输入,当前版本不可用,需等待正式版或选择其他选型。如果成本敏感,6元/百万输入token的价格在同等参数规模中具有竞争力,但需与实际完成任务所消耗的token量(受过度验证影响)一并计算真实成本。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接