IBM Granite 4.2开源三款推理模型:真实沙箱强化学习训练,30B达到SWE-Bench 57%

IBM于2026年8月25日发布Granite 4.2系列,含3B、8B、30B三款推理语言模型,Apache 2.0协议全权重开放。区别于业界普遍采用合成轨迹训练的做法,8B和30B模型在真实沙箱环境(代码仓库编辑、终端操控、网络搜索)中完成Agentic强化学习。30B模型在SWE-Bench Verified基准上达到57%,15万亿token预训练,上下文窗口扩展至512K。模型已同步上线

2026年8月25日,IBM发布Granite 4.2系列,共三款密集型解码器语言模型:3B、8B和30B参数规模,全部采用Apache 2.0协议开放权重,支持下载、微调和商业部署,无需授权谈判。这是IBM首次将"推理"能力作为Granite系列的核心设计目标——每款模型都原生支持思维链输出,并提供可切换的思考模式。

从原始训练规模看,三款模型均从零开始,在约15万亿token上完成预训练,采用五阶段渐进式训练策略将上下文窗口从标准128K扩展至512K token。监督微调阶段覆盖约720万条样本,包含思维链推理、指令遵循和Agentic轨迹数据,其中Agentic样本占比31.6%,非Agentic占68.4%。在Agentic样本中,软件工程任务进一步占据了69%的份额——这一数字直接说明了IBM的优先级排序。

训练机制的核心:真实环境,不是模拟

Granite 4.2最值得拆解的部分,是它的强化学习管线设计,尤其是8B和30B模型独有的Agentic RL阶段。

IBM采用了异步GRPO(组相对策略优化)算法,相比传统PPO去掉了独立的价值网络,简化了训练流程。整个RL过程分为多个独立阶段,每个阶段聚焦一项能力,并从上一阶段的检查点热启动。

关键差异在于训练环境的真实性。Agentic RL阶段包含三个场景:其一是软件工程——模型通过OpenHands工具链直接编辑真实代码仓库,奖励信号来自隐藏测试套件是否通过,没有模拟评分,只有代码跑不跑得通;其二是终端操控——模型在活跃的Linux Shell环境中执行任务,每次推理最多允许64轮环境交互;其三是网络搜索——模型通过实时搜索调用回答多跳问题,由另一个大模型担任裁判评分。

这一设计路径与当前业界主流做法存在明显分歧。据IBM官方博客介绍,很多开源Agentic模型的后训练依赖合成轨迹——即由其他模型生成的"假执行"数据。Granite 4.2的8B和30B选择了成本更高、工程难度更大的路径:直接在真实沙箱中让模型学习执行,奖励信号由任务结果而非模型判断决定。

训练基础设施方面,IBM在CoreWeave托管的NVIDIA GB200 NVL72集群上完成训练,单个NVLink域包含72块GPU,节点间通过400 Gb/s InfiniBand互联。

基准测试数字与实际含义

IBM公布了多个维度的基准成绩。在SWE-Bench Verified(衡量模型真实修复GitHub Issue能力的基准)上,30B模型达到57.00%,8B模型达到47.67%。在终端操作基准Terminal-Bench 2.1上,30B得分29.24%,8B为20.56%。数学推理方面,30B在AIME25上达到89.17%,8B为86.67%,3B也达到78.33%。科学推理GPQA方面,30B得分66.41%,8B为64.14%。长上下文基准RULER(128K)上,30B得分81.38%,8B为71.41%,3B为55.30%。

57%的SWE-Bench Verified分数需要放在正确坐标系下理解。这个数字的意义不在于与前沿闭源模型的横向竞争——目前顶级闭源模型在该基准上的成绩已显著更高——而在于它是以30B参数、Apache 2.0协议、可本地部署的形式实现的。对于需要完全掌控推理链路的企业而言,这个参数量和许可条件组合,在开源生态中此前并没有同类对手在Agentic任务上提供类似能力。

IBM同时发布了三种推理模式:默认的全思维链模式(在专用标签中输出完整推理过程)、直接回答的非思考模式、以及介于两者之间的低耗模式(在简单问题上消耗较短的推理预算)。多轮对话中,历史轮次的思考过程默认被裁剪以节省上下文。工具调用使用OpenAI函数调用格式,可直接接入使用vLLM或SGLang部署的Agentic框架,无需额外适配层。

对不同利益相关方意味着什么

对个人开发者和小团队来说,3B模型已有GGUF量化版本(最低至Q4_K_M),可在笔记本上通过Ollama或LM Studio运行,这降低了Agentic工具调用实验的硬件门槛。8B模型则适合单张现代GPU的中等规模团队。

对企业用户,特别是金融、医疗、政府等受监管行业而言,Apache 2.0加上可本地部署权重,提供了一条在不将数据发送至第三方API的前提下运行工具调用Agent的路径。这一组合在此前开源生态中缺乏高质量Agentic模型支撑,IBM的发布填补了这个空白。30B模型需要A100或H100级别GPU,或在vLLM上使用FP8/NVFP4量化部署。

对Agentic框架开发者,Granite 4.2的兼容性设计降低了接入成本:OpenAI格式的工具调用意味着已支持主流API格式的框架无需修改即可接入。这对LangChain、AutoGen、OpenHands等生态来说是直接利好。

对IBM竞争对手的直接压力则相对有限,但不可忽视。Granite 4.2不是要在单次问答质量上挑战GPT-5.5或Claude Opus 4.8,而是在"企业愿意本地部署的Agentic模型"这个细分赛道建立基准位置。这个赛道的竞争逻辑不同于通用能力排名:许可协议、部署成本、合规性往往比绝对基准分数更决定采购决策。

训练方式作为先例的意义

从更宏观的视角看,Granite 4.2的发布为开源Agentic训练树立了一个具体的技术参照点。过去一年,业界关于"模型是否真的能在真实环境中执行任务"的讨论大量停留在演示层面,而IBM提供的是一套可追溯的训练设计:使用OpenHands作为软件工程训练harness,模型通过隐藏测试套件判定成功;使用真实Shell给予64轮交互;使用真实网络搜索完成多跳推理。这些设计细节的公开,本身就为开源社区提供了可复现的路径参考。

此次随Granite 4.2同步发布的还有Granite Speech 5.0 Turbo CTC系列,两款470M参数的语音模型,其在单张H200 GPU上可在约1秒内完成3小时音频的转录,在Hugging Face Open ASR排行榜上声称速度约为此前领先者的两倍。