SOTA Sync
全部文章
模型进展2026-08-31

Granite 4.2 是如何炼成的:从 15T Tokens 到 Agentic RL

IBM Granite 4.2 把预训练、两阶段 SFT、可验证奖励和真实沙盒中的 Agentic RL 串成一条分阶段能力课程。

IBM 的 Granite 4.2 是一组从零预训练的稠密 Decoder-only 模型,包含 3B、8B 和 30B 三个尺寸。三者共享架构和主训练流程:约 15 万亿 Tokens 的预训练、面向推理与工具使用的监督微调,以及多阶段强化学习。8B 与 30B 还会进入真实沙盒做 Agentic RL,学习写代码、运行终端和搜索网络。

这篇技术说明最值得读的不是又一张基准表,而是一条清晰的能力生产线:模型的推理、指令遵循与 Agent 行为没有被塞进一次统一后训练,而是被拆成多个有独立环境、奖励和检查点的课程。

#五阶段预训练:从广覆盖走向长上下文

Granite 4.2 约用 15T Tokens 从头训练。前两个阶段建立基础语言与知识能力,中间两个阶段逐步提高数据质量并调整混合比例,最后一个阶段引入长上下文训练,把窗口扩展到 512K Tokens。

这种分阶段策略避免在整个训练周期都支付最长上下文的成本,也让后期数据更贴近最终用途。模型尺寸虽然不同,但结构统一,便于比较缩放效果、复用推理栈和发布量化版本。

架构本身并没有追求复杂的新模块。Granite 4.2 采用稠密 Transformer,把创新重点放在数据、训练课程和运行形态上。每个模型都支持思考与非思考模式,还提供低强度思考:简单问题只消耗较短推理预算,复杂任务再使用完整思考。这是把“推理深度”变成运行时控制项,而不是让所有请求承担同一种延迟。

#SFT:先把轨迹变成干净、统一的数据

监督微调数据约 720 万条、100B Tokens,其中约 65B 可训练;Agentic 数据占 31.6%,非 Agentic 数据占 68.4%。样本覆盖指令遵循、推理、代码、工具调用和多轮轨迹。

团队先将不同来源统一为 OpenAI Chat 格式,使消息与工具交互结构一致,再通过格式、质量和长度过滤清除异常数据。去重不仅在单一数据源内进行,也对全局 toolsmessages 组合计算 SHA-256,避免同一轨迹以不同来源重复进入训练。

30B 模型额外接受第二阶段 SFT,重点提高 Agentic Coding、软件工程与代码数据的权重,同时保留约 16% 原始 SFT 数据做回放。这一步的目标不是重训一个纯编码模型,而是在强化编码轨迹时防止已有通用能力被覆盖。

#强化学习不是一轮,而是一条课程链

SFT 后的训练顺序大致是:可验证奖励强化学习、若干能力增强阶段、软件工程 Agent、终端 Agent、搜索 Agent,最后再用 RLHF 对齐。每一阶段都是独立的 GRPO 运行,并从上一个检查点热启动。

基础 RL 面向数学、代码、科学、指令遵循和结构化输出。不同任务使用自己的验证器,奖励尽量依赖可检查结果,而不是统一的主观评分模型。3B、8B 和 30B 都经过这部分,但规模与轮数不同。

8B 和 30B 随后进入 Agentic RL。这里不再只判断一段回答是否正确,而是让模型在真实 Harness 和环境中产生多轮轨迹:修改仓库、执行命令、观察输出、继续决策,或者调用搜索工具。奖励主要看任务最终是否解决。3B 跳过这一段,因此“支持工具调用”和“通过真实工具轨迹学会行动”被明确区分开。

#NeMo-RL 与 NeMo-Gym 怎样连接训练和环境

这类训练的难点在于同时管理参数更新和大量有状态环境。Granite 4.2 用 NeMo-RL 驱动 GRPO 循环,Megatron-Core 负责训练,vLLM 生成 Rollout,Megatron-Bridge 在训练格式和 Hugging Face 检查点之间转换权重。

另一侧的 NeMo-Gym 把验证器、工具、沙盒和奖励模型统一抽象成 Resources。对训练循环而言,数学答案验证器、软件仓库虚拟机、终端环境和 Web 搜索接口都通过同一种资源协议接入。这样每个阶段可以替换任务环境,同时复用训练控制面。

这揭示了 Agentic RL 的核心工程变化:训练集不再只是静态输入输出对,环境成为数据生成器的一部分。模型行为改变环境,环境返回新状态,完整轨迹再转化为奖励和梯度。

#发布形态同样服务于生产约束

Granite 4.2 原生支持函数调用,可通过兼容接口接入常见 Agent Harness。思考、非思考与低强度思考三种模式,让使用方按任务难度控制延迟和成本;多轮对话默认可剥离历史思考过程,以节省上下文。

IBM 还发布了 FP8、NVFP4、MXFP4 与 GGUF 版本。FP4 版本使用 SFT 数据抽取的 2000 个样本做 GPTQ 校准。全部模型以 Apache 2.0 许可证开放,这使训练方法、权重和部署路径能够被一起检验,而不是只提供一个远程 API。

#这条训练链真正说明了什么

Granite 4.2 并没有证明分阶段训练一定优于所有端到端方案,但它给出了可复用的工程范式:先用预训练构建广泛能力,用高质量 SFT 教会结构化轨迹,再把可验证任务和真实环境分开强化,最后统一做偏好对齐。

对 Agent 模型而言,最关键的不是在静态基准上多拿几分,而是训练时是否见过“行动—反馈—纠错”的闭环。真实沙盒让工具使用从格式模仿变成环境交互,这很可能是 Agentic 模型与普通聊天模型之间更实质的分界线。