模型压缩通常分两步:先删除层、注意力头或神经元以减少参数,再把剩余权重从 BF16 降到 4-bit。前者损失结构容量,后者引入数值误差,推理、数学和代码能力往往一起下降。因此,真正要部署的压缩模型通常还需要一轮“修复”。
Multiverse Computing 提出的 Quantization-Aware Healing(QAH,量化感知修复)把这轮修复重新设计成蒸馏:不是让量化学生模仿已经压缩过的 BF16 检查点,而是直接模仿压缩前的原始大模型。实验中,一个从 GPT-OSS 120B 压缩到 60B、再量化为 MXFP4 的模型,在 9 项基准中的 7 项超过自己的 60B BF16 检查点。
结果很吸引人,但要读准:它证明了这条实际训练管线能够产出“比量化前检查点更好”的 4-bit 模型,并没有独立证明提升来自量化本身 。
#为什么常规修复方法不够理想
量化感知训练(QAT)在前向传播中模拟低精度计算,再用任务损失继续训练。它让参数适应量化误差,却可能要求重新经历监督微调、偏好对齐和 Agentic Training 的昂贵过程;任务损失还会持续推动模型,即使越过最佳点也不会自然停止。
量化感知蒸馏(QAD)用冻结教师的输出分布指导量化学生,KL 散度通常更稳定。但如果模型已经做过结构压缩,就不存在一个独立训练、架构完全相同的“全精度原版”。让学生模仿压缩后的 BF16 检查点,只能继承后者在结构压缩中已经丢失的能力。
QAH 的改变是跨架构蒸馏:教师使用压缩前 120B 模型,学生是 60B MXFP4。输出概率分布与具体网络形状无关,因此教师与学生不需要同构。学生在量化状态下直接学习原始模型的 Logits,量化阶段也就变成了第二轮能力转移。
为支持最长 32K Tokens 的修复语料,方法采用分块 KL 损失,逐段计算序列而不在显存中同时展开完整“序列长度 × 词表”矩阵。
#7 比 2 的结果意味着什么
与 60B BF16 检查点相比,QAH 的 60B MXFP4 在长上下文 AA-LCR 上提高 7.4 分,在 AIME 2025 提高 5.6 分,在 Agentic Coding、工具使用、科学问答、指令遵循和 LiveCodeBench 上也有不同幅度提升。MMLU-Pro 下降 0.2,SciCode 下降 1.4。
与 120B 教师相比,60B 量化学生在 LiveCodeBench 略高,在 GPQA Diamond 只差 1.6 分;长上下文仍有明显差距,说明结构压缩丢失的容量并不能完全靠蒸馏恢复。
资源侧的价值很明确:与 60B BF16 相比,4-bit 权重内存约减少四倍;与 120B 教师相比,参数量减半,单 Token 计算量也大致降低。对必须在较小硬件上部署的团队,这是一条可操作的质量恢复方案。
#QAH 与 QAT 的稳定性比较
另一组 GPT-OSS 9B 到 MXFP4 的匹配实验比较了两种损失。QAH 约 100 步达到 54.9 的平均峰值,之后基本稳定;QAT 约 700 步才达到接近的 54.6,却在 1200 步时下降近 19 分。
这符合两类目标函数的差异。KL 蒸馏在学生接近固定教师后缺少继续漂移的动力;硬标签交叉熵则会不断推动优化,若没有可靠验证集和早停,容易越过最佳点。工程上,QAH 降低了选择检查点的敏感性,但并不取消对独立评估的需求。
#最关键的限制:比较组接受了不同训练量
原文页面后续讨论确认,头条表格里的 60B BF16 与 60B MXFP4 并非完全等量训练。BF16 检查点接受了第一轮恢复,MXFP4 检查点又额外接受了第二轮、来自 120B 教师的蒸馏。因此表格无法区分两种解释:
- 在量化状态下蒸馏本身更有效;
- 量化模型只是比 BF16 对照多接受了一轮更强教师训练。
严格控制应至少增加两组:让 60B BF16 使用相同数据、步数和教师继续训练;再将这个继续训练后的 BF16 检查点直接做 MXFP4 后训练量化。只有比较这些等量路径,才能判断“量化中修复”相对于“先继续训练、再量化”到底贡献多少。
教师本身也需要准确描述。GPT-OSS 120B 发布权重原生就是 MXFP4 MoE,把它称为“全精度原模型”会产生误导。更稳妥的结论是:压缩到 60B 的 MXFP4 部署检查点,经过 QAH 后超过了它量化前的 60B BF16 起点,而不是“4-bit 天然胜过全精度 120B”。
#工程可用,因果结论仍待补齐
QAH 展示了一个有价值的实践方向:结构压缩后,不必把已经受损的学生当成唯一教师;可以回到原始大模型,用固定分布在量化状态下再次转移能力。它在速度、稳定性和最终质量上都给出了积极证据。
同时,这也是阅读模型效率论文的典型案例。部署结果是否更好,与某个技术因素是否造成提升,是两种不同命题。前者已经有可复现实验支持,后者还需要等量训练控制组。把两者分开,才能既不忽略方法的工程价值,也不把漂亮结果外推成尚未证明的规律。