Hugging Face Blog·· 2026-08-25精选AI 评分69
Quantization-Aware Healing:压缩 4-bit 模型超越原始全精度版本
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
AI 导读
Hugging Face 官方博客介绍了 Quantization-Aware Healing(QAH)方法,将 GPT-OSS 120B 压缩至 60B 参数并以 MXFP4 量化后,在 7 项基准中超过其 bfloat16 恢复版本,尤其在长上下文推理(+7.4)和数学(+5.6)上提升显著,且训练只需约 100 步并保持稳定,避免了传统 QAT 的剧烈漂移风险。
推荐理由
给出了在压缩后再量化的情况下如何恢复能力的具体方法,对降低大模型部署成本有直接参考价值。
来源:Hugging Face Blog · huggingface.co