跳到正文
原文
Hugging Face Blog·· 2026-08-10AI 评分31

高效知识蒸馏:离线 Top-K Logits 与融合分块 KL 损失

Making Knowledge Distillation Cheap Enough to Run at Scale

AI 导读

Hugging Face 发布新论文提出两种系统优化,将大语言模型知识蒸馏的显存开销大幅降低。离线蒸馏仅缓存教师模型 top-100 logits,避免教师在训练期间常驻内存;融合分块 KL 损失按序列块处理,使显存峰值从约 250GB 降至约 128GB。该方法使单卡长上下文蒸馏训练成为可能,成本大幅降低。

来源:Hugging Face Blog · huggingface.co