跳到正文

#开源/仓库

今日 0 条
8月10日周一
  1. Hugging Face Blog31

    高效知识蒸馏:离线 Top-K Logits 与融合分块 KL 损失

    Hugging Face 发布新论文提出两种系统优化,将大语言模型知识蒸馏的显存开销大幅降低。离线蒸馏仅缓存教师模型 top-100 logits,避免教师在训练期间常驻内存;融合分块 KL 损失按序列块处理,使显存峰值从约 250GB 降至约 128GB。该方法使单卡长上下文蒸馏训练成为可能,成本大幅降低。