Hugging Face Blog·· 1 小时前精选AI 评分62
AllenAI 发布 Olmo-core 3 开源 MoE 训练基础设施
Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs
AI 导读
AllenAI 发布 Olmo-core 3,升级开源 Mixture-of-Experts 训练框架,支持扩展到万亿参数规模。在 eight NVIDIA B300 GPUs 上,47B 参数模型吞吐量达到每 GPU 每秒 52,000 tokens,相比此前实现提升约 2.7 倍;并展示了在 MXFP8 格式下吞吐量提升约 21%。
推荐理由
文章给出MoE训练栈的关键优化与在B300上的吞吐数据,可帮助读者评估开源基础设施的扩展能力。
来源:Hugging Face Blog · huggingface.co