跳到正文
原文
Hugging Face Blog·· 2026-07-08精选AI 评分72

vLLM 升级 transformers 建模后端,实现 native 级推理速度

Native-speed vLLM transformers modeling backend

AI 导读

vLLM 通过 torch.fx 静态分析和 AST 重写,对 transformers 模型动态应用推理专用层融合,使 Qwen3-4B/32B/235B MoE 等架构在 transformers 后端达到或超越手写 native 实现的吞吐量。用户只需添加 --model-impl transformers 参数即可使用,并行策略和编译能力保持不变。

推荐理由

vLLM 升级 transformers 后端实现 native 级推理速度,模型作者无需重写代码即可获得高性能部署。

来源:Hugging Face Blog · huggingface.co