Hugging Face Blog·· 2026-07-08精选AI 评分72
vLLM 升级 transformers 建模后端,实现 native 级推理速度
Native-speed vLLM transformers modeling backend
AI 导读
vLLM 通过 torch.fx 静态分析和 AST 重写,对 transformers 模型动态应用推理专用层融合,使 Qwen3-4B/32B/235B MoE 等架构在 transformers 后端达到或超越手写 native 实现的吞吐量。用户只需添加 --model-impl transformers 参数即可使用,并行策略和编译能力保持不变。
推荐理由
vLLM 升级 transformers 后端实现 native 级推理速度,模型作者无需重写代码即可获得高性能部署。
来源:Hugging Face Blog · huggingface.co