Hugging Face Blog·· 8 天前精选AI 评分72
Transformers 原生支持运行 GGUF 量化模型
Transformers now runs llama.cpp quants
AI 导读
Hugging Face 的 transformers 增加 GGUF 格式支持,通过 kernels 库复用 ggml 内核并在 generate 中减少同步开销,在 Apple Silicon 上以 Qwen3.5 为例实现接近 llama.cpp 的本地推理性能。
推荐理由
transformers 内置 GGUF 加载并复用 ggml Metal 内核,用户可用熟悉的 API 在 Mac 上直接跑量化模型,速度接近 llama.cpp。
来源:Hugging Face Blog · huggingface.co