跳到正文
原文
Hugging Face Blog·· 8 天前精选AI 评分72

Transformers 原生支持运行 GGUF 量化模型

Transformers now runs llama.cpp quants

AI 导读

Hugging Face 的 transformers 增加 GGUF 格式支持,通过 kernels 库复用 ggml 内核并在 generate 中减少同步开销,在 Apple Silicon 上以 Qwen3.5 为例实现接近 llama.cpp 的本地推理性能。

推荐理由

transformers 内置 GGUF 加载并复用 ggml Metal 内核,用户可用熟悉的 API 在 Mac 上直接跑量化模型,速度接近 llama.cpp。

来源:Hugging Face Blog · huggingface.co