人工智能 来源:Hugging Face Blog 整理:feaOS 2026-09-22 21:56:55

Transformers 支持运行 llama.cpp 的 GGUF 模型

transformers 库现在支持高效运行 GGUF 格式的 AI 模型,用户可以通过熟悉的 transformers API 在笔记本电脑上使用这些模型。GGUF 格式由 llama.cpp 团队开发,支持多种量化级别,使得模型可以在不同硬件上运行。通过使用 llama.cpp 的底层 ggml 内核,transformers 能够提供接近原生性能的本地推理体验,特别是在 Apple Silicon 设备上。这使得在本地运行大型 AI 模型变得更加容易和实用。此外,GGUF 格式包含模型权重和元数据,包括分词器信息和可选的聊天模板,支持不同的量化级别,使得用户可以根据机器的性能选择合适的版本。例如,Unsloth 的 Qwen3.5-4B 模型在不同量化级别下的文件大小分别为:BF16 8.42GB,Q6_K 3.53GB,Q5_K_M 3.14GB,Q4_K_M 2.74GB。

ENTRY_ID: NEWS-17336 READ_MODE: SHORT_SIGNAL