Bartowski 发布了用于模型量化棘手问题的 imatrix 数据集

公共语料库以聊天模板和工具使用为目标;在没有 imatrix 的情况下,Qwen3.6-35B-A3B 在 Q2_K 上下降了约 28 个 BFCL 点。

By · Published

Primary source: Hugging Face Newsroom

Why it matters

Open models reach local hardware through quantization. Kealty's public recipe shows calibration can preserve tool use at very low precision, where the wrong corpus carries a measurable cost.

An embroidered textile patch of Bartowski's imatrix dataset, showing fragmented data and binary digits reflected in a screen.

Colin Kealty (@bartowski1182), 在线上以 Bartowski 为人所知的模型量化工程师,于 8 月 17 日 发布了一个新的校准语料库,供那些将开源权重语言模型压缩为更小 GGUF 文件的人使用。他的 Hugging Face 社区文章 做出了谨慎的断言:在激进压缩水平下,新资料可以提供帮助,同时 Kealty 表示 V5 数据集已经相当具有竞争力。

这种克制反映了 Kealty 在将大型检查点转换为用户可在本地运行的文件方面的经验。根据他公开帖子的 归档,Kealty 曾在 Arcee AI 任研究工程师,之后在一月份表示他将加入 Red Hat 为 llama.cpp 做贡献。他的 Hugging Face 账户已成为开源模型 GGUF 转换的分发点,包含促使用户注意到新校准配方的 Qwen3.8-27B 包

RuntimeWire 在 8 月 12 日 报道 最大的 Qwen3.8 检查点包含 2.4 万亿个参数。Kealty 的工作处理的是该发布周期的另一端:当操作人员试图把有能力的模型塞进工作站、笔记本和家庭服务器的内存预算时,会发生什么。

校准数据决定哪些误差得以保留

重要性矩阵,通常简称为 imatrix,是 llama.cpp 使用的量化过程的输入。量化降低了用于存储模型权重的精度,从而减少内存需求,并且常常使本地推理变得可行。该过程也会引入误差。

llama.cpp 的 imatrix 工具 将校准文本输入模型并记录激活统计数据。这些测量为量化器提供了关于哪些输入通道最重要的证据,因此它可以对误差加以差别对待,而不是将每个压缩值都视为同等重要。

Kealty 之前的 V5 语料库主要由纯文本组成。它包含多种语言,但并未代表指令微调模型在聊天和工具使用中遇到的结构化标记和格式。V6 实验探问校准流是否应当类似于模型实际接收提示的方式。

Kealty 与 Fable 合作,并使用 LTT Labs 提供的 GPU 容量来比较纯文本、格式化对话和工具使用示例。Ed Addario 的校准集合 提供了若干竞争数据集的材料。Kealty 还对 Kalomaze 和 Dampf 在早期语料中所贡献的内容表示致谢。

公开发布将散文和对话数据分开,并包括一个用于将对话通过各模型聊天模板呈现的脚本。这一区分很重要,因为聊天模板会添加控制标记、角色标识和工具定义,而纯散文从不激活这些内容。

Kealty 还在量化模型旁边发布了生成的文本。例如,Qwen3.8-27B 的校准文件 让其他量化者能够检查渲染后的输入,而不是将校准视为上传背后的隐藏步骤。

在比特预算变得紧张时收益才会显现

Kealty 在七个模型上评估了校准选择,包括来自 Gemma、Qwen 和 Mistral 系列的稠密和专家混合(mixture-of-experts)检查点。测试涵盖了与 BF16 输出的偏差、函数调用、短提示失败、专家覆盖、MMLU-Pro 和 GSM8K 子集等。

Hugging Face 文章报道称,在完全没有 imatrix 的情况下,Qwen3.6-35B-A3B 在 Q2_K 的 BFCL 性能上下降了 28 个点,从大约 82% 降至 54%。这一结果说明了当量化器几乎没有精度可分配时,校准为何至关重要。

数据集选择仍有局限。Kealty 报道 在该 Q2_K 测试中,最佳与最差校准语料库之间大约存在 10 个点的差距。在每个权重大约四比特以上时,差异更小且不那么一致。V5 在实验的大部分中仍具有竞争力,而 V6 带来了增益与损失的混合,而非彻底的全面胜出。

这一结果缩小了对专门校准的实际需求场景。构建极小 GGUF 文件的人获益最多。使用常见的四比特及以上变体的操作人员应当预计到适度且依赖于具体模型的差异,并仍需进行任务特定的评估。

该发布还将 Kealty 的量化工作流转变为可重用的基础设施。每个新的模型系列可能带来不同的聊天模板、分词器或工具格式。将规范对话与模型特定的渲染分离,使得语料库可以跟随这些变化,而无需为每个检查点手动维护不同的源数据集。

Kealty 将 V6 描述为一次迭代和学习练习。其有用的贡献是从源对话到校准过程中处理的渲染材料的可复现路径,以及展示额外工作何时值得投入的证据。在本地 AI 场景中,节省的少量比特就可能决定模型能否在某人已拥有的硬件上运行。V6 为量化者提供了更好的方式来决定哪些比特是他们可以承担丢失的。

Reader comments

Conversation for this story loads after sign-in.