Bartowski publica un conjunto de datos imatrix para el lado feo de la cuantización de modelos
El corpus público apunta a plantillas de chat y al uso de herramientas; sin imatrix, Qwen3.6-35B-A3B cayó aproximadamente 28 puntos BFCL en Q2_K.
By RuntimeWire Staff · Published
Primary source: Hugging Face Newsroom
Why it matters
Open models reach local hardware through quantization. Kealty's public recipe shows calibration can preserve tool use at very low precision, where the wrong corpus carries a measurable cost.

Colin Kealty (@bartowski1182), el cuantizador de modelos conocido en línea como Bartowski, publicó un nuevo corpus de calibración el 17 de agosto para personas que comprimen modelos de lenguaje con pesos abiertos en archivos GGUF más pequeños. Su Artículo de la comunidad de Hugging Face hace una afirmación comedida: el nuevo material puede ayudar en niveles de compresión agresivos, mientras Kealty dice que el conjunto de datos V5 ya era bastante competitivo.
Esa moderación refleja la experiencia de Kealty convirtiendo grandes checkpoints en archivos que la gente puede ejecutar localmente. Kealty trabajó como ingeniero de investigación en Arcee AI antes de decir en enero que se unía a Red Hat para contribuir a llama.cpp, según un archivo de sus publicaciones públicas. Su cuenta de Hugging Face se ha convertido en un punto de distribución para conversiones GGUF de modelos abiertos, incluyendo el paquete Qwen3.8-27B que llevó a los usuarios a notar una nueva receta de calibración.
RuntimeWire informó el 12 de agosto que el checkpoint más grande de Qwen3.8 tenía 2.4 billones de parámetros en total. El trabajo de Kealty aborda el otro extremo de ese ciclo de lanzamiento: qué ocurre cuando los operadores intentan ajustar modelos capaces al presupuesto de memoria de estaciones de trabajo, laptops y servidores domésticos.
Los datos de calibración deciden qué errores sobreviven
Una importance matrix, normalmente abreviada como imatrix, es una entrada para el proceso de cuantización usado por llama.cpp. La cuantización reduce la precisión usada para almacenar los pesos de un modelo, recortando los requisitos de memoria y a menudo haciendo práctica la inferencia local. El proceso también introduce error.
La herramienta imatrix de llama.cpp ejecuta texto de calibración a través de un modelo y registra estadísticas de activación. Esas mediciones dan al cuantizador evidencia sobre qué canales de entrada importan más, de modo que puede ponderar los errores de forma diferente en lugar de tratar cada valor comprimido como igualmente trascendental.
El corpus V5 anterior de Kealty consistía en gran medida de texto plano. Incluía múltiples idiomas, pero no representaba los tokens estructurados y el formato que los modelos ajustados por instrucción encuentran durante el chat y el uso de herramientas. El experimento V6 plantea la pregunta de si el flujo de calibración debería parecerse a la forma en que un modelo realmente recibirá las indicaciones.
Kealty trabajó con Fable y usó capacidad de GPU suministrada por LTT Labs para comparar texto plano, conversaciones formateadas y ejemplos de uso de herramientas. La colección de calibración de Ed Addario proporcionó varios de los conjuntos de datos competidores. Kealty también acreditó a Kalomaze y Dampf por material incorporado en el corpus anterior.
La versión pública separa datos de prosa y conversación e incluye un script para renderizar conversaciones mediante la plantilla de chat de cada modelo. Esa distinción importa porque las plantillas de chat añaden tokens de control, marcadores de rol y definiciones de herramientas que la prosa simple nunca activa.
Kealty también publica el texto generado junto al modelo cuantizado. El archivo de calibración Qwen3.8-27B, por ejemplo, permite que otros cuantizadores inspeccionen la entrada renderizada en lugar de tratar la calibración como un paso oculto detrás de la carga.
Las ganancias aparecen cuando el presupuesto de bits se vuelve ajustado
Kealty evaluó las opciones de calibración en siete modelos, incluyendo checkpoints densos y mixture-of-experts de las familias Gemma, Qwen y Mistral. Las pruebas cubrieron divergencia respecto a la salida BF16, llamadas a funciones, fallos con indicaciones cortas, cobertura de expertos, y subconjuntos de MMLU-Pro y GSM8K.
El artículo de Hugging Face informa que, sin imatrix en absoluto, Qwen3.6-35B-A3B experimentó una caída de 28 puntos en el rendimiento BFCL en Q2_K, de aproximadamente 82% a 54%. El resultado muestra por qué la calibración es determinante cuando un cuantizador tiene poca precisión para distribuir.
La selección del conjunto de datos aún tenía límites. Kealty reportó una diferencia de alrededor de 10 puntos entre los mejores y peores corpus de calibración en esa prueba Q2_K. Por encima de aproximadamente cuatro bits por peso, las diferencias fueron menores y menos consistentes. V5 siguió siendo competitivo en gran parte del experimento, y V6 produjo una mezcla de ganancias y pérdidas en lugar de una barrida limpia.
Ese resultado estrecha el caso práctico para la calibración especializada. Las personas que construyen archivos GGUF extremadamente pequeños son las que más pueden ganar. Los operadores que usan variantes comunes de cuatro bits o más deberían esperar diferencias modestas dependientes del modelo y aún necesitarán evaluación específica por tarea.
El lanzamiento también convierte el flujo de trabajo de cuantización de Kealty en infraestructura reutilizable. Cada nueva familia de modelos puede traer una plantilla de chat, un tokenizador o un formato de herramienta diferentes. Mantener las conversaciones canónicas separadas del renderizado específico del modelo permite que el corpus siga esos cambios sin mantener manualmente un conjunto de datos fuente distinto para cada checkpoint.
Kealty describe V6 como una iteración y un ejercicio de aprendizaje. La contribución útil es la ruta reproducible desde las conversaciones fuente hasta el material renderizado procesado durante la calibración, junto con evidencia que muestra dónde vale la pena el trabajo extra. En la IA local, unos cuantos bits ahorrados pueden decidir si un modelo se ejecuta en el hardware que alguien ya posee. V6 ofrece a los cuantizadores una mejor manera de decidir qué bits pueden permitirse perder.