Unsloth dice que los quants Dynamic 3.0 superan a sus rivales por un 10% a igual tamaño.

Los quants posteriores al entrenamiento de Daniel y Michael Han apuntan a usuarios locales de IA, con las ganancias principales medidas mediante las propias pruebas de Unsloth.

By · Published

Primary source: Unsloth

Why it matters

The Han brothers are turning quantization into a distribution business: every quality gain at a fixed file size expands the hardware that can run open models locally.

An illustrated extreme close-up of a machine's finely-calibrated dial showing a precision adjustment and an increased numerical reading for Unsloth Dynamic 3.0.

Daniel Han y Michael Han están publicando Unsloth Dynamic 3.0, una actualización del método de compresión de los hermanos para Qwen3.8-27B con archivos GGUF diseñados para conservar más del comportamiento original del modelo en tamaños adecuados para hardware local.

El lanzamiento extiende una apuesta técnica que los Han han perseguido desde que fundaron Unsloth en 2023: la optimización de modelos puede servir como una capa de distribución para la IA abierta. Cada reducción en los requisitos de memoria y almacenamiento pone un modelo al alcance de otro nivel de máquinas de consumo, dando a los desarrolladores una alternativa a pagar a un proveedor de inferencia cada vez que quieran ejecutarlo.

Daniel Han trabajó anteriormente en Nvidia y dice que hizo que el algoritmo t-SNE fuera 2,000 veces más rápido y corrigió más de 20 bugs en modelos abiertos incluyendo Llama, Gemma, Mistral y Phi. Michael Han se encarga de producto, diseño e ingeniería. Los hermanos llevaron a Unsloth por la cohorte Summer 2024 de Y Combinator, y YC actualmente lista la operación en San Francisco con ocho personas. Lightspeed identifica a Daniel como CEO y a Michael como cofundador.

Una afirmación más grande que un archivo más pequeño

Unsloth dice que los quants de Qwen3.8-27B de Dynamic 3.0 entregan más del 10% de mejor precisión top-1 al mismo tamaño en disco que los archivos competidores. Esa cifra proviene de los propios benchmarks de Unsloth y no ha sido reproducida de forma independiente.

El método subyacente es la cuantización posterior al entrenamiento. Unsloth dice que no reentrenó Qwen3.8 con sus datos de calibración ni usó entrenamiento con conciencia de cuantización o destilación con conciencia de cuantización. En su lugar, Dynamic 3.0 aplica una matriz de importancia de mayor calidad, una selección de capas revisada y técnicas de cuantización adicionales después de que el modelo base ya ha sido entrenado.

Unsloth armó el material de calibración alrededor de agentes de programación, chat y tareas multilingües. Esa elección importa porque los datos usados para decidir qué pesos requieren mayor precisión pueden moldear dónde un modelo comprimido se mantiene y dónde se deteriora. Una cuantización afinada alrededor de prompts de programación puede comportarse de manera diferente en otras cargas de trabajo, incluso cuando una cifra agregada de exactitud luce fuerte.

Unsloth también reconoce que su medición principal de top-1 tiene límites. Registra si un modelo cuantizado selecciona el mismo siguiente token de mayor probabilidad que la referencia BF16, dejando sin medir el resto de la trayectoria generada.

Por ello, Dynamic 3.0 añade una prueba diseñada por la compañía llamada Divergence-300 @32. Unsloth usó 300 prompts extraídos de Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26 y una colección de tareas en alfabetos no latinos y de documentos largos. Luego comparó 32 tokens de decodificación greedy de cada quant contra el modelo BF16. El lanzamiento también reporta la divergencia KL, que mide qué tan lejos se mueve la distribución de salida del modelo cuantizado respecto a la referencia de mayor precisión.

Esas adiciones hacen que la evaluación sea más útil que una única puntuación de siguiente token. La amplia afirmación de rendimiento aún descansa en prompts, elecciones de calibración y ajustes de comparación seleccionados por Unsloth. Los desarrolladores que decidan si reemplazar una cuantización existente necesitarán probar los archivos contra sus propias aplicaciones, especialmente fuera de programación, chat y los idiomas representados en el conjunto de calibración.

Unsloth ha publicado su matriz de importancia para pruebas comunitarias y variaciones. Eso le da a desarrolladores externos una vía para inspeccionar el método, crear afinamientos y ejecutar evaluaciones más allá del conjunto de benchmarks de Unsloth.

El intercambio por hardware

El archivo más agresivo es el quant de un bit UD-IQ1_S de 6.2GB. Unsloth dice que es 89% más pequeño que la referencia y retiene alrededor del 72% de precisión top-1. Esa reducción pone un modelo de 27 mil millones de parámetros dentro del rango de almacenamiento y memoria de máquinas que no podrían acercarse a la versión de precisión completa, con un compromiso sustancial de calidad adjunto.

El UD-Q2_K_XL de 9.83GB ofrece un compromiso menos severo. Unsloth reporta que vence a la siguiente mejor comparación por alrededor de un 8% en precisión top-1 y puede producir un programa HTML funcional, aunque con un bug de JavaScript en el ejemplo mostrado en la documentación.

Para las cuantizaciones por debajo de UD-Q2_K_XL, Unsloth removió el módulo de predicción multí-token del modelo para ahorrar alrededor de 500 MB. Los usuarios que quieran esa capacidad pueden cargar un módulo Q4_0 MTP separado. La decisión convierte el almacenamiento en una opción explícita en lugar de empaquetar el componente de decodificación especulativa en cada archivo más pequeño.

Los archivos GGUF de Qwen3.8-27B funcionan con motores incluyendo llama.cpp y Unsloth Desktop. Unsloth dice que los repositorios de Qwen3.8 registraron 5.1 millones de descargas en cinco días. Esa métrica representa solicitudes de archivos más que usuarios únicos: las reglas de conteo de Hugging Face cuentan solicitudes de archivos GGUF y pueden contabilizar múltiples archivos descargados durante un clone del repositorio.

La demanda todavía explica el momento. Los lanzamientos de modelos abiertos ahora producen una segunda carrera entre fabricantes de herramientas para empaquetar pesos para las máquinas que los desarrolladores ya poseen. Los Han están posicionando a Unsloth entre los labs de modelos y los runtimes locales, donde el formato de archivo, la calidad de la cuantización y la disponibilidad desde el día uno determinan qué pesos se prueban y adoptan.

RuntimeWire reportó en junio que Unsloth había aplicado la misma estrategia de distribución al GLM-5.2 de Z.ai, usando compresión GGUF y Unsloth Desktop para hacer un modelo abierto de frontera más accesible fuera de los centros de datos. Dynamic 3.0 convierte ese trabajo recurrente de lanzamientos en una metodología nombrada que Unsloth puede aplicar a través de familias de modelos.

Ese enfoque les da a los hermanos un lugar útil en la cadena de suministro de modelos abiertos. Los labs pueden publicar pesos cada vez más capaces, mientras que las limitaciones de hardware siguen decidiendo quién puede ejecutarlos. La credibilidad de Unsloth dependerá de qué tan bien se trasladen las ganancias de Dynamic 3.0 a través de modelos y cargas de trabajo una vez que los desarrolladores empiecen a medir los archivos fuera del conjunto de pruebas de Unsloth.

Reader comments

Conversation for this story loads after sign-in.