BOSS Zhipin lanza un modelo de agente 3B con una pila de transformadores reutilizada
El modelo Apache-2.0 utiliza un Looped Transformer de dos pasadas y fue entrenado con 28 billones de tokens para flujos de trabajo de codificación, ofimática y herramientas.
By Ryan Merket · Published
Primary source: X
Why it matters
BOSS Zhipin is using recruiting revenue and internal workflow experience to compete in general agent models. If Nanbeige's results hold outside its own tests, startups could run useful coding and office agents with a far smaller memory footprint.

Nanbeige LLM Lab, el grupo de investigación en IA dentro de la plataforma china de reclutamiento BOSS Zhipin, lanzó un modelo de agente compacto el 24 de julio que utiliza las mismas capas de transformer dos veces para aumentar su profundidad efectiva sin añadir parámetros.
El lanzamiento coloca a BOSS Zhipin, fundada por Peng Zhao, en una posición inusual entre las plataformas de internet aplicadas. BOSS Zhipin construyó Nanbeige para flujos de trabajo de contratación y luego amplió el programa de investigación hacia modelos generales destinados a ejecutar agentes de codificación, herramientas de oficina y asistentes personales. Zhao dirigió anteriormente la plataforma rival de reclutamiento Zhaopin y tiene un título en Derecho por Peking University.
El equipo de investigación de 24 autores, encabezado en el artículo por Chen Yang, publicó el informe técnico Nanbeige4.2-3B junto con pesos del modelo Apache-2.0. Nanbeige4.2-3B tiene 4 mil millones de parámetros en total, incluidos 3 mil millones fuera de sus capas de embedding, y soporta inglés y chino con una ventana de contexto de hasta 262,144 tokens.
El lanzamiento se difundió más allá de los canales propios de Nanbeige el 27 de julio cuando Tanishq Mathew Abraham, Ph.D. (@iScienceLuvr) publicó el modelo y el artículo en X. Abraham no está afiliado a Nanbeige.
Pesos más pequeños, cómputo repetido
Nanbeige entrenó el modelo base desde cero con 28 billones de tokens, aumentando la proporción de matemáticas, código y datos sintéticos de pregunta-respuesta en la mezcla. El corpus también incluyó una cantidad menor de datos de trayectoria de agentes, según el artículo.
Su principal apuesta arquitectónica es el Looped Transformer. Los estados ocultos recorren la pila de capas del modelo y luego pasan por esas mismas capas una segunda vez. Eso le da al modelo una mayor profundidad computacional efectiva mientras mantiene fija la cantidad de parámetros.
El ahorro de parámetros aún implica un costo computacional. Nanbeige encontró que la configuración de dos pasadas conservó alrededor del 75% de la eficiencia por token de un transformer estándar. Pasadas adicionales produjeron ganancias menores, entrenamiento más lento y una optimización menos estable. El laboratorio también probó compartir la caché clave-valor entre las pasadas, lo que redujo los requisitos de caché a la mitad pero disminuyó el rendimiento, y eligió la configuración completa sin compartición para el modelo publicado.
Después del entrenamiento combinaron ajuste fino supervisado con varias etapas de aprendizaje por refuerzo. Nanbeige ensambló trayectorias de ingeniería de software, uso de herramientas y tareas de oficina a partir de entornos reales y sintéticos, y luego las filtró usando resultados de ejecución y evaluaciones basadas en rúbricas. Su proceso de aprendizaje por refuerzo apuntó a alucinaciones, salida repetitiva, errores de instrucción, longitud del razonamiento y fallos durante el uso de herramientas en múltiples pasos.
La ficha del modelo proporciona instrucciones para ejecutar Nanbeige4.2-3B mediante Transformers, vLLM y SGLang. Nanbeige también publicó rutas para GGUF y cuantización int4, además de ramas modificadas de llama.cpp y Ollama para inferencia local. Ese empaquetado es importante para los desarrolladores que evalúan modelos pequeños porque el conteo nominal de parámetros por sí solo no hace que un modelo sea fácil de desplegar.
Indicadores sólidos del proveedor, con salvedades
Nanbeige reporta que el modelo obtuvo 63.6 en SWE-bench Verified, 46.9 en SWE-bench Pro y 44.1 en Terminal-Bench 2.0. También reportó 87.4 en GPQA-Diamond y 52.2 en Claw-Eval.
En las comparaciones del laboratorio, Nanbeige4.2-3B superó a modelos más grandes como Qwen3.5-9B y Gemma4-12B en todas las evaluaciones listadas de agente general y agente de código. También lideró cinco de seis pruebas de razonamiento en la tabla comparativa. Gemma4-12B se mantuvo por delante en dos evaluaciones de alineamiento, incluida Recruit-Bench interna de BOSS Zhipin.
Esas cifras son evaluaciones propias de Nanbeige. Algunas pruebas de oficina y coworking usaron un andamiaje interno, mientras que Recruit-Bench fue diseñada internamente alrededor de tareas de empleadores y buscadores de empleo. Nanbeige dice que usó marcos de agentes establecidos para los principales benchmarks de codificación, incluyendo OpenHands para SWE-bench Verified y SWE-agent para SWE-bench Pro.
El diseño del entrenamiento también expone dónde el modelo compacto sigue estando limitado. Durante el aprendizaje por refuerzo orientado a agentes, Nanbeige favoreció tareas relativamente fáciles con trayectorias más cortas y tasas de aprobación más altas porque esos ejemplos produjeron un entrenamiento más estable y mayores ganancias que las tareas difíciles y de largo horizonte. La ficha del modelo advierte por separado que las salidas pueden contener material inexacto, sesgado o dañino.
BOSS Zhipin convierte un modelo interno en una apuesta de plataforma más amplia
BOSS Zhipin comenzó a desplegar Nanbeige en 2024 para búsquedas, recomendaciones, comunicación asistida por IA y entrevistas. La plataforma de reclutamiento combina el modelo propietario con modelos fundacionales de terceros, según la presentación anual 2025 de Kanzhun.
El programa de modelos está bajo una organización técnica supervisada por Tao Zhang, el director de tecnología de BOSS Zhipin desde su creación. Zhang trabajó previamente en empresas del grupo IBM, Renren y Baidu y es responsable de investigación, desarrollo e infraestructura de TI.
BOSS Zhipin tiene la escala para financiar el trabajo internamente. Kanzhun reportó 60.9 millones de usuarios activos mensuales promedio en el primer trimestre de 2026 y 7.1 millones de clientes empresariales de pago durante los 12 meses terminados el 31 de marzo. Los ingresos del primer trimestre alcanzaron RMB2.07 mil millones, o $299.9 millones, mientras que los gastos en investigación y desarrollo fueron RMB423.8 millones, según sus resultados del 20 de mayo.
Kanzhun también ha dicho a los inversionistas que Nanbeige requiere gasto continuo de capital y personal y que puede que nunca genere suficientes ingresos directos para cubrir esos costos. Abrir el código de Nanbeige4.2-3B le da a BOSS Zhipin otro retorno sobre esa inversión: adopción externa, retroalimentación y credibilidad técnica para un programa de modelos que comenzó dentro de una app de reclutamiento.
Para los desarrolladores de agentes, la prueba práctica es si el rendimiento reportado sobrevive fuera del entorno de evaluación de Nanbeige. Un modelo capaz de 3 mil millones de parámetros puede reducir los requisitos de memoria y hacer que los despliegues privados y de baja latencia sean más accesibles, incluso cuando su arquitectura en bucle exige cómputo adicional por token.