Thinking Machines Lab lanza Inkling-Small con pesos abiertos y menores costos de cómputo

El modelo multimodal de 276 mil millones de parámetros le proporciona a la plataforma Tinker de Murati una base más económica para el ajuste fino de agentes de codificación y aplicaciones de IA personalizadas.

By · Published

Primary source: X

Why it matters

Inkling-Small gives startups a lower-cost multimodal base they can inspect, host and fine-tune, while turning Tinker into the paid distribution layer for Murati's model family.

Thinking Machines Lab ships Inkling-Small with open weights and lower compute costs

Thinking Machines Lab de Mira Murati (@miramurati) lanzó Inkling-Small el 30 de julio, un modelo multimodal de pesos abiertos diseñado para ofrecer gran parte del razonamiento y el rendimiento agente de su hermano mayor con menores costos de cómputo e inferencia.

En un hilo de seis publicaciones en X y en un anuncio técnico detallado, Thinking Machines Lab informó que Inkling-Small tiene 276 mil millones de parámetros en total y activa 12 mil millones por token. El modelo disperso de Mixture-of-Experts acepta texto, imágenes y audio, soporta una ventana de contexto de hasta 1 millón de tokens y permite a los desarrolladores variar su esfuerzo de razonamiento para intercambiar rendimiento por costo.

Murati, ex directora de tecnología de OpenAI y breve directora ejecutiva interina, lanzó públicamente Thinking Machines Lab en febrero de 2025 después de dejar OpenAI para crear lo que describió como "tiempo y espacio" para su propia exploración. Thinking Machines Lab posteriormente recaudó alrededor de $2 mil millones en una ronda semilla valuada en $12 mil millones liderada por Andreessen Horowitz, con Nvidia, Accel, Cisco y AMD entre los inversores participantes, informó WIRED.

Inkling-Small pone un modelo más desplegable detrás del argumento original de Murati: sistemas de IA que los desarrolladores puedan entender y adaptar en lugar de acceder únicamente a través de la interfaz de un proveedor cerrado. Los pesos completos del modelo están disponibles bajo la licencia Apache 2.0, lo que permite uso comercial, modificación y despliegue local sujeto a los términos de la licencia.

Más pequeño por diseño

Inkling-Small tiene aproximadamente una cuarta parte del tamaño de Inkling, que Thinking Machines Lab lanzó el 15 de julio con 975 mil millones de parámetros totales y 41 mil millones activos. Ambos modelos usan una arquitectura dispersa que enruta cada token a través de un subconjunto de los expertos del modelo en lugar de activar todos los parámetros.

Thinking Machines Lab dice que el modelo más pequeño se benefició de lecciones aprendidas durante el entrenamiento de Inkling. Esos cambios incluyeron una mezcla de datos de preentrenamiento revisada, una receta de machine learning refinada, destilación on-policy usando a Inkling como modelo maestro y otras dos semanas adicionales de aprendizaje por refuerzo centrado en la codificación orientada a agentes.

Las afirmaciones resultantes en benchmarks son más fuertes en programación y razonamiento general. Thinking Machines Lab reporta que Inkling-Small obtuvo 80.2% en SWE-Bench Verified, 64.7% en Terminal-Bench 2.1 y 31.6% en la versión solo de texto de Humanity's Last Exam. Inkling obtuvo 77.6%, 63.8% y 29.7%, respectivamente, en la misma tabla.

Esas cifras siguen siendo reportadas por el proveedor. Thinking Machines Lab usó un arnés solo en bash para sus resultados de SWE-Bench y un arnés interno de codificación para Terminal-Bench. El laboratorio dijo que asignó puntuaciones cero a un pequeño número de soluciones de Terminal-Bench contaminadas por búsquedas web. También reconoció que Inkling mantiene una ventaja en cobertura de conocimiento y factualidad. En SimpleQA Verified, Inkling-Small obtuvo 20.6%, frente al 43.9% de Inkling.

La brecha multimodal es más estrecha. Thinking Machines Lab reporta puntajes de 74% en MMMU Pro y 90.1% en VoiceBench para Inkling-Small, cercanos al 73.5% y 91.4% de Inkling. Las imágenes y el audio se procesan conjuntamente con el texto en lugar de pasar por un codificador separado, y el modelo puede invocar Python para recortar, ampliar e inspeccionar porciones de gráficos o documentos mientras razona.

Tinker se convierte en el canal de distribución

Thinking Machines Lab está lanzando Inkling-Small a través de la misma infraestructura que quiere que los desarrolladores usen para la personalización. Murati presentó Tinker en octubre de 2025 como un servicio administrado de ajuste fino que da a los usuarios control sobre los datos de entrenamiento y los algoritmos, mientras Thinking Machines Lab se encarga del cómputo distribuido, la programación y la recuperación ante fallos.

Inkling-Small está disponible para ajuste fino a través de Tinker y para conversaciones de texto, imagen y audio a través de Tinker Playground. El modelo también puede ejecutarse localmente mediante frameworks como Transformers, vLLM y SGLang, según su ficha del modelo.

La página de precios de Thinking Machines Lab lista un descuento del 50% por tiempo limitado para la configuración de ajuste fino de 64,000 tokens. Las tarifas son $0.58 por millón de tokens de prefill, $1.44 por millón de tokens muestreados y $1.73 por millón de tokens de entrenamiento. Una configuración de 256,000 tokens cuesta más, mientras que el modelo publicado admite contextos de hasta 1 millón de tokens.

Esa combinación convierte a Inkling-Small tanto en un lanzamiento de modelo como en un vehículo de adquisición de clientes para Tinker. Los desarrolladores pueden inspeccionar y alojar los pesos ellos mismos, y luego pagar a Thinking Machines Lab cuando necesiten ajuste fino administrado o inferencia alojada. El enfoque enfrenta a Thinking Machines Lab tanto con los editores de modelos abiertos como con los proveedores de personalización al mismo tiempo.

El lanzamiento también comienza a mostrar lo que compró la inusualmente grande ronda semilla de Murati. Thinking Machines Lab ha pasado de una tesis general sobre IA personalizable a una línea de productos conectada verticalmente: su propia familia de modelos, un servicio administrado posterior al entrenamiento y un playground que puede exponer puntos de control afinados directamente a los usuarios. Una asociación a escala de gigavatios con Nvidia anunciada en marzo le da a Thinking Machines Lab una ruta a largo plazo al cómputo necesario para seguir expandiendo esa pila.

Reader comments

Conversation for this story loads after sign-in.