webAI lanza los modelos TwiL para comprobar el razonamiento de la IA en hardware de consumo

webAI afirma que su modelo de 3B superó a gpt-oss-120b en cuatro de cinco pruebas internas, mientras que una compilación de 1.06 GB se ejecuta localmente en hardware de consumo.

By · Published

Primary source: PR Newswire

Why it matters

webAI is betting that narrow, local models can become a checking layer for enterprise AI. The results remain self-reported, but the 1.06 GB build makes that thesis testable on ordinary hardware.

Illustration of webAI's TwiL models depicted as a compact model architecture running on consumer hardware, highlighting the 3B model and the 1.06 GB local build.

webAI cofundador y director ejecutivo (CEO) David Stout (@Davidstout) publicó un par de modelos de lógica formal pequeños el 10 de agosto, extendiendo su apuesta de seis años de que la IA empresarial útil se ejecutará cerca de los datos privados en lugar de dentro de una nube remota.

El TwiL-LM release incluye variantes de 1.7 mil millones y 3 mil millones de parámetros diseñadas para traducir inglés simple a lógica formal, determinar si las conclusiones se derivan de las premisas y manejar deducción en varios pasos. webAI dice que ambos están disponibles a través de Hugging Face para Transformers y llama.cpp bajo la licencia de modelo no comercial de webAI.

Stout creció en un rancho de Michigan antes de mudarse a Austin, según un perfil de Austin Business Journal. Fundó webAI en 2019 con Ethan Baird, ahora chief research officer, y Tyler Mauer (@TylerMauer4), chief product officer de webAI. webAI describe al equipo original como ingenieros de Michigan que concluyeron que las cargas de trabajo de IA sensibles necesitaban ejecutarse localmente.

TwiL convierte esa visión fundacional en un producto con una definición estrecha. En lugar de intentar responder todo tipo de prompts, los modelos se concentran en tareas estructuradas detrás de políticas de cumplimiento, condiciones contractuales, enunciados de teoremas y decisiones basadas en reglas. En el comunicado, Stout describe el modelo como "casi como un autocorrector para la IA", una capa de razonamiento que puede inspeccionar y reestructurar la salida de otros modelos especializados.

La afirmación del benchmark

La comparación principal de webAI enfrenta a TwiL-LM3, la variante de 3B, contra gpt-oss-120b de OpenAI. En la suite de razonamiento formal de webAI, TwiL-LM3 obtuvo puntajes más altos en cuatro de las cinco pruebas reportadas: inducción de reglas, análisis semántico, formalización en Lean y respuestas con formato exacto. gpt-oss-120b mantuvo la delantera en el etiquetado de implicación, obteniendo 77.5 frente a 68.7 de TwiL-LM3.

Las mayores brechas reportadas se dieron en análisis semántico, donde webAI midió 87.6 para TwiL-LM3 frente a 43.3 para gpt-oss-120b, y en respuestas con formato exacto, donde las puntuaciones fueron 52.0 y 7.0. webAI también dice que TwiL-LM3 produjo 32.9 respuestas por segundo en su prueba de rendimiento, en comparación con 12.6 para el modelo de 120B.

Esos números miden el rendimiento en la propia suite de webAI. No han sido reproducidos de forma independiente, y la ficha del modelo indica que las pruebas no deben interpretarse como evidencia de inteligencia general. La comparación también abarca modelos con arquitecturas, métodos de entrenamiento, límites de salida y recuentos de parámetros diferentes, lo que la hace útil como demostración de producto más que como un estudio controlado de escalado.

La ficha detallada del modelo para la versión de 1.7B es inusualmente directa sobre esos límites. webAI informa que el modelo más pequeño mejoró su base SmolLM2-1.7B de 0.185 a 0.361 en la puntuación agregada de lógica formal de webAI. Fuera de esa especialidad, las ganancias fueron mixtas: el adaptador mejoró el rendimiento en LogicBench mientras que puntuó por debajo del modelo base en GSM8K y en dos evaluaciones ARC-Challenge.

webAI también advierte que TwiL no es un verificador. Las expresiones formales aún pueden ser sintácticamente válidas y lógicamente incorrectas, por lo que los despliegues que impliquen decisiones legales, médicas, financieras o críticas para la seguridad requieren un solucionador simbólico, un probador de teoremas o revisión humana.

Un ajuste fino de 289 MB

El modelo TwiL más pequeño se construyó como un adaptador LoRA para SmolLM2-1.7B-Instruct en lugar de entrenarse desde cero. El adaptador añade aproximadamente 72.35 millones de parámetros y ocupa alrededor de 289 MB. webAI dice que el adaptador se entrenó en un motor de datos de lógica formal diseñado específicamente y propietario, construido a partir de fuentes abiertas.

Ese enfoque mantuvo el paquete desplegable pequeño. La compilación cuantizada recomendada Q4 es de 1.06 GB, con versiones mayores Q5, Q8 y FP16 también listadas. El modelo soporta una ventana de contexto de 8,192 tokens y despliegue local con llama.cpp. webAI midió un rendimiento agregado de generación de 366.8 tokens por segundo en su evaluación, aunque la ficha advierte que la cifra depende del hardware, el batching, la longitud del prompt, la precisión y la configuración del backend.

El corpus de entrenamiento en sí no es público, lo que limita la reproducción independiente y el análisis de contaminación. Los artefactos del lanzamiento tampoco incluyen configuraciones del optimizador, cronogramas de tasa de aprendizaje, datos semilla, hardware de entrenamiento ni intervalos de confianza. Esas omisiones importan porque el argumento de venta más fuerte de TwiL se apoya en la eficiencia de los benchmarks: webAI pide a los desarrolladores aceptar que un motor de datos dirigido puede sustituir a decenas de miles de millones de parámetros de propósito general en una clase definida de trabajo.

La red de expertos de Stout

TwiL encaja en la arquitectura que Stout y sus cofundadores han descrito a lo largo de 2026. En una presentación de marzo de webAI, webAI argumentó que las organizaciones deberían poseer redes de modelos especializados entrenados en torno al conocimiento local. Cada modelo maneja una tarea definida, y la red combina esas salidas sin enviar datos privados a una API con tarificación.

TwiL le da a esa red un posible árbitro. Un modelo de contratos podría extraer cláusulas, un modelo de recuperación podría encontrar documentos de respaldo y TwiL podría convertir el resultado en reglas formales o probar si una conclusión se sigue. La pequeña huella permite que ese paso de verificación se ejecute de forma continua en hardware local, que es el valor práctico detrás de la analogía del autocorrector de Stout.

El uso comercial requerirá un arreglo separado porque webAI liberó los pesos bajo su Non-Commercial License v1.0. La licencia permite a los desarrolladores inspeccionar y probar el modelo en Hugging Face, mientras que el despliegue comercial requiere permiso de webAI. Esa estructura convierte el lanzamiento tanto en un artefacto de investigación como en un posible punto de entrada a la plataforma de IA privada de webAI.

Stout tiene capital sustancial detrás de la estrategia. webAI dijo que había recaudado $60 millones para septiembre de 2024, cuando su Serie A valoró a webAI en $700 millones. En enero de 2026, webAI anunció otra ronda con una valoración pre-money de $2.5 billion, con la participación de TIME Ventures, Atreides Management, Forerunner Ventures y OXCART Ventures. Axios informó que la financiación totalizó decenas de millones en el rango alto.

Esa financiación también estableció el Intelligence Lab dirigido por Paul J. Maykish, el grupo acreditado con TwiL. El lanzamiento es la salida técnica más clara hasta ahora de esa inversión: un modelo descargable que los desarrolladores pueden comparar con sus propias reglas y documentos. Su valor dependerá del rendimiento fuera del arnés de prueba de webAI, especialmente cuando la lógica formal se enfrente a contratos largos, políticas incompletas y datos del mundo real inconsistentes.

Reader comments

Conversation for this story loads after sign-in.