Microsoft lanza open browser agent de código abierto posentrenado en 64 B200s durante seis días

Fara1.5-27B usa capturas de pantalla en lugar del DOM y se distribuye bajo una licencia MIT, lo que da a los desarrolladores control sobre el agente de navegador de Microsoft.

By · Published

Primary source: X - @0xSero

Why it matters

Fara1.5 shows that competitive browser automation can come from focused post-training of an existing open model, lowering the compute barrier for developer-controlled agents.

Developer's focused interaction with a web browser agent (Oil painting in the manner of Edward Hopper)

Microsoft puso a disposición pública los pesos de Fara1.5, una familia de modelos para uso en navegador construidos sobre Qwen3.5, disponibles públicamente bajo una licencia MIT el 22 de julio. La publicación incluye modelos con 4 mil millones, 9 mil millones y 27 mil millones de parámetros, cada uno entrenado para operar sitios web leyendo capturas de pantalla y produciendo acciones de ratón, teclado y navegación.

El modelo más grande requirió 64 GPUs Nvidia B200 durante seis días de ajuste fino supervisado, según su model card en Hugging Face. Eso equivale a 9,216 GPU-horas, una ejecución posterior al entrenamiento relativamente compacta para un modelo que Microsoft posiciona frente a sistemas propietarios de uso en computadora.

Un hilo del 27 de julio de 0xSero (@0xSero) estimó el cómputo en aproximadamente $40,000 a $60,000. Los actuales precios de Lambda listan instancias B200 de ocho GPUs a $6.69 por GPU-hora, lo que pondría 9,216 GPU-horas en alrededor de $61,655. Esa comparación es solo un proxy del precio de renta. No representa los costos de infraestructura internos de Microsoft, y excluye el gasto de generar datos, ejecutar modelos maestros, evaluar trayectorias y pagar a los investigadores e ingenieros que construyeron el sistema.

El número útil es la escala: Microsoft convirtió un modelo existente de 27 mil millones de parámetros en un agente especializado para navegador con menos de una semana de cómputo posterior al entrenamiento. Eso da a los desarrolladores un punto de referencia más claro para construir sistemas especializados de uso en computadora sin financiar una corrida de preentrenamiento de un modelo fundacional.

The training pipeline behind the six-day run

Fara1.5 provino de Microsoft Research AI Frontiers, el laboratorio dirigido por Ece Kamar. El artículo técnico, enviado por primera vez el 18 de junio y revisado el 22 de julio, lista a Ahmed Awadallah y 14 coautores en el proyecto.

Los investigadores ajustaron finamente modelos Qwen3.5 bajo supervisión usando datos de FaraGen1.5, una canalización que crea tareas web, registra intentos de completarlas y filtra las trayectorias resultantes. Microsoft usó tanto sitios web en vivo como seis entornos sintéticos que cubren servicios como correo electrónico, calendarios, mercados y herramientas de gestión de experimentos.

Esas réplicas abordan un problema básico de entrenamiento para agentes de uso en computadora. Los investigadores no pueden recopilar de forma segura demostraciones ilimitadas en sitios en vivo que impliquen inicios de sesión de cuentas, mensajes, compras y otras acciones que cambian datos reales. En un entorno sintético, Microsoft controla la interfaz, la base de datos y el resultado esperado, permitiendo que verificadores automatizados comparen el estado antes y después de que actúe un agente.

Microsoft dice que la mezcla de entrenamiento resultante contiene aproximadamente 2 millones de muestras. La model card del 27B describe aproximadamente 1 billón de tokens de texto y menos de 1 billón de imágenes de entrenamiento. Un solucionador potenciado por GPT-5.4 generó trayectorias de tareas, mientras que verificadores separados calificaron corrección, eficiencia y si el agente se detenía cuando necesitaba información faltante, aclaración o aprobación para una acción irreversible.

Esta estructura maestro-estudiante es central para la economía. Un modelo propietario grande realiza tareas y produce demostraciones; luego un modelo mucho más pequeño de pesos abiertos aprende el comportamiento especializado. Los desarrolladores pagan al modelo más grande durante la generación de datos en lugar de cada vez que el agente desplegado hace clics en un sitio web.

Microsoft's benchmark claims need context

Microsoft reporta que Fara1.5-27B alcanzó 72.3% en Online-Mind2Web, un benchmark de tareas realizadas en sitios web en vivo. El artículo de investigación de Microsoft lista 58.3% para OpenAI Operator, 57.3% para Google's Gemini 2.5 Computer Use y 64.7% para Yutori Navigator n1 en la misma tabla comparativa.

Los resultados siguen siendo evaluaciones reportadas por Microsoft y no pruebas independientes. Microsoft usó Browserbase para estabilizar sesiones y promedió los resultados de Fara en tres ejecuciones. Las puntuaciones de agentes de navegador pueden cambiar con modificaciones en los sitios web, sesiones bloqueadas, el diseño del evaluador y las herramientas exactas disponibles para cada sistema, lo que limita cuánto demuestra una sola tabla sobre implementaciones reales.

Los propios materiales de Microsoft también contienen una discrepancia. El artículo de investigación y la model card reportan 72.3% para Fara1.5-27B en Online-Mind2Web. Una entrada de blog complementaria de Microsoft del 21 de mayo dice que el modelo superó el 90% en ese benchmark. La cifra de 72.3% es la que se repite en el artículo técnico, el artículo de investigación, el repositorio y la model card.

El reporte de WebVoyager varía ligeramente también. El artículo de investigación da a Fara1.5-27B una puntuación de 88.6%, mientras que la model card actual lista 89.3%. Ambas fuentes colocan al modelo 27B por encima de las variantes Fara más pequeñas, aunque la diferencia de versión hace que la precisión aparente sea poco útil.

An agent developers can inspect and contain

Fara1.5-27B tiene una ventana de contexto de 262,144 tokens y observa capturas de pantalla del navegador sin leer el document object model ni un árbol de accesibilidad. Predice coordenadas ancladas para clics y arrastres, y puede escribir, desplazarse, visitar URLs, realizar búsquedas, hacer preguntas al usuario y terminar una tarea.

Microsoft recomienda ejecutar el modelo a través de su repositorio Fara o MagenticLite, que coloca el navegador en un contenedor y agrega listas de dominios permitidos, registros de acciones, monitoreo y un control de pausa. La model card advierte explícitamente en contra de dar a Fara acceso irrestricto al navegador en una máquina que contenga archivos o credenciales sensibles.

La licencia MIT da a los desarrolladores espacio para inspeccionar y adaptar los pesos, mientras que el tamaño 27B mantiene el despliegue al alcance de organizaciones que puedan servir un modelo a través de un pequeño clúster de GPUs. Microsoft dice que el modelo ha sido probado en hardware A6000, A100, H100 y B200, con al menos dos GPUs recomendadas para inferencia BF16.

Fara1.5 aún tiene los modos de falla que hacen que los agentes de uso en computadora sean riesgosos: inyección de prompts desde el contenido de la página, acumulación de errores en tareas largas, estados de página alucinados y confusión causada por interfaces ambiguas. Microsoft excluye el uso sin sandbox y las tareas legales, médicas y financieras de alto riesgo del alcance previsto del modelo.

El lanzamiento establece una receta práctica para equipos que buscan automatización de navegador: usar un modelo de vanguardia para generar y verificar datos de interacción, especializar un modelo abierto más pequeño y luego contenerlo dentro de un arnés de ejecución diseñado para ese propósito. La corrida de entrenamiento de seis días es el gasto visible. Los entornos sintéticos, las llamadas al modelo maestro y el sistema de verificación son los activos más difíciles de reproducir.

Reader comments

Conversation for this story loads after sign-in.