Mistral lanza Agentic Search para que la IA empresarial pueda seguir buscando
Mistral de Arthur Mensch afirma que su bucle de recuperación elevó la precisión de FinanceBench de 26.7% a 86% en una prueba realizada por la empresa.
By RuntimeWire Staff · Published
Primary source: Mistral AI
Why it matters
Enterprise agents fail when they cannot locate and verify private information. Mistral is turning retrieval into a core product as it builds beyond foundation models.

Arthur Mensch's Mistral AI lanzó Agentic Search el 20 de agosto, ofreciendo a los sistemas de IA empresariales un bucle de recuperación multi‑paso para buscar, abrir y leer documentos extensos en lugar de responder con el primer lote de fragmentos de texto que reciben.
Mensch, un exinvestigador de Google DeepMind, fundó Mistral en 2023 junto con Guillaume Lample y Timothee Lacroix, quienes habían trabajado en Meta AI. Los tres investigadores construyeron Mistral alrededor de una propuesta de modelos eficientes, herramientas abiertas y control por parte del cliente. Agentic Search lleva ese argumento a la capa de recuperación, donde el acceso a información privada a menudo importa tanto como el modelo que genera la respuesta final.
El producto está disponible a través de Mistral Search Toolkit y a través de Libraries dentro de Studio y Vibe. Mistral dice que los clientes pueden ejecutar las herramientas en la nube o en las instalaciones y conectarlas a un índice de búsqueda existente, un requisito importante para organizaciones que no pueden enviar contratos, presentaciones o registros operativos a un servicio de terceros.
Un modelo que puede seguir buscando
La generación aumentada por recuperación convencional, o RAG, normalmente busca en un índice una sola vez, pasa un grupo fijo de fragmentos a un modelo de lenguaje y solicita una respuesta. Eso funciona para una consulta directa. Se vuelve frágil cuando la cifra relevante está en una nota al pie, en una tabla en la página 147 o en un segundo documento referenciado por el primero.
Agentic Search permite que el modelo decida qué inspeccionar a continuación mediante cinco herramientas: search, open, navigate, read y grep. El modelo puede refinar una consulta, abrir un documento prometedor, moverse a una página en particular y buscar dentro de ese archivo antes de responder. Según Mistral, las herramientas no requieren ajuste fino específico del modelo.
Mistral ilustra la diferencia con una pregunta que pide la suma de los gastos mensuales de defensa nacional de EE. UU. en 1953. Una búsqueda única recuperó boletines que contenían solo parte del año. El bucle agentic buscó de nuevo, encontró un Treasury Bulletin de febrero de 1954 que contenía los 12 meses, leyó la página relevante y calculó un total de $44,463 millones.
Ese ejemplo captura la ventaja práctica del enfoque. El índice inicial todavía reduce el corpus. Luego el modelo investiga las fuentes probables en lugar de tratar los primeros resultados de búsqueda como todo el registro disponible.
El Search Toolkit subyacente entró en vista previa pública el 28 de mayo. Maneja la extracción de documentos, el chunking, los embeddings, la indexación, la recuperación y la evaluación en formatos que incluyen PDFs, archivos de Office, hojas de cálculo, correos electrónicos y texto plano. Agentic Search convierte esa infraestructura en un conjunto de acciones que un modelo puede invocar durante la inferencia.
El caso de referencia
Mistral probó el sistema con Mistral Medium 3.5 y el GLM-5.2 de Z.ai en FinanceBench y OfficeQA Pro. Según Mistral, las pruebas usaron el chunking y el ranking por defecto de Search Toolkit sin ajuste específico por caso de uso.
En FinanceBench, Mistral informa que la precisión de GLM-5.2 aumentó de 26.7% con RAG de una sola consulta a 86% con búsqueda iterativa y navegación de documentos. El bucle de búsqueda explicó un incremento de 52.6 puntos porcentuales, mientras que las herramientas open, navigate, read y grep sumaron otros 6.7 puntos. Mistral Medium 3.5 ganó 47.3 puntos gracias a la búsqueda iterativa y otros 8.7 puntos por la navegación.
FinanceBench evalúa preguntas financieras a través de 368 filings de la SEC que cubren alrededor de 53,900 páginas. Mistral usó su conjunto de evaluación público de 150 preguntas y puntuó las respuestas con un juez LLM calibrado frente a etiquetas humanas.
Las herramientas de navegación también redujeron el costo de búsquedas repetidas en la prueba de Mistral. El uso de tokens cayó 23.9% para Mistral Medium 3.5 y 33.7% para GLM-5.2 en comparación con un bucle agentic de solo búsqueda. La latencia p90 en FinanceBench disminuyó de 255 segundos a 154 segundos, mientras que la latencia media cayó de 108 segundos a 71 segundos.
En OfficeQA Pro, GLM-5.2 subió de 6.3% con recuperación de una sola pasada a 51.9% con el conjunto completo de herramientas, según Mistral. El benchmark contiene 133 preguntas sobre 696 U.S. Treasury Bulletins históricos que abarcan aproximadamente 89,000 páginas. Sus preguntas requieren que los sistemas recuperen y razonen sobre tablas escaneadas y múltiples documentos, lo que hace que la selección correcta del documento sea solo el inicio de la tarea.
Las mejoras son la propia evaluación de Mistral y no resultados replicados de forma independiente. Probar un modelo de Mistral y un modelo de terceros proporciona una comprobación cruzada útil, aunque dos modelos no establecen la afirmación más amplia de Mistral de que el sistema es agnóstico al modelo. La propia investigación de OfficeQA Pro encontró que los agentes de vanguardia provistos con el corpus de documentos promediaron 34.1%, evidencia de que la recuperación y el análisis de documentos siguen siendo puntos de fallo importantes incluso cuando modelos capaces reciben los archivos subyacentes.
Mensch avanza en la pila empresarial
Agentic Search sitúa a Mistral en un mercado ya ocupado por especialistas. Glean vende búsqueda en el lugar de trabajo consciente de permisos a través de aplicaciones empresariales, mientras que Contextual AI ofrece recuperación activa y multi‑paso para agentes empresariales especializados, incluidas opciones de implementación privadas.
La propuesta de Mistral se basa en la portabilidad, componentes abiertos y compatibilidad con índices que los clientes ya operan. Eso encaja con la campaña más amplia de Mensch para dar a las organizaciones europeas mayor control sobre los sistemas que gestionan sus datos. Los fundadores de Mistral describen la apertura, la eficiencia y el control del usuario como el núcleo de la tesis fundacional del desarrollador de IA con sede en París.
El lanzamiento también extiende un movimiento rápido más allá de los modelos base. RuntimeWire informó a principios de agosto que Mistral envió un modelo guard compacto con controles de políticas en tiempo de ejecución, y que Mensch está construyendo una coalición europea de cómputo en torno a compromisos de capacidad a largo plazo. Search añade otra capa entre los modelos de Mistral y el flujo de trabajo empresarial.
Esa capa puede determinar si un agente es útil. Un modelo más potente no puede producir una respuesta verificada cuando su sistema de recuperación le envía la página equivocada. Mensch apuesta a que Mistral puede vender la maquinaria que encuentra la evidencia, aplica la política y se ejecuta dentro de la infraestructura del cliente, en lugar de dejar esas tareas a una colección de proveedores externos.
Agentic Search le da a Mistral una entrada creíble en esa capa. Los resultados del benchmark muestran que permitir que un modelo investigue documentos puede producir una ganancia sustancial respecto a una única pasada de recuperación. Las implementaciones empresariales determinarán si esas ganancias perduran en corpus privados con formatos inconsistentes, controles de acceso y menos respuestas convenientes de referencia.