Mistral puso OCR 4.1 en vista previa pública con extracción a nivel de párrafo

La vista previa pública de Mistral del 16 de julio agrega cajas delimitadoras a nivel de párrafo, etiquetas estructurales y puntuaciones de confianza a nivel de bloque, mientras que su guía de la API documenta la salida de confianza a nivel de página y de palabra.

By · Published

Primary source: Mistral Docs

Why it matters

Paragraph-level extraction gives engineers finer document structure for search, agents and automated workflows. Documented page-level and word-level confidence data can help teams route uncertain results for human verification.

Illustration of Mistral OCR 4.1 processing a document, with paragraph bounding boxes, structural labels, and block-level confidence scores highlighted for human review.

Mistral puso a OCR 4.1 en vista previa pública el 16 de julio de 2026. El modelo añade extracción nativa de cajas delimitadoras a nivel de párrafo, etiquetas estructurales de bloque y puntuaciones de confianza a nivel de bloque. La actual documentación de OCR de Mistral describe la salida de confianza a nivel de página y a nivel de palabra.

Arthur Mensch, Guillaume Lample y Timothee Lacroix fundaron Mistral en abril de 2023 tras carreras en Google DeepMind y Meta. Mensch se convirtió en CEO, Lample asumió el puesto de director científico y Lacroix se convirtió en CTO. Su tesis fundacional se centró en dar a los clientes mayor control sobre los sistemas de IA mediante modelos accesibles y personalizables. El procesamiento de documentos es una prueba práctica de esa propuesta: las empresas necesitan saber qué extrajo un modelo, dónde encontró la información y cuánta confianza deben depositar en cada resultado antes de que un sistema automatizado actúe sobre él.

La página del modelo OCR 4.1 lista un precio de EUR3.50 por 1,000 páginas y EUR4.38 por 1,000 páginas anotadas. Esos valores no deben tomarse como continuidad con la versión anterior: el anuncio de OCR 4 de Mistral fijó el procesamiento por API en $4 por 1,000 páginas y Document AI en $5 por 1,000 páginas. OCR 4.1 soporta OCR, anotaciones estructuradas, extracción de cajas delimitadoras a nivel de párrafo y procesamiento por lotes a través de la pila Document AI de Mistral.

The API documents three confidence layers

OCR 4, lanzado el 23 de junio, devolvía bloques de documento con cajas delimitadoras y etiquetas estructurales como text, title, table, equation, code, header, footer y signature. La página del modelo OCR 4.1 añade extracción nativa de cajas delimitadoras a nivel de párrafo y lista puntuaciones de confianza a nivel de bloque.

La actual documentación de OCR documenta page y word como granularidades disponibles de puntuación de confianza. La página del modelo OCR 4.1 lista por separado puntuaciones de confianza a nivel de bloque, aunque la guía básica de OCR no explica ese modo en detalle. La salida a nivel de página proporciona estadísticas agregadas de confianza, mientras que la salida a nivel de palabra añade puntuaciones para palabras individuales. Por separado, include_blocks=True agrega un arreglo blocks a cada página con cajas delimitadoras a nivel de párrafo, etiquetas estructurales y contenido extraído en orden de lectura.

El changelog de Mistral registra el lanzamiento del 23 de junio de 2026 de OCR 4 como mistral-ocr-4-0 y dice que mistral-ocr-latest apunta a él. La documentación oficial no establece que un alias mistral-ocr-4 haya sido redirigido a OCR 4.1.

En su anuncio de OCR 4, Mistral identificó el llenado de formularios, el procesamiento de facturas, las comprobaciones de cumplimiento, la redactación, la búsqueda empresarial y la recuperación como usos previstos. Mistral dijo que los metadatos de confianza podrían apoyar la verificación humana. Las cajas delimitadoras preservan la ubicación de cada bloque, mientras que las etiquetas estructurales indican al software posterior qué tipo de material está manejando. Esos campos, combinados con datos de confianza a nivel de página, palabra y bloque, dan a los ingenieros entradas más granulares para políticas de revisión que una página indiferenciada de texto extraído.

The benchmark case still belongs to OCR 4

Mistral publicó un caso de rendimiento detallado para OCR 4. Mistral reportó una puntuación de 85.20 en OlmOCRBench y dijo que anotadores independientes prefirieron OCR 4 en el 72% de las comparaciones en más de 600 documentos. Mistral también advirtió que los benchmarks agregados de OCR pueden interpretar erróneamente ecuaciones correctas, el orden de columnas y las clasificaciones de bloques como errores, y describió los resultados como orientativos.

Esos números se aplican a OCR 4. El material publicado de Mistral para la versión 4.1 describe sus funciones soportadas sin establecer un resultado de rendimiento separado. Los clientes que evalúen la vista previa aún necesitan probar el modelo con sus propios escaneos, formularios, tablas, escritura a mano y documentos de diseño mixto. El caso documentado de OCR 4.1 se basa en la localización a nivel de párrafo y en los metadatos estructurales más que en un nuevo benchmark de precisión.

Las dos versiones también usan presentaciones de precios publicadas y monedas diferentes. La página del modelo de OCR 4.1 lista EUR3.50 por 1,000 páginas y EUR4.38 por 1,000 páginas anotadas. El anuncio de OCR 4 listó $4 por 1,000 páginas de API, un descuento del 50% en Batch API a $2 por 1,000 páginas y $5 por 1,000 páginas para Document AI.

Mistral wants the ingestion layer

Mensch y sus cofundadores están construyendo más allá de modelos de lenguaje de propósito general. Mistral siguió OCR 3 en diciembre de 2025 con OCR 4 en junio de 2026 y la vista previa pública de OCR 4.1 en julio. Mistral está ensamblando modelos enfocados que pueden integrarse dentro de sistemas empresariales e industriales.

La ingestión de documentos es un punto de entrada útil porque los agentes empresariales dependen de la calidad del material que reciben. Un modelo puede razonar bien y aun así producir un mal resultado si una tabla se aplanó incorrectamente, un pie de página se confundió con el texto del cuerpo o una cifra de baja confianza entró en el índice de recuperación sin revisión. OCR 4.1 ofrece a los operadores ubicación a nivel de párrafo, datos estructurales y puntuaciones de confianza a nivel de bloque en esa frontera, mientras que la API documenta metadatos de confianza a nivel de página y palabra.

Mistral entró en el mercado de OCR e inteligencia de documentos con el lanzamiento de OCR 4 el 23 de junio de 2026. Entre sus rivales están Amazon Textract, que extrae texto, escritura a mano, tablas y formularios, y Google Cloud Document AI, que combina OCR con análisis de diseño, clasificación y extracción estructurada. Esas plataformas se benefician de su posición dentro de grandes portafolios en la nube. Mistral ofrece un modelo de documentos enfocado conectado a sus propios modelos, herramientas de Studio y pila de IA empresarial.

OCR 4.1 es una vista previa pública limitada según los estándares de modelos de frontera. Su importancia proviene de dónde los fundadores colocaron la mejora: dentro del flujo de documentos que alimenta la búsqueda, los agentes y las decisiones automatizadas. La salida a nivel de párrafo da a los desarrolladores una estructura más fina para inspeccionar, enrutar e indexar. Los datos de confianza documentados a nivel de página y palabra de la API, junto con la lista de confianza a nivel de bloque de la página del modelo, proporcionan entradas adicionales para evaluar extracciones con incertidumbre.

Reader comments

Conversation for this story loads after sign-in.