Metric lanza un benchmark de habla armenia; sistemas cerrados ocupan los primeros ocho lugares
El laboratorio de Hrant Davtyan probó casi 30 sistemas en 20.7 horas de audio armenio a lo largo de cinco conjuntos de datos de voz, con los sistemas cerrados encabezando la clasificación combinada.
By RuntimeWire Staff · Published
Primary source: Hugging Face Newsroom
Why it matters
ArmBench-ASR gives Armenian developers a shared test across real speech domains, while showing that closed-model leads shrink or disappear on specific audio types.

Hrant Davtyan, fundador y CEO de Metric, publicó ArmBench-ASR el 20 de agosto, ofreciendo al reconocimiento de voz en armenio una prueba común a través de discurso leído, poesía, diálogos de películas y noticas narradas.
El benchmark inicial v0.1 evalúa cerca de 30 sistemas de pesos abiertos y cerrados usando 10,113 fragmentos de audio que suman aproximadamente 20.7 horas. Alexander Shahramanyan y Mariam Avetisyan están entre los investigadores de Metric acreditados en el lanzamiento junto a Davtyan.
Gemini 2.5 Pro de Google se ubicó en primer lugar con una tasa combinada estricta de error de palabras, o WER, de 14.31%. El modelo conversacional armenio de HiSpeech siguió en 16.81%, y Gemini 2.5 Flash ocupó el tercer lugar con 17.55%. Valores más bajos son mejores. Los ocho mejores resultados combinados de WER provinieron de sistemas cerrados, mientras que FastConformer de NVIDIA fue el modelo abierto mejor posicionado en noveno lugar con 20.21%.
La premisa del benchmark de Metric es sencilla: una sola puntuación limpia de discurso leído no puede mostrar cómo los sistemas de ASR en armenio manejan poesía, medios producidos o noticias narradas. Evaluaciones públicas con frecuencia cubren un único estilo de habla, usan un procesamiento de texto inconsistente o carecen de procedimientos estandarizados. ArmBench-ASR aplica el mismo marco de evaluación en cinco dominios.
Davtyan ha pasado gran parte de su carrera moviéndose entre la ciencia de datos aplicada, la docencia y la creación de empresas. La American University of Armenia lo identifica como profesor asistente y cofundador del centro de investigación Metric. Su sitio personal dice que previamente hizo crecer una operación de software de IA de un empleado a 21 y de un proyecto a 30 proyectos en dos años sin gasto en marketing.
El trabajo de Metric en idioma armenio ocupa una vía de investigación autofinanciada. En su página de investigación, Metric dice que sus investigadores invierten su propio tiempo y presupuesto porque la infraestructura de IA para el armenio importa incluso cuando no existe un caso de negocio inmediato. ArmBench-ASR convierte ese compromiso en algo contra lo que otros creadores de modelos pueden medir sus sistemas.
Cinco conjuntos de datos exponen cinco problemas diferentes
ArmBench-ASR usa el mismo material fijo y reglas de procesamiento para cada sistema evaluado. Sus dos componentes públicos son Common Voice 26, un conjunto de lectura en voz alta recopilado por la comunidad, y la división de prueba armenia de FLEURS de Google. Metric publicó un pequeño conjunto de correcciones después de revisar manualmente las transcripciones de FLEURS.
Metric añadió tres colecciones privadas. Poems contiene lecturas literarias expresivas con música de fondo. Movies contiene diálogo conversacional y ruido de medios producidos. Infocom consiste en texto noticioso armenio recitado por un solo hablante. Metric dice que revisó y corrigió manualmente las transcripciones de referencia de los tres.
La tabla de clasificación interactiva desglosa los resultados por conjunto de datos y permite a los usuarios comparar tasas de error de palabras y caracteres estrictas y normalizadas. La puntuación estricta preserva la sensibilidad a la puntuación y a las mayúsculas. La puntuación normalizada convierte el texto a minúsculas y elimina la puntuación después de aplicar reglas consistentes de Unicode, espaciado y procesamiento de caracteres tanto a las referencias como a la salida del modelo.
Esa distinción cambia materialmente los números. El WER combinado normalizado de Gemini 2.5 Pro fue 6.42%, menos de la mitad de su puntuación estricta. La brecha indica que la puntuación, las mayúsculas, el espaciado y las elecciones ortográficas representan una porción sustancial de los errores medidos. También advierte a los compradores sobre tratar un único porcentaje de la tabla como una descripción completa de la calidad de la transcripción.
Metric informa que cada modelo evaluado registró su WER estricto más alto en la colección privada Movies. La mediana alcanzó 61.87%, en comparación con 17.29% en Common Voice 26 y 17.02% en FLEURS. El ruido de fondo es un factor posible, según Metric, aunque la entrega conversacional y el audio producido generan diferencias adicionales respecto a los conjuntos de discurso leído.
Los resultados por dominio también suavizan la victoria agregada de las API cerradas. FastConformer de NVIDIA lideró Common Voice con 7.70% WER, por delante de Gemini 2.5 Pro con 9.69%. Los dos modelos armenios de HiSpeech superaron a Gemini en WER estricto para poesía, mientras que Gemini lideró después de la normalización. Por lo tanto, la elección del modelo depende en gran medida del audio y de las convenciones de salida deseadas.
Los datos útiles también son la parte difícil de verificar
Los tres conjuntos de datos privados de ArmBench-ASR hacen que el benchmark sea más amplio que una prueba pública de discurso leído. Su ausencia en la publicación también impide que investigadores externos reproduzcan completamente la porción más distintiva de la evaluación.
Metric expone la limitación directamente. El conjunto actual cubre principalmente el armenio oriental y excluye el armenio occidental y los dialectos regionales. Prueba la precisión de la transcripción sin medir diarización de hablantes, marcas de tiempo a nivel de palabra, streaming, comportamiento en contenido de larga duración o rendimiento en tareas posteriores. Las evaluaciones se realizaron a fines de julio y principios de agosto de 2026, por lo que los sistemas alojados pueden cambiar después mediante actualizaciones de modelo no versionadas o decisiones de enrutamiento.
Eso importa sobre todo para las API cerradas. Una futura reejecución bajo el mismo nombre de producto puede corresponder a un modelo subyacente diferente. ArmBench-ASR usó parámetros por defecto, con la temperatura de Gemini ajustada a cero y el modo "thinking" deshabilitado o mantenido en un ajuste mínimo. Esas opciones convierten este lanzamiento en una comparación temporal de servicios configurados más que en un ranking permanente.
El benchmark aún cubre una laguna práctica junto a proyectos amplios como el Open ASR Leaderboard de Hugging Face y baselines multilingües como Whisper de OpenAI. Evaluaciones de propósito general pueden mostrar si un modelo de voz funciona en distintos idiomas. Davtyan y Metric están planteando la pregunta más estrecha que realmente enfrentan los desarrolladores armenios: qué sucede cuando el hablante deja de leer una oración de prueba limpia y empieza la película.
Metric ha estado construyendo un marco de evaluación más amplio para el armenio, incluyendo proyectos ArmBench para modelos de lenguaje y embeddings de texto. SmartGateVC invirtió en la ronda pre-semilla de Metric en 2021, cuando Metric fue descrita como un laboratorio de investigación en IA aplicada anteriormente conocido como Pinsight. No se publicaron la cantidad ni la valoración.
ArmBench-ASR extiende ese programa de investigación al habla al tiempo que expone dónde radica el siguiente trabajo. Metric planea añadir alternancia de códigos, conversaciones espontáneas, entrevistas, llamadas, reuniones, superposición de hablantes, vocabulario especializado, diarización y calidad de marcas de tiempo. Cada adición aumenta el costo de recopilar y validar referencias, especialmente para un idioma con datos estandarizados limitados.
La apuesta de Davtyan es que la infraestructura que falta vale la pena construir de todos modos. El primer lanzamiento ofrece a los desarrolladores de modelos armenios una línea base y un conjunto de dominios de audio difíciles. También ofrece a los proveedores de servicios de voz mejor financiados una prueba más allá de otro conjunto de lectura limpia.