Metric 发布亚美尼亚语语音基准测试;封闭系统占据前八名

Hrant Davtyan 的实验室在五个语音数据集上对近30个系统进行了测试,覆盖了20.7小时的亚美尼亚语音频,封闭系统在综合排名中领先。

By · Published

Primary source: Hugging Face Newsroom

Why it matters

ArmBench-ASR gives Armenian developers a shared test across real speech domains, while showing that closed-model leads shrink or disappear on specific audio types.

A high-contrast photocopy of a research page, showing Armenian script, an audio waveform, and a fragmented film strip with handwritten notes about speech model testing.

Hrant Davtyan, founder and CEO of Metric, released ArmBench-ASR on August 20, giving Armenian speech recognition a common test across read speech, poetry, movie dialogue and narrated news.

初始的 v0.1 基准使用 10,113 段音频片段(总计约 20.7 小时)评估了近 30 个开放权重和封闭系统。Alexander ShahramanyanMariam Avetisyan 与 Davtyan 一同被列为此发布中的 Metric 研究人员。

Google 的 Gemini 2.5 Pro 以严格组合词错误率(WER)14.31% 排名第一。HiSpeech 的亚美尼亚语对话模型以 16.81% 紧随其后,Gemini 2.5 Flash 则以 17.55% 排在第三。数值越低越好。八个最佳的组合 WER 结果来自封闭系统,而 NVIDIA 的 Armenian FastConformer 是排名最高的开源模型,位列第九,WER 为 20.21%。

Metric 的基准前提很直接:单一的干净朗读分数无法展示亚美尼亚语 ASR 系统在诗歌、制作媒体或新闻旁白等场景下的表现。公开评估通常只覆盖单一语音风格、使用不一致的文本处理或缺乏标准化流程。ArmBench-ASR 在五个领域中应用相同的评估框架。

Davtyan 在职业生涯的大部分时间里在应用数据科学、教学和公司建设之间切换。American University of Armenia 将他标为助理教授并且是 Metric 研究中心的联合创始人。他的个人网站 表示,他此前在两年内将一个 AI 软件团队从 1 名员工扩展到 21 名、项目从 1 个增长到 30 个,且未进行市场推广支出。

Metric 的亚美尼亚语工作属于自筹资金的研究路线。在其研究页面中,Metric 表示其研究人员投入自己的时间和预算,因为即便短期商业回报不足,亚美尼亚语 AI 基础设施仍然重要。ArmBench-ASR 将这种承诺转化为其他模型开发者可以度量的基线。

五个数据集揭示五种不同的问题

ArmBench-ASR 对每个被评估系统使用相同的固定材料和处理规则。其两个公开组成部分是 Common Voice 26,一个众包朗读语音集,以及 Google 的 FLEURS 的亚美尼亚语测试拆分。Metric 在手动审查 FLEURS 抄本后发布了一小批更正

Metric 添加了三个私有集合。Poems 包含带背景音乐的富有表现力的文学朗读。Movies 包含对话性对白和制作媒体噪声。Infocom 由一位说话者朗读的亚美尼亚语新闻文本组成。Metric 表示他们对这三者的参考抄本均进行了人工审校和更正。

交互式排行榜 将结果按数据集拆分,并允许用户比较严格与规范化的词错误率和字符错误率。严格评分保留对标点和大小写的敏感性。规范化评分在对参考文本和模型输出同时应用一致的 Unicode、间距和字符处理规则后,会将文本小写化并移除标点。

这一差别实质性地改变了数字。Gemini 2.5 Pro 的规范化组合 WER 为 6.42%,不到其严格得分的一半。该差距表明标点、大小写、空格和正字法选择占了被测错误的相当大一部分。它也提醒买家不要将单一排行榜百分比视为转录质量的完整描述。

Metric 报告,所有被评估模型在私有 Movies 集上都记录了最高的严格 WER。中位数达到 61.87%,而 Common Voice 26 为 17.29%,FLEURS 为 17.02%。Metric 认为背景噪声是一个可能因素,尽管对话式的呈现和制作音频与朗读语料集相比也造成了额外差异。

这些领域结果也削弱了封闭 API 的总体胜利。NVIDIA 的 FastConformer 在 Common Voice 上以 7.70% 的 WER 领先,优于 Gemini 2.5 Pro 的 9.69%。HiSpeech 的两个亚美尼亚语模型在诗歌的严格 WER 上击败了 Gemini,而在规范化后 Gemini 领先。因此模型选择在很大程度上取决于音频类型和所需的输出约定。

有用的数据同时也是难以验证的部分

ArmBench-ASR 的三个私有数据集使得基准比公开朗读测试更广泛。它们在发布中缺失也阻止了外部研究人员完全复现评估中最具特色的部分。

Metric 直接说明了这一限制。当前套件主要覆盖东亚美尼亚语,排除了西亚美尼亚语和地区方言。它测试转录准确性,但不衡量说话人分离(speaker diarization)、词级时间戳、流式处理、长篇行为或下游性能。评估于 2026 年 7 月下旬和 8 月上旬进行,因此托管系统以后可能通过未版本化的模型更新或路由决策发生变化。

这对封闭 API 的影响最大。在相同产品名称下的未来重跑可能对应不同的底层模型。ArmBench-ASR 使用了默认参数,将 Gemini 的 temperature 设置为 0,并将“思考”禁用或保持在最低设置。这些选择使得此次发布成为对已配置服务的时点比较,而非永久性的排名。

该基准仍然在诸如 Hugging Face 的 Open ASR Leaderboard 以及像 OpenAI 的 Whisper 这样的多语种基线项目之外填补了一个实用空白。通用评估可以展示一个语音模型能否跨语言适用。Davtyan 与 Metric 所问的是亚美尼亚语开发者真正面临的更狭窄问题:当说话者不再朗读一条干净的测试句子而电影开始时会发生什么。

Metric 一直在构建更广泛的亚美尼亚语评估栈,包括用于语言模型和文本嵌入的 ArmBench 项目。SmartGateVC 在 2021 年投资了 Metric 的 pre-seed 融资,当时 Metric 被描述为一家前称 Pinsight 的应用型 AI 研究实验室。投资金额和估值未公开。

ArmBench-ASR 将该研究计划扩展到语音领域,同时揭示了下一步工作的方向。Metric 计划添加代码切换、非正式对话、采访、通话、会议、重叠说话者、专有词汇、说话人分离和时间戳质量等测试。每一项新增都提高了收集和验证参考数据的成本,尤其是对于一个缺乏标准化数据的语言而言。

Davtyan 的赌注是:缺失的基础设施无论如何都值得去构建。首次发布为亚美尼亚语模型开发者提供了一个基线和一组具有挑战性的音频领域,也为资金最充足的语音提供商提供了一个超出另一个干净朗读集的测试。

Reader comments

Conversation for this story loads after sign-in.