Alibaba 的 Qwen 提升了对技术术语和结构化转录的语音识别能力

Qwen 表示其 ASR 更新改进了上下文处理和热词,尽管 Alibaba 的公开 API 文档仍然指向较早的模型快照。

By · Published

Primary source: Qwen / Alibaba

Why it matters

Domain terminology is where fluent transcripts often fail. Qwen's internal results are strong, but developers need model-specific API documentation and production tests before relying on the upgrade.

Alibaba's Qwen upgrades speech recognition for technical terms and structured transcripts

Alibaba 的 Qwen (@Alibaba_Qwen) 团队在 7 月 31 日宣布 了一项语音识别更新,旨在保持技术词汇的完整并将粗糙的语音转化为结构化的转录文本。Qwen 表示 Qwen-Audio-3.0-ASR-Flash 提升了上下文一致性、领域术语识别和自定义热词处理,解决了通用转录系统常常将专业词汇扁平化为看似合理但错误的词语的问题。

此发布契合了 Alibaba 联合创始人兼 CEO Eddie Wu 制定的战略。Wu 是一位技术人员,曾在 1999 年 Alibaba 成立时担任技术总监,后成为 Alipay 和 Taobao 的 chief technology officer。Wu 将 AI 和云计算视为 Alibaba 的核心运营优先事项,承诺集团落实一项于 2025 年 2 月宣布的 人民币 3,800 亿元(约 530 亿美元)基础设施计划

Qwen-Audio-3.0-ASR-Flash 是该押注在产品层面的体现:一个相对廉价的转录服务,能够将开发者及其生产音频引入 Alibaba Cloud。Qwen 团队也在构建其 Qwen3-ASR research base,包括开源权重的语音识别模型。

Alibaba 在一月发布了开源权重的 Qwen3-ASR 模型,包括 6 亿和 17 亿参数的版本,能识别 30 种语言和 22 种中文方言。本次新的 Flash 公告针对的是不同的部署问题:那些希望通过 API 获取领域适配而无需自行训练和托管语音栈的公司。

A benchmark built around jargon

Alibaba 的公告集中在领域术语召回率上,这是一个狭窄但具有直接商业价值的指标。医疗记录员即便能产出流畅文本,如果把药品名称替换掉依然会失败。客服转录看起来干净,但可能会破坏产品标识、客户姓名或指令。这类错误代价高昂,正因为它们常常能通过简单的人类检查存留。

在公告中附带的 内部对比 中,Qwen-Audio-3.0-ASR 在与 Doubao_ASR 和 Fun-ASR-Flash 的九类测试中录得最高的领域术语召回率。Qwen 在医学术语上报告的召回率为 95.36%,而 Doubao 为 90.99%,Fun-ASR-Flash 为 89.56%。

报告中显示最大的差距出现在技术类目上。在 IT 和编程词汇上,Qwen 的召回率为 91.87%,Fun-ASR-Flash 为 79.72%,Doubao 为 60.50%。在 AI 术语上,数字分别为 76.82%、66.23% 和 63.58%。Qwen 在工业术语、组织名称、股票、文化、名人和畜牧业等内部表格中也位居首位。

这些结果衡量的是目标术语是否被恢复。它们并不衡量总转录准确率、延迟、说话人分离、虚构文本(hallucination)或在不同麦克风、口音和背景噪音条件下的表现。该对比是 Alibaba 的内部测试,而非独立基准,因此生产环境评估需要确定所报告的增益能否在 Qwen 的测试集之外成立。

模型声称的另一项能力,“将语音润色为结构化转录文本”,对开发者而言可能具有同等重要性。语音 API 越来越多地被用作会议记录、临床记录、通话摘要和语音代理工作流的第一步。如果 ASR 层在产出可用文档结构的同时能保留实体,客户就可以减少通常在转录后需要的清理提示和后处理代码。

The API details still need to catch up

Alibaba 自 2025 年起就运营着 Qwen3-ASR-Flash service。其 model lifecycle page 将最初的 qwen3-asr-flash 快照日期标为 2025 年 9 月 8 日,随后有文件转录、实时和 2026 年 2 月快照变体。因此 7 月 31 日的发布是对现有 ASR 系列的功能和品牌更新,而不是 Alibaba 首次推出 Qwen 语音识别。

当前文档给早期采用者留下了一个部署问题。Alibaba 的 pricing page 仍显示通用的 qwen3-asr-flash 端点等同于 2025 年 9 月 8 日的快照。Alibaba 的 API reference 记录了用于背景文本和实体词表的系统上下文,但并未标识 Qwen-Audio-3.0-ASR-Flash 的模型 ID。

关于热词也存在类似的不匹配。公告将自定义热词列为核心升级。QwenCloud 当前的 recognition-accuracy guide 列出了对 Fun-ASR 模型的热词支持以及对 fun-asr-flash-2026-06-15 的上下文增强。如果文档落后于发布,开发者在围绕该新功能构建之前仍应确认端点和参数支持情况。

热词行为也值得进行模型特定的测试。一个 3 月 30 日的 GitHub issue 报告称,当用户向独立的开源权重 Qwen3-ASR 0.6B 流式模型提供热词时出现重复输出。该 issue 后来被关闭,理由为不在计划之内。该问题并不构成 Qwen-Audio-3.0-ASR-Flash 的缺陷证明,但它仍说明了过于积极地将识别偏置到词汇列表的风险:当出现相似语音时,模型可能会开始插入首选术语。

A low-cost route into Alibaba Cloud

Alibaba 在其 当前记录的价格 中显示,非实时的 Qwen3-ASR-Flash 在国际和美区部署的费用为每秒 $0.000035,约合每小时音频 $0.126。记录的实时服务在国际上的费用为每秒 $0.000090,约合每小时 $0.324。符合条件的国际账户可获得所列 ASR 模型的 10 小时免费配额。

该定价使开发者可以用真实的医疗、工业或编程音频以低成本运行针对性评估。它也推动了 Alibaba 将 Qwen 采纳转化为经常性云推理收入的更大努力。在 ASR 公告前三天,RuntimeWire 报道称 Alibaba 正在 提供 21 亿 QwenCloud 代币以换取 agent 反馈,这是另一个旨在将开发者纳入 Alibaba 托管模型栈的项目。

Qwen-Audio-3.0-ASR-Flash 为该战略提供了一个实际的切入点。语音识别位于靠近可创收的工作流处,领域错误也容易被客户识别和量化。Alibaba 提供了令人鼓舞的内部表格和激进的使用定价。下一步的考验在于新宣称的能力是否会以清晰的 API 标识出现,并在开发者实际投产的杂乱音频上重现这些增益。

Reader comments

Conversation for this story loads after sign-in.