Gradium 开放针对电话号码、电子邮件和金融代码的 TTS 测试版

该仅限 API 的模型旨在消除脆弱的文本规范化规则,并为生产用例反馈提供 100 万积分。

By · Published

Primary source: X - Gradium

Why it matters

Voice agents fail when they misread the identifiers needed to finish a call. Gradium is moving that normalization work into the model and using customer failures to train the next production release. ([gradium.ai](https://gradium.ai/blog/gradium-tts-public-beta))

Gradium opens TTS beta for phone numbers, emails and financial codes

Gradium,这家由联合创始人兼首席执行官 Neil Zeghidour (@neilzegh) 领导的语音 AI 开发商,于 7 月 30 日开放了一个公开测试版,针对文本转语音模型,旨在正确发音那些经常让语音代理出错的字符串,包括电话号码、电子邮件地址、IBAN(国际银行账号)和时间表达式。Gradium 在 一篇 X 帖子中宣布了这次发布,并通过其 API 以 gradium-tts-beta 的名称提供该模型。(gradium.ai)

https://x.com/gradiumai/status/2082895563712815458?s=46

poster=/api/storage/public-objects/tweet-videos/gradium-opens-tts-beta-phone-numbers-emails-ibans-poster-91d7f56a.jpg|来自 @GradiumAI 在 X 的视频

该测试版延续了 Gradium 在 6 月进行的一次面向生产的 TTS 升级工作。Gradium 表示,新模型可以直接处理困难的输入,而无需开发者维护单独的提示层、正则表达式和文本规范化规则。目标用例超出了头条示例,还包括账户名、测量值、参考代码、车牌号、URL 和序数词。生产模型仍为默认,因此客户必须明确选择加入测试版。(gradium.ai)

这一重点反映了 Zeghidour 进入该市场的路径。在创办 Gradium 之前,他曾在 Google Brain、Google DeepMind 和 Meta 从事生成音频方面的工作。他与 CTO Olivier Teboul、首席编码官 Laurent Mazare 以及首席科学官 Alexandre Defossez 一起创立了 Gradium。该团队此前参与了 Kyutai——巴黎的一个研究实验室,曾发布实时对话语音系统,Gradium 表示其创始人帮助开发并开源了神经音频编解码器和音频语言模型。(gradium.ai)

移除生产依赖

文本转语音系统在普通散文上可能听起来自然,但在承载最多操作风险的结构化信息上却会失败。读错回拨号码可能会让一次客户服务互动中断。若模型处理标点错误,口述的电子邮件地址就变得无用。金融标识符和参考代码必须保留每个字符以及听众在其语言中期望的分组方式。

开发者通常在推理之前处理这些失败,将输入重写为语音化或展开形式。这为语音堆栈增加了另一个组件,并产生了工程团队必须测试和维护的语言特定边缘情况。Gradium 对该测试版的明确目标更简单:应用程序应能够直接将数据库或语言模型中的文本发送过来,并在无需预处理的情况下接收可用的口语版本。(gradium.ai)

该模型可通过 Gradium 的 Python SDK 和实时 WebSocket API 使用。开发者通过将 gradium-tts-beta 作为模型名称传递来选择它。现有的 Gradium 语音,包括自定义语音,无需迁移即可沿用。Gradium 已将测试版限制为 API 用户,而不是在生产中设置为默认,从而为客户提供一条受控路径,以便在自己的流量上测试该模型。(gradium.ai)

Gradium 向每位基于生产用例提交反馈的测试版参与者提供 100 万积分。按照 Gradium 公开的转换率——每个 TTS 字符 1 积分,以及每小时生成语音大约 45,000 字符计算,这种激励大约相当于 22 小时的合成。参与者必须提供输入文本、语言、语音和预期输出,从而为 Gradium 提供一系列用于改进模型的失败用例。(gradium.ai)

这一反馈提议是此次发布的核心。结构化字符串具有过多的区域格式、缩写和发音习惯,单靠一个干净的基准测试难以覆盖所有情况。Gradium 正在利用客户的工作负载来发现长尾问题,同时要求开发者根据与支持呼叫、账户验证和其他在线应用相关的精确输入来评判测试版。

资金雄厚的语音技术栈

Gradium 于 2025 年 12 月公开推出,获得了由 FirstMarkEurazeo 领投的 7000 万美元种子轮融资。7 月 8 日,Gradium 表示已将该轮融资扩大至 1 亿美元,并新增 NVIDIA 作为投资者。Gradium 表示,这笔融资将用于资助研究、产品开发、国际扩张以及在旧金山湾区设立办公室。(gradium.ai)

这笔资金为 Gradium 提供了在包括 ElevenLabs、Cartesia、Inworld 以及大型模型供应商的语音产品在内的语音市场中竞争的空间。Gradium 把其主张集中在实时基础设施上:语音生成、转录、翻译、语音克隆和回合检测,这些可以组装成交互式代理。Gradium 表示,其在上线数周内就开始产生收入,并为医疗保健、客户体验、媒体、AI 代理和消费者应用领域的客户提供服务,尽管这些数据仍为公司自行报告。(gradium.ai)

公开测试版将这一广泛的平台战略缩小到一个具体的工程问题上。Gradium 正在押注,语音提供商之间的竞争将取决于其模型是否能在普通业务数据上存活,而不仅仅是演示听起来是否像人声。电话号码、电子邮件地址和银行标识符比富有表现力的克隆语音做出的演示更不戏剧化,但它们决定了语音代理是否能完成其被部署来处理的任务。

Reader comments

Conversation for this story loads after sign-in.