Fish Audio 获得5000万美元种子轮融资,用于开放权重语音模型

Rissa Cao 和 Shijia Liao 的 Fish Audio 报告 ARR 为 2100 万美元,并将开放权重语音模型与创作者采纳转化为面向企业的 API 推动。

By · Published

Primary source: TechCrunch

Why it matters

Fish Audio is testing whether open-weight distribution can create a fast route into paid enterprise API sales. Its user-uploaded voice library also makes consent, ownership verification and takedown systems core product infrastructure.

Stylized human profile interacting with abstract sound and data streams (Flat modernist vector illustration with subtle textured overprint)

Rissa Cao 和 Shijia Liao 为 Fish Audio 完成了 5,000 万美元的种子轮融资,为这家总部位于 Palo Alto 的 AI 语音开发商注入资本,该公司从 Liao 的单 GPU 研究项目发展成一个创作者平台和企业 API 提供商。TechCrunch 在 7 月 28 日报道了该轮融资

Coreline Ventures 和 Capital Today 领投了本轮融资。投资方还包括 359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 和 HF0。Fish Audio 未披露估值。

Liao,Fish Audio 的联合创始人兼首席科学家,曾在 Nvidia 担任研究员。他在对合成语音感到失望后创办了 Fish Speech,原因是那些语音在短片段里可能听起来富有表现力,但无法在更长的段落中维持该质量。Liao 在单 GPU 上训练了第一个模型并公开发布了代码。据 TechCrunch 报道,随之产生的 Fish Speech 仓库 在 GitHub 上收获了超过 31,000 个星标。

Cao,Fish Audio 的联合创始人兼 CEO,正在主导商业化推进,试图将公开模型访问和创作者采用转化为企业 API 的需求。

支撑自报业绩的大额种子轮

Fish Audio 表示,自 2025 年推出以来,其托管和可下载模型的用户已超过 800 万,年经常性收入达到 2,100 万美元。该用户数字将使用开源权重模型的用户与 Fish Audio 托管产品的用户合并计算,因此不应被视为付费客户数量。

过去一年中,Fish Audio 推出了五个模型,包括四个语音生成系统和一个语音转文本模型。其中三个语音生成版本已提供可下载的权重文件。Fish Audio 销售面向创作者的订阅、按使用量计费的 API 以及企业接入,并表示 HeyGen、Sanas 和 Plaud 在使用其技术。

这笔融资为 Cao 和 Liao 提供了同时推进两项昂贵任务的空间:训练更大的音频模型,以及构建企业客户所需的销售、支持和可靠性功能。

开放权重推动付费 API 业务

Fish Audio 使用可下载的模型权重来吸引开发者,并销售按使用量计费的 API 访问。Fish Audio 的 定价文档 列出 s2-pro/s1 API 访问为每百万 UTF-8 字节 15 美元。

Fish Audio 也在努力降低该 API 背后的计算成本。在一篇 关于其推理栈的工程文章 中,Fish Audio 表示已重建其推理流水线,以降低 S2 Pro API 访问的计算成本。

底层的 S2 发布 包括模型权重、微调代码和基于 SGLang 的推理引擎。Fish Audio 表示 S2 Pro 在超过 1,000 万小时的音频上进行训练,并支持 80 多种语言;其 S2 技术报告 描述了在大约 80 种语言和方言上进行的超过 1,000 万小时的预训练。报告还称,S2 在 H200 上大约 100 毫秒即可开始流式传输音频。Fish Audio 设计该模型以遵循关于情绪、节奏和说话者行为的自然语言指令。

Fish Audio 在进入企业市场时面临着资金充足的竞争对手。ElevenLabs 在 2 月份表示 它筹得了 5 亿美元,估值为 110 亿美元,其产品涵盖语音代理、创作者工具和开发者 API。Fish Audio 的赌注是,公开模型访问、更低的服务成本和细粒度的语音控制可以为进入许多相同客户提供一种资本投入较少的途径。

语音所有权成为基础设施

Fish Audio 的创作者分发模式带来了权利和同意风险。Fish Audio 网站 宣传了一个拥有超过 200 万条语音的库,其中许多是用户上传的。6 月,英国表演者工会 Equity 表示它已要求 Fish Audio 从平台上移除未经授权的克隆声音

这些指控显示了随着用户上传语音库的增长,报告、所有权验证和下架操作为何成为 Fish Audio 的核心运营功能。

这笔 5,000 万美元的资金为 Cao 和 Liao 提供了将一个开放权重研究项目推进为商业语音基础设施的资源。他们接下来的考验是,开发者采用是否能持续填充销售管道,同时企业合约是否能为模型训练、计算能力和权利控制买单。

Reader comments

Conversation for this story loads after sign-in.