Fish Audio recauda 50 millones de dólares en ronda semilla para modelos de voz con pesos abiertos
Fish Audio, de Rissa Cao y Shijia Liao, reporta $21 millones en ARR mientras convierte modelos de voz con pesos abiertos y la adopción por parte de creadores en un impulso de API empresarial.
By Ryan Merket · Published
Primary source: TechCrunch
Why it matters
Fish Audio is testing whether open-weight distribution can create a fast route into paid enterprise API sales. Its user-uploaded voice library also makes consent, ownership verification and takedown systems core product infrastructure.

Rissa Cao y Shijia Liao han recaudado una ronda semilla de 50 millones de dólares para Fish Audio, sumando capital a un desarrollador de voces con IA con sede en Palo Alto que creció desde el proyecto de investigación de Liao en una sola GPU hasta convertirse en una plataforma para creadores y proveedor de API para empresas. TechCrunch informó sobre la financiación el 28 de julio.
Coreline Ventures y Capital Today lideraron la ronda. El grupo de inversores también incluyó a 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0. Fish Audio no reveló una valoración.
Liao, cofundador y director científico de Fish Audio, trabajó anteriormente como investigador en Nvidia. Inició Fish Speech tras frustrarse con voces sintéticas que podían sonar expresivas en un clip corto pero no lograban mantener esa calidad en pasajes más largos. Liao entrenó el primer modelo en una sola GPU y publicó el código. El repositorio resultante, Fish Speech, ha acumulado más de 31,000 estrellas en GitHub, según TechCrunch.
Cao, cofundadora y CEO de Fish Audio, está liderando el empuje comercial mientras Fish Audio intenta convertir el acceso público a modelos y la adopción por parte de creadores en demanda de API empresariales.
Una amplia semilla detrás de la tracción autodeclarada
Fish Audio dice que sus modelos alojados y descargables han alcanzado a más de 8 millones de usuarios y 21 millones de dólares en ingresos recurrentes anuales desde su lanzamiento en 2025. La cifra de usuarios combina personas que usan modelos de pesos abiertos con usuarios de los productos alojados de Fish Audio, por lo que no debe interpretarse como un conteo de clientes de pago.
Fish Audio ha lanzado cinco modelos en el último año, incluidos cuatro sistemas de generación de voz y un modelo de reconocimiento de voz (speech-to-text). Tres de los lanzamientos de generación de voz se han puesto a disposición con pesos descargables. Fish Audio vende suscripciones para creadores, APIs basadas en uso y acceso empresarial, y dice que HeyGen, Sanas y Plaud usan su tecnología.
La financiación les da a Cao y a Liao margen para perseguir dos tareas costosas a la vez: entrenar modelos de audio más grandes y construir las funciones de ventas, soporte y confiabilidad que requieren los clientes empresariales.
Los pesos abiertos alimentan un negocio de API de pago
Fish Audio usa pesos de modelo descargables para atraer a desarrolladores y vende acceso a la API basado en uso. La documentación de precios de Fish Audio lista el acceso a la API s2-pro/s1 en $15 por millón de bytes UTF-8.
Fish Audio también ha trabajado para reducir el costo de cómputo detrás de esa API. En una publicación de ingeniería sobre su pila de inferencia, Fish Audio dice que reconstruyó su canal de inferencia para reducir el costo de cómputo asociado al acceso a la API S2 Pro.
El lanzamiento subyacente S2 incluye pesos de modelo, código de ajuste fino y un motor de inferencia basado en SGLang. Fish Audio afirma que S2 Pro se entrenó con más de 10 millones de horas de audio y soporta más de 80 idiomas; su informe técnico S2 describe un preentrenamiento en más de 10 millones de horas a lo largo de aproximadamente 80 idiomas y dialectos. El informe también indica que S2 puede comenzar a transmitir audio en alrededor de 100 milisegundos en una H200. Fish Audio diseñó el modelo para seguir instrucciones en lenguaje natural relativas a la emoción, el ritmo y el comportamiento del hablante.
Fish Audio entra al mercado empresarial frente a competidores con fuerte financiamiento. ElevenLabs dijo en febrero que recaudó 500 millones de dólares con una valoración de 11,000 millones, con productos que abarcan agentes de voz, herramientas para creadores y APIs para desarrolladores. La apuesta de Fish Audio es que el acceso público a modelos, costos de servicio más bajos y controles de voz de grano fino pueden producir una ruta menos intensiva en capital hacia muchas de las mismas cuentas.
La propiedad de la voz se convierte en infraestructura
El modelo de distribución para creadores de Fish Audio conlleva un riesgo de derechos y consentimiento. El sitio web de Fish Audio publicita una biblioteca de más de 2 millones de voces, muchas subidas por usuarios. En junio, el sindicato británico de intérpretes Equity dijo que había exigido que Fish Audio eliminara voces clonadas no autorizadas de la plataforma.
Esas alegaciones muestran por qué la notificación, la verificación de propiedad y las retiradas son funciones operativas centrales para Fish Audio a medida que crece su biblioteca de voces subidas por usuarios.
Los 50 millones de dólares proporcionan a Cao y a Liao los recursos para impulsar un proyecto de investigación de pesos abiertos más profundamente hacia la infraestructura de voz comercial. Su próxima prueba es si la adopción por parte de desarrolladores puede seguir llenando la canalización de ventas mientras los contratos empresariales pagan el entrenamiento de modelos, la capacidad de cómputo y los controles de derechos.