Gradium abre la beta de TTS para números de teléfono, correos electrónicos y códigos financieros
El modelo exclusivo para API tiene como objetivo eliminar las reglas frágiles de normalización de texto, ofreciendo 1 millón de créditos por retroalimentación sobre casos de producción.
By Ryan Merket · Published
Primary source: X - Gradium
Why it matters
Voice agents fail when they misread the identifiers needed to finish a call. Gradium is moving that normalization work into the model and using customer failures to train the next production release. ([gradium.ai](https://gradium.ai/blog/gradium-tts-public-beta))

Gradium, el desarrollador de IA de voz dirigido por el cofundador y CEO Neil Zeghidour (@neilzegh), abrió una beta pública el 30 de julio para un modelo de texto a voz diseñado para pronunciar las cadenas que rutinariamente hacen fallar a los agentes de voz, incluidos números de teléfono, direcciones de correo electrónico, IBAN y expresiones de tiempo. Gradium anunció el lanzamiento en una publicación en X y puso el modelo a disposición a través de su API bajo el nombre gradium-tts-beta. (gradium.ai)
https://x.com/gradiumai/status/2082895563712815458?s=46
La beta continúa el trabajo que Gradium inició con una actualización de TTS de producción en junio. Gradium dice que el nuevo modelo puede procesar entradas difíciles directamente, sin que los desarrolladores tengan que mantener una capa separada de prompts, expresiones regulares y reglas de normalización de texto. Los casos objetivo se extienden más allá de los ejemplos principales para incluir nombres de cuenta, medidas, códigos de referencia, placas de matrícula, URLs y ordinales. El modelo de producción sigue siendo el predeterminado, por lo que los clientes deben optar explícitamente por la beta. (gradium.ai)
Ese enfoque refleja la trayectoria de Zeghidour en el mercado. Antes de fundar Gradium, trabajó en audio generativo en Google Brain, Google DeepMind y Meta. Fundó Gradium con el CTO Olivier Teboul, el Chief Coding Officer Laurent Mazare y el Chief Science Officer Alexandre Defossez. El grupo trabajó previamente en Kyutai, el laboratorio de investigación de París que lanzó sistemas de habla conversacional en tiempo real, y Gradium dice que sus fundadores ayudaron a desarrollar y abrir el código fuente de códecs de audio neuronales y modelos de lenguaje de audio. (gradium.ai)
Eliminando una dependencia de producción
Los sistemas de texto a voz pueden sonar naturales en prosa ordinaria mientras fallan con la información estructurada que conlleva el mayor riesgo operativo. Un número de devolución mal leído puede terminar una interacción de atención al cliente. Una dirección de correo electrónico hablada se vuelve inútil si el modelo maneja mal la puntuación. Los identificadores financieros y los códigos de referencia deben preservar cada carácter y la agrupación que los oyentes esperan en su idioma.
Los desarrolladores comúnmente abordan esas fallas antes de la inferencia, reescribiendo las entradas en formas fonéticas o expandidas. Eso añade otro componente a la pila de voz y crea casos límite específicos por idioma que los equipos de ingeniería deben probar y mantener. El objetivo declarado de Gradium para la beta es más simple: las aplicaciones deberían poder enviar texto directamente desde una base de datos o un modelo de lenguaje y recibir una versión hablada utilizable sin preprocesamiento. (gradium.ai)
El modelo está disponible a través del SDK de Python de Gradium y de la API WebSocket en tiempo real. Los desarrolladores lo seleccionan pasando gradium-tts-beta como nombre de modelo. Las voces existentes de Gradium, incluidas las voces personalizadas, se transfieren sin necesidad de migración. Gradium ha limitado la beta a usuarios de la API en lugar de convertirla en el predeterminado en producción, dando a los clientes un camino controlado para probar el modelo con su propio tráfico. (gradium.ai)
Gradium está ofreciendo 1 millón de créditos a cada participante de la beta que envíe retroalimentación basada en un caso de producción. Según la tasa de conversión publicada por Gradium (un crédito por carácter TTS) y aproximadamente 45,000 caracteres por hora de audio generado, ese incentivo representa alrededor de 22 horas de síntesis. Los participantes deben proporcionar el texto de entrada, el idioma, la voz y la salida esperada, lo que le da a Gradium un flujo de casos de falla para usar en el refinamiento del modelo. (gradium.ai)
La oferta de retroalimentación es central para el lanzamiento. Las cadenas estructuradas tienen demasiados formatos regionales, abreviaturas y convenciones de pronunciación como para cubrirlas con un benchmark limpio únicamente. Gradium está usando las cargas de trabajo de los clientes para encontrar la cola larga, mientras pide a los desarrolladores que juzguen la beta con las entradas exactas vinculadas a llamadas de soporte, verificación de cuentas y otras aplicaciones en vivo.
Una pila de voz fuertemente financiada
Gradium se lanzó públicamente en diciembre de 2025 con una ronda semilla de $70 millones liderada por FirstMark y Eurazeo. El 8 de julio, Gradium dijo que había ampliado la ronda a $100 millones y añadió a NVIDIA como inversor. Gradium dijo que la financiación financiaría investigación, desarrollo de producto, expansión internacional y una oficina en el Área de la Bahía de San Francisco. (gradium.ai)
El capital le da a Gradium margen para competir en un mercado de voz que incluye a ElevenLabs, Cartesia, Inworld y productos de voz de proveedores de modelos grandes. Gradium ha concentrado su propuesta en infraestructura en tiempo real: generación de voz, transcripción, traducción, clonación de voz y detección de turno que pueden ensamblarse en agentes interactivos. Gradium dice que comenzó a generar ingresos en semanas tras el lanzamiento y atiende a clientes en salud, experiencia del cliente, medios, agentes de IA y aplicaciones de consumo, aunque las cifras siguen siendo reportadas por la compañía. (gradium.ai)
La beta pública estrecha esa amplia estrategia de plataforma hacia un problema de ingeniería específico. Gradium apuesta a que los proveedores de voz competirán en si sus modelos sobreviven a los datos comerciales ordinarios, no simplemente en si una demostración suena humana. Los números de teléfono, las direcciones de correo electrónico y los identificadores bancarios son demos menos dramáticos que las voces clonadas expresivas. Deciden si un agente de voz puede completar la tarea para la que fue desplegado.