Owen Song lanza síntesis de voz completamente local en 9.36M parámetros

El desarrollador en solitario autofinanciado reconstruyó Inflect alrededor de un paquete de 37.53 MB, aceptando una voz y salida únicamente en inglés para mantener la inferencia local.

By · Published

Primary source: Hugging Face

Why it matters

Inflect packages the complete neural speech path into 37.53 MB, giving local applications a credible voice option while exposing the feature and reproducibility costs of extreme compression.

Diagram of Owen Song's Inflect, a 9.36M-parameter compact local speech synthesis system showing a single English voice and on-device inference.

El 24 de julio de 2026, Owen Song lanzó Inflect-Micro-v2, un modelo de texto a voz de 9,356,513 parámetros que transforma texto en inglés hasta una forma de onda a 24 kHz sin recurrir a un servicio alojado ni a un vocoder neuronal separado.

Song se describe como un desarrollador en solitario centrado en la eficiencia del aprendizaje automático. La ficha del modelo indica que construyó y financió Inflect v2 de forma independiente, y que ninguna empresa ni inversores externos están vinculados al proyecto.

Esa restricción moldeó el lanzamiento. Con v2, Song estaba probando hasta dónde se podía llevar una pila completa y diminuta de TTS mientras aún producía habla utilizable.

Un modelo completo dentro del conteo de parámetros

Las comparaciones entre modelos de voz pequeños pueden ocultar parte de la carga de despliegue al informar solo el tamaño del modelo acústico mientras omiten un vocoder separado. La cifra de 9.36 millones de Inflect cubre la ruta neuronal desplegada: codificación de texto, predicción de duraciones, generación latente de voz y el decodificador de forma de onda integrado. La normalización del inglés y el frontend de fonemas eSpeak-ng siguen ejecutándose como código convencional del lado de la CPU.

El repositorio de código abierto describe a Inflect como un sistema de la familia VITS con un codificador de texto tipo transformer, predicción estocástica de duraciones, flujos de acoplamiento residuales y un decodificador con reducción de aliasing. Song publicó el código y los pesos bajo Apache 2.0.

Inflect v2 está disponible en dos tamaños a través de la misma interfaz de Python. Micro usa 37.53 MB de pesos FP32 y prioriza la calidad de salida. Inflect-Nano-v2 contiene 3,966,721 parámetros en un paquete FP32 de 15.97 MB y prioriza la huella. Ambos soportan inferencia en CPU o CUDA, semillas deterministas, controles de velocidad y variación de entrega, y división consciente de puntuación para pasajes más largos.

Song también publicó una exportación ONNX verificada separada para CPU, CUDA y DirectML. El paquete ONNX mantiene eSpeak-ng y el frontend de Python fuera de sus dos grafos neuronales, que suman alrededor de 37.75 MB. No hay una versión cuantizada a enteros disponible; la documentación de Song indica que la cuantización básica de pesos puede dañar de forma audible el decodificador de forma de onda.

Los desarrolladores pueden probar Micro y Nano en el Inflect v2 playground. El runtime de referencia no es por streaming, por lo que devuelve un fragmento completo después de la síntesis en lugar de producir audio de forma incremental.

La evaluación comparativa es prometedora y adecuadamente limitada

Las cifras de rendimiento de Inflect provienen del propio paquete de evaluación de Song. Micro registró una tasa de preferencia del 66.2% en una prueba de escucha comunitaria anónima consistente en 21 victorias, 10 derrotas y tres empates. Eso son 34 comparaciones, y Song califica el resultado como evidencia descriptiva comunitaria en lugar de un estudio formal de Mean Opinion Score (MOS).

La ficha del modelo informa una puntuación UTMOS22 de 4.395, con un intervalo de confianza bootstrap del 95% de 4.381 a 4.408. UTMOS22 es un predictor aprendido de naturalidad, no una puntuación de escucha humana. Micro también registró una tasa de error de palabras (word-error rate) principal del 3.99% derivada del promedio de igual peso de las evaluaciones Qwen3-ASR y Nemotron 3.5. Su resultado separado con Whisper large-v3 fue de 2.73%.

En una instancia gestionada de Hugging Face con ocho CPU virtuales y cuatro hilos de framework, Micro generó audio a 6.28x tiempo real. Nano alcanzó 10.72x. Esos resultados respaldan la afirmación de Song de que funciona en CPU, aunque su propia comparación muestra sistemas compactos más rápidos: Piper Low alcanzó 31.37x y KittenTTS Nano alcanzó 13.33x bajo la prueba direccional.

Song no presenta a Inflect como el líder en velocidad. La corrida comparativa también usó una prueba más corta de 50 prompts mientras que el tiempo de ejecución principal de Inflect proviene de 100 prompts, y algunos rivales se ejecutaron mediante implementaciones ONNX optimizadas mientras Inflect usó su runtime canónico de PyTorch. La documentación mantiene esas diferencias visibles en lugar de aplanar los resultados en un único ranking.

KittenTTS Nano, uno de los puntos de referencia elegidos por Song, contiene 15 millones de parámetros y ofrece ocho voces. Inflect Micro es más pequeño y tiene un conjunto de funciones más reducido. Su ventaja es una ruta de síntesis compacta y autocontenida en lugar de amplitud.

Song mantuvo el alcance limitado

Inflect produce una única voz sintética masculina en inglés. No ofrece clonación de voz, selección de hablantes, salida multilingüe ni streaming acústico. Números, abreviaturas, nombres poco comunes y homógrafos aún pueden causar errores de pronunciación, mientras que fragmentos sintetizados de forma independiente pueden hacer que pasajes largos suenen menos coherentes.

El modelo no ha sido validado para comunicaciones médicas, legales, de emergencia o críticas para la accesibilidad. Song originalmente quería lanzar cuatro voces, escribió en una discusión tras el lanzamiento, pero recortó tres porque las adaptaciones no alcanzaban su umbral de calidad.

Esa contención le da a Inflect un perfil de despliegue claro. Un asistente local, un experimento en navegador, un dispositivo embebido o una aplicación offline pueden valorar más un paquete de voz de 37.53 MB y una salida determinista que la clonación de voces. Un sistema de atención al cliente que requiera muchas voces, idiomas, rango emocional o bajo tiempo hasta el primer audio necesitaría un modelo diferente.

El lanzamiento también es de peso abierto (open-weight) en lugar de completamente reproducible a partir de los datos crudos. Song publicó los pesos de inferencia, el código fuente, el frontend, los prompts de evaluación, los reportes y los hashes de integridad. La canalización de generación del corpus, la infraestructura de filtrado y la receta completa de optimización permanecen privadas. Reproducir la ejecución de entrenamiento o auditar la procedencia de sus datos, por tanto, requiere información fuera del paquete público.

La adopción determinará si Inflect se convierte en un proyecto más grande

El plan de Song para Inflect está ligado directamente a la demanda. Dice que una v3 podría añadir voces, idiomas, adaptación más sencilla y otra pasada de estabilidad si v2 encuentra audiencia. Está pidiendo a los usuarios texto exacto que falle, configuraciones del modelo, semillas y detalles de hardware, retroalimentación que puede convertir un lanzamiento independiente en un ciclo de desarrollo más sistemático.

El momento encaja con un empuje más amplio hacia modelos capaces que se ejecutan más cerca del usuario. RuntimeWire informó en junio que Hugging Face estaba orientando a los desarrolladores hacia la eficiencia de modelos pequeños, ya que los sistemas de open-weight se volvieron prácticos para más cargas de trabajo locales. Hugging Face es la plataforma de distribución de Inflect más que su desarrollador o inversor.

Para Song, el lanzamiento pone a prueba una proposición más difícil: si un desarrollador en solitario con recursos limitados de entrenamiento puede ganarse la atención haciendo que todo el sistema sea pequeño e inspeccionable. Inflect v2 ya supera el umbral técnico que estableció después de v1. Su siguiente umbral es la adopción, que decidirá si el proyecto se expande más allá de una voz inglesa compacta.

Reader comments

Conversation for this story loads after sign-in.