Nous Research agrega transmisión de voz para acelerar los chats de voz de Hermes Agent

El agente de código abierto comienza a hablar mientras genera una respuesta, reduciendo el silencio incómodo que hace que las interfaces de voz de IA parezcan lentas.

By · Published

Primary source: X

Why it matters

Voice latency is a product problem as much as a model problem. Streaming lets Nous make Hermes feel faster while it builds paid hosting around an open-source, provider-agnostic agent.

Nous Research adds streaming speech to speed Hermes Agent voice chats

Ryan "Teknium" Teknium (@Teknium), un cofundador de Nous Research y su jefe de post-entrenamiento, dijo en X el miércoles que los chats de voz de Hermes Agent ahora transmiten habla desde la mayoría de los backends de texto a voz basados en API, acercando al asistente de código abierto a una conversación en vivo.

La implementación no hace que el modelo de lenguaje subyacente genere respuestas más rápido. Reduce la demora que los usuarios perciben al comenzar la reproducción de audio antes de que Hermes haya terminado de escribir su respuesta. Esa distinción importa en productos de voz, donde el silencio entre una pregunta y la primera palabra hablada puede hacer que un modelo capaz parezca poco receptivo.

Teknium ayudó a formar Nous Research como una comunidad de investigación en IA en Discord en 2022 antes de que se convirtiera en empresa en 2023. Según su sitio personal, anteriormente trabajó como ingeniero de datos de LLM en Stability AI y en modelos de lenguaje centrados en personajes en Digi AI. En Nous, ha liderado post-entrenamiento, evaluaciones y despliegue mientras ayudaba a construir la familia de modelos Hermes.

How Hermes streams an answer

La documentación de voz de Hermes Agent muestra que el sistema recopila el texto entrante del modelo hasta que tiene una oración completa de al menos 20 caracteres. Elimina markdown, emoji y etiquetas de razonamiento oculto, y luego envía esa oración al proveedor configurado de texto a voz mientras el modelo continúa generando el resto de su respuesta.

Hay dos niveles de transmisión dentro de esa canalización. ElevenLabs y OpenAI soportan audio PCM fragmentado, lo que permite a Hermes reproducir audio sin procesar a medida que el proveedor lo devuelve. Otros proveedores, incluida la opción predeterminada Edge TTS, sintetizan y reproducen cada oración después de que se completa. El primer enfoque ofrece la ruta más corta a la primera palabra audible; el segundo aún evita esperar la respuesta completa del modelo.

Nous dice que la misma canalización de voz opera en la interfaz de línea de comandos, la interfaz de terminal y la aplicación de escritorio. En la implementación de escritorio, el texto generado se mueve a través de un WebSocket vinculado a una sola respuesta, manteniendo la generación del modelo y la reproducción de audio en ejecución al mismo tiempo sin abrir una nueva conexión por cada oración.

Hermes también admite controles para interrumpir la reproducción. Un usuario puede comenzar a hablar encima de una respuesta, enviar otro mensaje o presionar la tecla de grabación para detener la reproducción. El siguiente prompt le indica al modelo que su respuesta anterior fue interrumpida, dándole contexto para continuar o cambiar de dirección.

El sistema de voz se encuentra dentro del proyecto más amplio de código abierto Hermes Agent, que combina memoria persistente, habilidades aprendidas, automatización del navegador, herramientas de codificación e integraciones de mensajería. Los usuarios pueden elegir su propio proveedor de modelo en lugar de estar limitados a un modelo de Nous, mientras que Nous Portal vende acceso a modelos alojados, herramientas y despliegues en la nube mediante una sola cuenta.

Nous is turning Hermes into a business

El trabajo sobre latencia llega mientras Nous construye una capa comercial alrededor de su agente de código abierto. TechCrunch informó el 13 de julio que Nous estaba finalizando al menos $75 million en financiamiento liderado por Robot Ventures, con una participación significativa de Union Square Ventures, a una valuación reportada de $1.5 billion. El reporte dijo que Nous había recaudado previamente $70 million de inversores que incluyen a Paradigm, Robot Ventures, North Island Ventures, Delphi Ventures, OSS Capital y Balaji Srinivasan.

Ese financiamiento reportado pone presión sobre Nous para convertir la adopción de Hermes en un producto alojado duradero. La voz es útil para ese impulso porque expande el agente más allá de sesiones escritas en terminal y bots de mensajería hacia trabajo manos libres, asistencia en el escritorio y conversaciones en vivo en Discord. La apertura comercial es directa: mantener las opciones de agente y proveedor abiertas, y luego cobrar a los usuarios que quieran que Nous suministre los modelos, servicios de voz, herramientas e infraestructura siempre activa.

La transmisión de voz aborda una parte estrecha de ese plan, pero es una parte con consecuencias. Los usuarios juzgan a un agente de voz durante la pausa después de dejar de hablar. Hermes ahora puede llenar esa pausa antes, sin requerir que Nous controle el modelo que genera la respuesta.

Reader comments

Conversation for this story loads after sign-in.