Telnyx añade Kimi K3 de Moonshot, de 2.8 billones de parámetros, a su API de inferencia

David Casem apuesta a que Telnyx puede combinar un modelo open-weight a escala "frontier" con la infraestructura de red, voz y mensajería que los agentes necesitan.

By · Published

Primary source: Telnyx

Why it matters

Kimi K3 became available from multiple inference providers within days of its weights release. Telnyx's advantage will depend on integrating inference with voice and network infrastructure, since access to the model is already widespread.

Illustration of Telnyx linking Moonshot's 2.8 trillion-parameter Kimi K3 to a vast network of AI agents flowing like a natural phenomenon.

Telnyx dijo en una nota de lanzamiento del 28 de julio que Kimi K3 de Moonshot AI está disponible a través de la Telnyx Inference API. Telnyx está dirigida por el cofundador y CEO David Casem.

El comunicado avanza una estrategia hacia la que Casem ha estado construyendo desde un punto de partida poco habitual. Ingeniero autodidacta que estudió economía en Swarthmore College, Casem fundó Telnyx en 2009 y construyó su primer sistema telefónico con software de código abierto y una licencia de la FCC. Telnyx pasó los años siguientes convirtiendo infraestructura de operador, números telefónicos y redes de comunicaciones en APIs. Casem está aplicando la misma hoja de juego a la inferencia de IA: poseer la infraestructura cara, ocultar su complejidad operativa y cobrar a los desarrolladores por lo que usan.

Kimi K3 proviene de Moonshot AI, fundada a principios de 2023 y dirigida por Yang Zhilin. Yang obtuvo un doctorado en ciencias de la computación en Carnegie Mellon University y coescribió los influyentes trabajos Transformer-XL y XLNet. Ese historial de investigación importa aquí: Moonshot AI ha construido su identidad de producto alrededor de modelos de contexto largo, y K3 extiende esa tesis a una ventana de contexto de un millón de tokens.

La nota del 28 de julio de Telnyx dice que K3 ya está disponible a través de su API alojada. Los materiales de Kimi K3 de Moonshot AI describen 2.8 billones de parámetros totales, 104 mil millones de parámetros activos y una arquitectura mixture-of-experts, mientras que la página oficial de Kimi K3 en Hugging Face posiciona a K3 como un lanzamiento con pesos abiertos.

Inferencia a escala de vanguardia sin el clúster

El recuento de parámetros destacado de Kimi K3 exagera cuánto del modelo se ejecuta por cada token, ya que solo 104 mil millones de parámetros están activos a la vez. El tamaño total aún crea un problema exigente de servicio.

Telnyx está vendiendo acceso a esa maquinaria a través de una API de inferencia compatible con OpenAI. Los desarrolladores seleccionan moonshotai/Kimi-K3, envían solicitudes mediante una interfaz familiar de chat-completions y dejan el aprovisionamiento de GPU a Telnyx. Telnyx también remite a los desarrolladores a su documentación de Inference para detalles de implementación. La nota de lanzamiento de Telnyx dice que la API soporta function calling, carga dinámica de herramientas, salida restringida por JSON Schema y caché automática de prompts. El esfuerzo de razonamiento puede ajustarse a bajo, alto o máximo.

El modelo acepta entradas de texto, imagen y video, mientras que su ventana de contexto alcanza 1,048,576 tokens. Esas especificaciones hacen a Kimi K3 relevante para repositorios de código largos, colecciones de documentos y sesiones de agentes que necesitan conservar un contexto de trabajo sustancial. No garantizan resultados útiles a lo largo de toda esa ventana.

Telnyx cobra $0.27 por millón de tokens de entrada en caché, $2.70 por millón de tokens de entrada sin caché y $13.50 por millón de tokens de salida. El caché de prompts podría cambiar materialmente la factura para agentes que envían repetidamente las mismas instrucciones del sistema, definiciones de herramientas o contexto de repositorio. La salida sigue siendo el lado caro de la solicitud, dando a los desarrolladores un incentivo para controlar la longitud de la respuesta y los bucles de agente.

Telnyx afirma que Kimi K3 compite con modelos propietarios de vanguardia en trabajo de codificación, razonamiento y agentes. Eso sigue siendo una afirmación de referencia por parte del proveedor en lugar de una prueba de que K3 igualará a modelos cerrados en un flujo de trabajo de producción concreto, por lo que los equipos deberían probar latencia, uso de herramientas y calidad de salida con sus propias cargas de trabajo antes de mover tráfico.

La apuesta de infraestructura de Casem

Kimi K3 llegó a servicios de inferencia alojados rápidamente después de su despliegue en julio. Fireworks AI también ha publicado su propia propuesta de hosting para Kimi K3, y los proveedores de inferencia pueden empaquetar el modelo, optimizar la pila de serving y competir en precio, velocidad, controles de datos y fiabilidad.

Telnyx se diferencia a través de la infraestructura que rodea al modelo. Telnyx opera APIs de comunicaciones, números telefónicos, speech-to-text, text-to-speech, mensajería y herramientas de agentes de voz junto con la inferencia. Un desarrollador que construya un agente basado en teléfono podría usar Telnyx para la llamada, la transcripción, la solicitud al modelo y la voz generada en lugar de juntar varios proveedores.

Telnyx expone esa posición en un ensayo de Telnyx sobre conectividad de IA, y su argumento más amplio es el control de la pila desde la red del operador hasta la inferencia de IA. Eso podría importarle a aplicaciones en tiempo real como agentes de voz, aunque Telnyx no ha publicado mediciones de latencia ni de rendimiento de K3 en la nota de lanzamiento.

Casem obtiene un modelo a escala de vanguardia que puede arrastrar tráfico de inferencia hacia la pila más amplia de Telnyx. Cada parte aporta trabajo intensivo en capital: Moonshot AI entrenó el modelo, mientras que Telnyx opera la red y las GPUs que lo convierten en un endpoint de producción.

El término "código abierto" necesita precisión en este caso. Moonshot AI ha lanzado K3 bajo una Kimi K3 License personalizada. Algunas empresas de modelo-como-servicio con más de $20 millones en ingresos deben firmar un acuerdo separado con Moonshot antes de su uso comercial. Los términos personalizados hacen que "de pesos abiertos" sea la designación más precisa para K3.

El movimiento de Telnyx muestra lo rápido que un modelo de vanguardia puede convertirse en inventario de infraestructura. Moonshot AI construyó Kimi K3 como un modelo de pesos abiertos, y los proveedores de hosting se están moviendo para hacerlo invocable a través de APIs estándar. La apuesta de Casem es que el endpoint ganador será el que esté conectado al resto de la pila operativa de un agente, desde la inferencia hasta la red telefónica que lleva la conversación.

Reader comments

Conversation for this story loads after sign-in.