La prueba Kimi K3 de Composio encuentra una brecha de tokens de 6x entre harnesses de agentes
En 28 tareas, Kimi Code, Hermes y Claude Code completaron a tasas similares, mientras que la mediana del uso de tokens osciló entre 61,000 y 340,000.
By Ryan Merket · Published
Primary source: Composio on X
Why it matters
Agent economics depend on orchestration as well as model pricing. A poorly matched harness can multiply token use while producing nearly the same completion rate.

Composio, la empresa de infraestructura para agentes de IA fundada por Soham Ganatra (@GanatraSoham) y Karan Vaidya (@KaranVaidya6), dijo el miércoles que el Kimi K3 de Moonshot AI consumió casi seis veces más tokens en Claude Code que en Kimi Code al completar el mismo conjunto de tareas de agente con una tasa de éxito similar.
La prueba realizada por la empresa envió a Kimi K3 a través de Claude Code, Hermes de Nous Research y Kimi Code en 28 tareas idénticas. Kimi Code completó 22, Hermes completó 21 y Claude Code completó 20. La estrecha diferencia en las ejecuciones contrastó con una amplia brecha en el consumo de tokens: la tarea mediana usó 61,000 tokens en Kimi Code, 67,000 en Hermes y 340,000 en Claude Code. Composio también informó que tareas individuales podían consumir hasta 30 veces más tokens en un arnés que en otro. (x.com)
Hermes registró el tiempo mediano de finalización más corto, con 179 segundos. Kimi Code tomó 297 segundos, mientras que Claude Code tomó 348 segundos, según Composio. Esas cifras hacen de Hermes el líder en velocidad en esta pequeña prueba y de Kimi Code el líder en eficiencia de tokens.
Los resultados son importantes porque los desarrolladores suelen comparar modelos de agentes usando tasas de finalización y puntuaciones de benchmark. La prueba de Composio mantuvo el modelo constante y cambió el software a su alrededor: el prompt del sistema, el bucle de herramientas, la gestión de contexto y otras decisiones de orquestación descritas colectivamente como el arnés. En esta ejecución, esas decisiones produjeron una diferencia económica mayor que la brecha en la tasa de éxito.
Kimi advierte que la compatibilidad del arnés importa
El propio blog técnico de Kimi K3 de Moonshot ofrece una importante salvedad. K3 fue entrenado para preservar su historial de pensamiento, y Moonshot advierte que el rendimiento puede volverse inestable cuando un arnés no devuelve correctamente ese historial. Moonshot recomienda un arnés verificado y compatible, como Kimi Code, y desaconseja cambiar de modelo durante una sesión. (kimi.com)
Eso convierte el resultado de Composio en una prueba del emparejamiento modelo-arnés más que en un veredicto general sobre Claude Code. Un arnés optimizado alrededor del contexto y el comportamiento de razonamiento de una familia de modelos puede imponer una sobrecarga sustancial cuando se usa con otra. La propia Moonshot usa diferentes arneses en los benchmarks incluidos en los materiales de lanzamiento de K3, incluyendo Kimi Code, Claude Code y Codex.
La brecha de tokens sigue teniendo un costo directo. Moonshot fija el precio de la entrada a la API de K3 en $3 por millón de tokens en caso de fallo de caché y $0.30 por millón en caso de acierto de caché, con la salida valorizada en $15 por millón de tokens. Las facturas reales dependen de la mezcla entrada-salida y del caching, pero un agente que recargue contexto repetidamente o realice pasos innecesarios en el bucle de herramientas puede borrar los ahorros de elegir un modelo más barato. (kimi.com)
La muestra de 28 tareas de Composio es orientativa, y el benchmark proviene de un proveedor con un interés comercial en la capa de orquestación. Composio vende infraestructura para conectar agentes a más de 1,000 herramientas, incluyendo autenticación, ejecución de herramientas y gestión de contexto. Su conclusión de que los desarrolladores deberían inspeccionar el arnés antes de reemplazar el modelo refuerza la categoría de producto que están construyendo Ganatra y Vaidya. (composio.dev)
Composio apuesta por la capa que rodea al modelo
El interés de Ganatra en esa capa empezó antes de que se formara el mercado actual de agentes de codificación. Dijo en una entrevista de 2025 que se enfrentó al costo de mantener integraciones de software mientras trabajaba como ingeniero fundador y más tarde como engineering and product manager en la startup de fraude y riesgo Bureau. Se fue alrededor de abril o mayo de 2023 para construir Composio después de concluir que mejorar los modelos de generación de código podría automatizar parte de ese trabajo de integración. (pmf.show)
Vaidya, CTO de Composio, menciona a Google y Rubrik entre sus paradas previas en su sitio personal. Ambos fundadores se graduaron del programa de ciencias de la computación de IIT Bombay en 2017, según la oficina de exalumnos de la universidad. (acr.iitbombay.org)
El 22 de julio de 2025, Composio anunció una Serie A de $25 millones liderada por Lightspeed Venture Partners, llevando su financiación total reportada a $29 millones. La ronda incluyó al CEO de Vercel, Guillermo Rauch; al cofundador de HubSpot, Dharmesh Shah; SV Angel, Operator Partners, Elevation Capital y Together Fund. Composio dijo en ese momento que su plataforma atendía a más de 100,000 desarrolladores y 200 startups y empresas; esas cifras siguen siendo reportadas por la compañía. (prnewswire.com)
Kimi K3 ofrece a Composio una demostración oportuna de la apuesta detrás de esa financiación. Los modelos de última generación llegan cada vez más con requisitos específicos para el historial de pensamiento, la compactación de contexto, los formatos de herramientas y los controles de razonamiento. El arnés decide si esos requisitos se convierten en una ejecución eficiente o en un bucle costoso. La prueba de Composio pone un número a ese riesgo de implementación: una finalización de tareas similar puede ocultar una diferencia mediana de seis veces en el uso de tokens.