TestMu AI lanza Agent Assurance para evaluar agentes de IA en función de sus efectos

La empresa anteriormente conocida como LambdaTest está ampliando su pila de aseguramiento de la calidad para incluir agentes que escriben archivos, invocan herramientas y acceden a APIs.

By · Published

Primary source: PR Newswire

Why it matters

AI agents can produce convincing transcripts while taking the wrong action. TestMu AI is trying to make observable system changes and criteria it cannot verify part of the release decision.

TestMu AI's Agent Assurance interface on a vast digital network, displaying a diff view of an AI agent's changes to code, files, and API calls.

TestMu AI, fundada por Asad Khan, Jay Singh y Mayank Bhola, ha lanzado Agent Assurance, ampliando su plataforma de pruebas de software a agentes de IA que pueden modificar archivos, invocar herramientas, acceder a APIs y abrir pull requests.

El nuevo producto evalúa los efectos observables del trabajo de un agente. TestMu AI dice que lee la base de código de un agente, genera escenarios funcionales, no funcionales y adversariales, ejecuta al agente y verifica los archivos resultantes, los artefactos y las llamadas a herramientas. Eso desplaza la prueba desde la respuesta final del agente o su actividad auto-reportada hacia los sistemas que realmente tocó.

Para Khan, el lanzamiento lleva a TestMu AI más profundamente al campo donde comenzó su carrera. La biografía de TestMu AI dice que trabajó como lead engineer en GlobalLogic antes de cofundar 360logica, una empresa de servicios de pruebas de software adquirida posteriormente por Saksoft. Khan y Singh comenzaron LambdaTest en 2017 como un servicio en la nube para ejecutar pruebas web y móviles en distintos navegadores, sistemas operativos y dispositivos.

Bhola, cofundador y head of products de TestMu AI, ocupó previamente roles de producto e ingeniería en Zomato, PressPlay TV y Juggernaut Books. Singh aportó el lado comercial y de clientes, habiendo fundado previamente BusinessMojos y VisualMojos y ocupado puestos en LeadSquared y Harman International.

Esa combinación explica la dirección del producto. TestMu AI está aplicando prácticas familiares de aseguramiento de calidad, incluidas pruebas de regresión, pruebas de humo, puertas de CI y retención de evidencia, a agentes cuyo comportamiento puede cambiar entre ejecuciones y cuyas fallas pueden ir más allá de una ventana de chat.

Un tercer veredicto para lo que el sistema no puede verificar

La parte más útil de Agent Assurance puede ser su tratamiento de la evidencia faltante.

Los materiales del lanzamiento de TestMu AI asignan a los criterios de validación uno de tres resultados: Aprobado, Falló o No se puede verificar, y describen la porción no verificada de los resultados como una brecha de aseguramiento. Esa brecha queda excluida de la tasa de aprobados y puede reducirse haciendo a los agentes más observables.

Esa distinción importa porque un agente puede parecer exitoso dejando poca prueba de lo que ocurrió. Un arnés de prueba puede ver la respuesta final sin poder establecer si el archivo correcto cambió, si se llamó a la API aprobada o si se usó una herramienta no declarada. Marcar un criterio como No se puede verificar mantiene esa incertidumbre visible en lugar de tratarla como un aprobado.

"La historia que un agente cuenta sobre lo que hizo es la evidencia más débil disponible sobre sus acciones", dijo Vipul Verma, senior vice president of group engineering de TestMu AI, en el anuncio de lanzamiento.

Un resultado de No se puede verificar también establece un límite en la afirmación de TestMu AI. Muestra que el sistema de pruebas careció de evidencia suficiente para confirmar un criterio. No establece que un agente sea seguro en producción, y TestMu AI no ha publicado resultados independientes que conecten sus resultados de validación con menos incidentes de seguridad o fallas operativas. Evidencia más sólida tendrá que provenir de pruebas contra agentes que operen a través de sistemas corporativos reales.

De los requisitos a la canalización de CI

El flujo de trabajo documentado de pruebas para agentes de TestMu AI comienza con un endpoint de la API del agente y materiales de requisitos como prompts, documentos de requisitos de producto, bases de conocimiento, PDFs o archivos DOCX. La plataforma usa esos materiales para generar escenarios de prueba. El anuncio de lanzamiento dice que los equipos pueden invocar a un agente mediante un comando, un endpoint HTTP, un servidor MCP o un flujo de trabajo construido en una plataforma como n8n.

Los escenarios generados incluyen por defecto inyección de prompts, anulación de instrucciones y mal uso de herramientas, según el anuncio. TestMu AI también dice que sus informes distinguen escenarios que fallan de forma nueva, los que se corrigieron recientemente y los escenarios inestables. El comunicado de lanzamiento afirma que sus comandos de CI distinguen una falla del agente de una falla del entorno.

Este es un movimiento deliberado hacia un territorio ya atendido por productos de evaluación y observabilidad. LangSmith, por ejemplo, soporta evaluaciones previas al despliegue y en producción, pruebas de regresión y evaluaciones de trayectorias de agentes y llamadas a herramientas.

La distinción que propone TestMu AI es la capa de evidencia. El anuncio de lanzamiento dice que Agent Assurance verifica archivos, artefactos y llamadas a herramientas contra la interfaz de herramientas declarada por el agente, mientras que sus materiales de producto marcan los criterios de validación que no puede confirmar. Esas afirmaciones se basan por ahora en los materiales de producto de TestMu AI; el lanzamiento no incluye ningún estudio de caso de clientes, prueba comparativa o auditoría independiente del sistema de agentes autónomos.

El rebranding de LambdaTest empieza a hacer honor a su nombre

Agent Assurance sigue al rebranding como TestMu AI de LambdaTest el 12 de enero. El cambio de nombre prometía un giro desde las pruebas de navegadores y dispositivos hacia una plataforma de calidad nativa de IA donde los agentes planifican, escriben, ejecutan y analizan pruebas.

Los fundadores financiaron esa expansión antes del rebranding. En diciembre de 2024, LambdaTest recaudó $38 millones en una ronda liderada por Avataar Venture Partners, con Qualcomm Ventures y los inversionistas existentes participando. Singh dijo a Moneycontrol que el capital financiaría ingeniería e investigación para la línea de productos de IA. Entre los patrocinadores anteriores nombrados por TestMu AI se encuentran Peak XV, Premji Invest, Blume Ventures y Titanium Ventures.

El servicio original de pruebas cross-browser le dio a la compañía una base instalada para el siguiente acto. TestMu AI dice que tiene más de 3 millones de usuarios a nivel mundial. Esa cifra reportada por la empresa cubre la plataforma más amplia y no establece la adopción de Agent Assurance.

TestMu AI dice que su categoría de agentes conversacionales está disponible para chat, voz, teléfono, imágenes y video. Su producto de pruebas para agentes de video coloca a una persona simulada en una sesión de video en vivo y vincula cada veredicto con el momento relevante en la grabación. El anuncio de lanzamiento dice que las pruebas de agentes autónomos se ejecutan desde una herramienta de terminal llamada Rook, con modelos que operan mediante el controlador de TestMu AI para que los desarrolladores no necesiten claves de proveedor locales.

Los fundadores apuestan a que la capa de pruebas que construyeron para navegadores y dispositivos móviles puede convertirse en un punto de control para el software que actúa por su cuenta. Agent Assurance le da a esa apuesta una idea organizadora creíble: los criterios aprobatorios deberían llevar evidencia observable, mientras que los criterios que el sistema no puede confirmar deberían permanecer claramente marcados. El trabajo difícil comienza cuando los equipos lo aplican a agentes capaces de modificar sistemas corporativos reales.

Reader comments

Conversation for this story loads after sign-in.