Deltix combina la exploración de aplicaciones con IA con pruebas de regresión reproducibles en iOS

Su agente para Mac mantiene los binarios de las aplicaciones de forma local, mientras que las capturas de pantalla y los datos de la interfaz aún viajan a la nube de Deltix y a Anthropic.

By · Published

Primary source: Deltix

Why it matters

Deltix is testing whether AI can discover a mobile flow once, then convert it into a repeatable regression check without sending the app binary to a testing cloud.

AI-driven iOS app testing architecture with local processing and cloud AI integration (Isotype infographic poster with mid-century pictograms)

Deltix está ofreciendo a los desarrolladores de iOS un agente de pruebas con IA que intenta tareas en inglés sencillo dentro de un simulador que se ejecuta localmente, registra dónde tiene éxito o se queda atascado, y convierte las ejecuciones exitosas en comprobaciones de regresión reutilizables.

El producto en beta abierta refleja una apuesta focalizada por parte de los creadores de Deltix: un probador con IA se vuelve más útil cuando su trabajo exploratorio puede preservarse como una prueba convencional. Un desarrollador puede pedirle al agente que "regístrate y envía tu primer mensaje", verlo navegar por la interfaz y guardar una ruta completada como un Playbook para compilaciones posteriores.

Deltix parte de una configuración deliberadamente restringida. Los desarrolladores instalan un Mac Agent nativo, conectan un iOS Simulator que ya se está ejecutando en la máquina y envían tareas a través de Deltix. El binario de la app, el código fuente y las identidades de firma permanecen locales. El agente basa sus acciones en la interfaz que encuentra, proporcionando a los desarrolladores una visión de cómo un usuario por primera vez podría avanzar a través de un flujo desconocido.

Ese enfoque le da a Deltix un punto de entrada práctico en las pruebas móviles. El producto inmediato no intenta reemplazar todas las capas de una pila de aseguramiento de la calidad. Se enfoca en la pregunta que a menudo sobrevive a una suite de pruebas unitarias marcada como "verde": ¿puede un usuario completar la tarea para la que el producto fue diseñado?

Convertir una exploración en una prueba

Deltix organiza el producto alrededor de tres modos. Task se encarga de la exploración puntual. Playbook guarda y repite una ruta exitosa. Experiment ejecuta la misma tarea contra dos compilaciones, permitiendo que un equipo de producto compare si una interfaz propuesta ayuda o impide que el agente termine.

La secuencia de la exploración a la reproducción es la elección de diseño importante. Las pruebas basadas en agentes pueden adaptarse a una interfaz y encontrarse con rutas que un desarrollador no guionó explícitamente. Las pruebas de regresión tienen un requisito diferente: los equipos necesitan comprobaciones repetibles cuyas fallas apunten a un cambio en el producto en lugar de a un cambio de opinión del modelo.

Deltix afirma que una ejecución exploratoria exitosa se convierte en un Playbook determinista usando las mismas interacciones y objetivos en compilaciones subsecuentes. Eso podría eliminar parte del mantenimiento de localizadores y aserciones asociado con las suites de XCUITest. Deltix no ha publicado datos comparativos de confiabilidad en su página de aterrizaje, por lo que la afirmación se juzgará en última instancia por cómo se comportan los Playbooks después de que cambien los diseños, las etiquetas, los tiempos y las dependencias del modelo.

Los términos de la beta de Deltix establecen un límite más cauteloso. Indican que los resultados de validación son orientativos y no se garantiza que sean exactos, completos o estables de una ejecución a otra. También colocan la responsabilidad de falsos positivos y falsos negativos en el desarrollador. La arquitectura atractiva separa el descubrimiento probabilístico de una ruta de reproducción fija; Deltix deberá dejar esa separación lo suficientemente clara para que los desarrolladores entiendan qué resultados se pueden confiar en un proceso de liberación.

La ejecución local aún envía datos de la interfaz a la nube

El modelo de agente local de Deltix limita uno de los costos mayores de probar un nuevo servicio de pruebas: los desarrolladores no tienen que subir su build ni su repositorio de código. El límite de privacidad es, sin embargo, más estrecho que en una prueba totalmente local.

El aviso de privacidad de Deltix indica que las capturas de pantalla, las capturas del árbol de accesibilidad, las descripciones de acciones y los metadatos de ejecución salen del Mac. Esa información se procesa a través de la infraestructura en la nube de Deltix y la API Claude de Anthropic para navegación, puntuación y autocuración. Los hallazgos, los Playbooks guardados y los datos de ejecución se almacenan en la base de datos de Deltix.

La distinción importa porque las pantallas de prueba pueden exponer credenciales, registros de clientes, información de salud y detalles internos del producto incluso cuando el binario subyacente nunca abandona la laptop del desarrollador. Deltix instruye a los usuarios a confiar en entornos de prueba y evitar datos de clientes en producción, credenciales, información de salud protegida, expedientes educativos y datos que involucren a menores de 13 años.

Según Deltix, los desarrolladores pueden proporcionar su propia clave de modelo, aunque los materiales públicos no describen un modo de inferencia completamente fuera de línea. Por lo tanto, el agente local se entiende mejor como ejecución local con razonamiento asistido en la nube, en lugar de un sistema de pruebas íntegramente en el dispositivo.

Las páginas públicas de Deltix también describen reglas de acceso distintas. La página de aterrizaje califica el producto como una beta abierta sin necesidad de invitación. El aviso de privacidad y los términos de la beta, ambos fechados el 6 de mayo de 2026, describen una beta solo por invitación centrada en Estados Unidos y Canadá. La discrepancia puede reflejar una ampliación de la beta, pero la copia legal actual aún ofrece a los usuarios potenciales una versión contradictoria sobre quién puede registrarse.

Una apertura estrecha en una categoría de pruebas concurrida

Deltix entra en un mercado donde la autoría de pruebas en lenguaje natural y la ejecución con autocuración ya se están convirtiendo en argumentos estándar. Momentic documenta pruebas en web, iOS y Android, con ejecución local y remota más soporte para CI. QualGent ejecuta pruebas en lenguaje natural en dispositivos iOS y Android reales en la nube. Waldo combina la exploración móvil manual con pruebas automatizadas en infraestructura remota.

El producto inicial de Deltix es más pequeño. Actualmente soporta un iOS Simulator en un Mac. Las pruebas en iPhone físico están listadas como en progreso, mientras que Android, una interfaz de línea de comandos para integración continua y el soporte para React Native y Flutter permanecen en la hoja de ruta.

Esa estrechez le da a Deltix una beta coherente. El Mac Agent reduce la configuración y mantiene los artefactos de software más sensibles en la máquina del desarrollador. El flujo de trabajo de exploración a Playbook da a cada ejecución del agente una ruta hacia un proceso de ingeniería repetible en lugar de dejar a los desarrolladores con otro video y una lista de observaciones.

La siguiente prueba del producto es la confiabilidad. Deltix tiene que demostrar que un Playbook sigue siendo útil cuando una compilación cambia por razones legítimas, que detecta regresiones cuando se rompe el recorrido del usuario y que falla con suficiente claridad para que un ingeniero pueda diagnosticar la causa. Si Deltix puede cumplir ese estándar, su agente se convierte en un puente entre las pruebas informales de producto y las comprobaciones automatizadas que los equipos ya usan para decidir si el software está listo para entregarse.

Reader comments

Conversation for this story loads after sign-in.