Markov empaqueta 99 horas de trabajo de ingeniería en datos de entrenamiento para agentes de IA de escritorio

La startup YC S26 emparejó 51 tareas de ingeniería con archivos de referencia, rúbricas, grabaciones y trazas de interacción entre ocho grupos de software CAD.

By · Published

Primary source: X

Why it matters

AI agents need task environments and measurable outputs before they can move from browser chores into engineering software. Markov is building that training and evaluation layer around CAD.

AI data startup Markov releases 99 hours of CAD workflows for computer-use agents

Markov, la startup de datos de uso de computadoras fundada por Dev Mandal (@DevvMandal) y Harish Ashok (@habril27), publicó una colección de flujos de trabajo CAD realizados por humanos el 3 de agosto para entrenar y evaluar agentes de IA que operan software de ingeniería a través de una interfaz gráfica.

https://x.com/DevvMandal/status/2084318299765281183

poster=/api/storage/public-objects/tweet-videos/markov-cad-environments-computer-use-ai-agents-poster-e0a37c5b.jpg|Video de @DevvMandal en X

Mandal dijo en un hilo de dos publicaciones en X que Markov estaba publicando 50 tareas en AutoCAD, SOLIDWORKS y Siemens NX. El repositorio en Hugging Face actualmente lista 51 flujos de trabajo que abarcan ocho grupos de software: AutoCAD, SketchUp, SOLIDWORKS, Revit Architecture, Revit MEP, Siemens NX, Revit Structure y STAAD.Pro.

El repositorio más amplio importa porque muestra lo que Mandal y Ashok están tratando de vender a los desarrolladores de IA: asignaciones de ingeniería completas y reproducibles en lugar de capturas de pantalla desconectadas o etiquetas del cursor. Cada flujo de trabajo incluye un prompt estructurado, un documento de descripción general, archivos de entrada y de referencia, el entregable CAD completado, rúbricas de evaluación y una grabación de pantalla de un humano realizando la tarea. Markov también capturó eventos sincronizados de ratón y teclado, tiempos de fotogramas, narración y un formato de trayectoria derivado para modelos de uso de computadora.

Mandal, el CEO de Markov, estudió ingeniería aeroespacial en IIT Madras y trabajó anteriormente en Sarvam AI, según el perfil de Markov en Y Combinator. Sus proyectos anteriores incluyeron doubt.ai, un solucionador de preguntas de examen de código abierto que, según dijo, manejó más de 5,000 preguntas de más de 700 usuarios. Ashok, que dice tener 17 años y estar radicado en Bangalore, construyó anteriormente Zenith, un asistente por voz para ingenieros en robótica que generaba, compilaba, subía y depuraba firmware.

Esos antecedentes acercan a ambos fundadores al problema que Markov está persiguiendo. Los programas de ingeniería requieren largas secuencias con estado de clics, entradas de teclado, operaciones de archivos y decisiones geométricas. Un agente usable debe preservar el contexto a lo largo de esa secuencia y producir un archivo que pueda inspeccionarse en cuanto a dimensiones, estructura y completitud.

El recuento de tareas enmascara duraciones desiguales de los flujos de trabajo

La publicación suma 99.03 horas y 152 GB. Su titular de 51 flujos de trabajo no representa una cobertura equitativa entre las aplicaciones. SOLIDWORKS tiene 19 flujos de trabajo que suman 16.64 horas, mientras que AutoCAD tiene cuatro flujos de trabajo que suman 25.7 horas. SketchUp aporta siete flujos de trabajo y 25.15 horas. Revit MEP tiene un único flujo de trabajo de 7.19 horas.

Esa distribución acerca el archivo más a un conjunto de demostraciones profundas que a un benchmark equilibrado entre productos CAD. Puede exponer a un modelo a sesiones de ingeniería completas, pero las comparaciones entre aplicaciones tendrían que tener en cuenta las grandes diferencias en el número de tareas y el tiempo de grabación.

La publicación de Markov también incluye los artefactos necesarios para puntuar el trabajo de un agente. El resultado de referencia y la rúbrica pueden soportar la evaluación frente al entregable final, mientras que la grabación humana y la traza de interacción ofrecen un camino de referencia a través del software. Un agente no necesita necesariamente copiar ese camino, siempre que su archivo CAD final cumpla con los requisitos de la tarea.

Markov está pasando de grabaciones sin procesar a entornos evaluables

La publicación de CAD extiende el trabajo anterior de Markov recopilando demostraciones amplias de uso de computadoras. Su Computer Use Large dataset, publicado en marzo, contiene 48,478 videos que representan alrededor de 12,300 horas de trabajo en AutoCAD, Blender, Excel, Photoshop, Salesforce y VS Code. Esos videos se obtuvieron de internet, se recortaron para eliminar contenido fuera de pantalla y se les quitó el audio.

CAD Environments es más pequeño y más estructurado. Los operadores humanos comienzan con entradas definidas y producen salidas conocidas bajo una rúbrica explícita. Eso hace que la nueva publicación sea útil para entrenamiento supervisado, análisis de trayectorias y evaluación del artefacto final, en lugar de mera exposición al uso del software.

Markov también publicó AutoCAD Bench, un benchmark separado de 50 tareas para probar si agentes multimodales pueden recrear dibujos 2D con acotaciones y modelos 3D precisos. El benchmark ejecuta agentes dentro de sesiones aisladas de AutoCAD y evalúa los archivos DWG resultantes. Juntos, el benchmark y el nuevo archivo de flujos de trabajo le dan a Markov ambos lados de una canalización de desarrollo de agentes: demostraciones para entrenamiento y tareas controladas para medición.

Y Combinator lista a Markov como una empresa de dos personas en San Francisco en su cohorte Summer 2026. El acuerdo estándar de YC invierte $500,000 en cada empresa aceptada, dividido entre $125,000 por 7% y $375,000 en un SAFE sin límite con una cláusula de nación más favorecida.

Publicar el archivo CAD les da a Mandal y Ashok una demostración pública del sistema de colección y empaquetado detrás de Markov. La oportunidad comercial está con los laboratorios de IA que necesitan tareas propietarias, demostraciones humanas y entornos de evaluación para software de escritorio especializado. CAD es un campo de prueba útil porque el resultado de un agente puede juzgarse por el archivo que produce, en lugar de si su secuencia de clics simplemente parecía plausible.

Reader comments

Conversation for this story loads after sign-in.