Standard Machines lanza entornos de RL que entrenan a agentes de IA para diseñar chips

Jacob Peake, egresado de la arquitectura de GPU de Apple, está apuntando a laboratorios de vanguardia con tareas de diseño de chips selladas y evaluación basada en física.

By · Published

Primary source: X

Why it matters

Chip design offers AI labs high-value, verifiable work, but weak graders can train agents to exploit tests. Standard Machines is betting that trusted environments become core model infrastructure.

Illustration of Standard Machines' RL environment showing an agent iterating chip designs as layered circuit diagrams linked by arrows, suggesting physics-based grading of designs.

Standard Machines lanzó un conjunto de entornos de aprendizaje por refuerzo el 4 de agosto que someten a agentes de IA al ciclo de diseño de chips, desde escribir SystemVerilog y ejecutar simulaciones hasta síntesis, vistas previas de diseño físico y evaluación sellada.

Founder and CEO Jacob Peake (@jacobpeake) publicó el lanzamiento en un hilo en X el 5 de agosto. Peake dijo que Standard Machines quiere ayudar a los laboratorios de IA de frontera a mejorar modelos en tareas de ingeniería de hardware, con el objetivo a más largo plazo de permitir que equipos pequeños tape out chips avanzados en cuestión de meses.

Ese objetivo sigue siendo la ambición declarada de Standard Machines. El producto inicial está dirigido a la capa más temprana del problema: construir tareas de entrenamiento y calificadores que puedan decir si un diseño de hardware generado por IA es correcto, físicamente factible y eficiente.

El historial de Peake explica el enfoque. Se identifica como fundador y CEO de Standard Machines en su sitio personal, donde enumera machine intelligence, computer architecture y hardware-software co-design como sus principales intereses. En una publicación en LinkedIn de 2024, Peake dijo que se unió a Apple por seis meses para trabajar en GPU architecture junto con su platform architecture group. El post de lanzamiento de Standard Machines lo describe como el primer pasante y la contratación más joven en la organización GPU Architecture de Apple, una afirmación atribuida a Peake.

Training against the engineering loop

Cada tarea de Standard Machines está estructurada como un contrato ejecutable que fija los cálculos requeridos, las interfaces y los límites físicos. Un ejemplo en la publicación de lanzamiento pide a un agente implementar un motor de multiplicación de matrices INT8 mientras cumple los requisitos de rendimiento, potencia, área y restricciones de proceso especificadas.

El agente recibe un sandbox que contiene la especificación y las herramientas de automatización de diseño electrónico. Puede escribir RTL, compilar y simular el diseño, inspeccionar errores y formas de onda, ejecutar síntesis y usar un presupuesto limitado de vistas previas de place-and-route. El entorno mantiene la implementación de referencia, las pruebas ocultas y el grader final fuera del espacio de trabajo del agente.

Cuando el agente envía un diseño, Standard Machines dice que los archivos se congelan y se evalúan en entornos de ejecución separados. El grader comprueba la entrega en etapas: si es legal y sintetizable, si es correcto, si cumple con los límites de temporización y recursos, y finalmente cómo se desempeña en latencia, rendimiento, área y consumo de energía.

Ese orden aborda un problema central en el aprendizaje por refuerzo. Un agente optimizará la recompensa que puede observar, incluidas cualquier falla en el sistema de medición. Standard Machines argumenta que una puntuación ponderada que combine corrección y rendimiento podría permitir que un diseño suficientemente rápido pero defectuoso obtenga una recompensa positiva. Su grader asigna cero a un diseño incorrecto antes de examinar el rendimiento.

"The value of an environment is set by the trustworthiness of its reward," escribió Peake en la publicación de lanzamiento.

Standard Machines también propone puntuar el rendimiento respecto a lo que llama el "speed-of-light bound" de una tarea. El sistema calcula cotas inferiores teóricas a partir del recuento de operaciones, los anchos de entrada y salida, las cadenas de dependencia y la biblioteca física especificada para la tarea. Los diseños pueden medirse entonces como un porcentaje de esa cota, mientras que cualquier resultado que parezca superarla se trata como evidencia de un banco de pruebas roto.

A benchmark problem becomes a business

Peake está posicionando a Standard Machines alrededor de una debilidad en las evaluaciones de diseño de chips actuales: muchas miden si un modelo puede producir fragmentos relativamente cortos de RTL que pasen un testbench suministrado. Esa configuración deja espacio para la contaminación de pruebas, cobertura incompleta y agentes que inspeccionan repetidamente la retroalimentación del grader hasta satisfacer el benchmark.

Las puntuaciones públicas ya están subiendo. NVIDIA informó en julio que su agente ACE-RTL emparejado con Nemotron 3 Ultra logró una tasa de aprobación promedio del 97.1% en nueve categorías en el Comprehensive Verilog Design Problems benchmark. NVIDIA describe CVDP como un marco para medir modelos y agentes en tareas de diseño y verificación de hardware.

Standard Machines sostiene que esos resultados muestran que los benchmarks existentes están perdiendo su capacidad para distinguir entre los sistemas líderes. Sus entornos están diseñados para alargar las tareas a sesiones más largas de uso de herramientas y calificar los compromisos físicos que determinan si un diseño podría convertirse en silicio útil.

El objetivo comercial es el laboratorio de modelos de frontera, no el diseñador de chips individual. Peake invitó a equipos de reinforcement-learning, post-training y datos a usar las tareas de Standard Machines tanto para entrenamiento como para evaluaciones con conjuntos reservados. Ese mismo grader sellado puede puntuar miles de intentos de entrenamiento y luego ejecutar familias de tareas mantenidas en privado para evaluar un modelo sin exponer las respuestas.

Ese enfoque separa a Standard Machines de copilotos de diseño de chips que se venden directamente en los flujos de trabajo de ingeniería. La compañía, también respaldada por Y Combinator, SigmanticAI, por ejemplo, comercializa un sistema que genera y refina iterativamente Verilog usando la retroalimentación del compilador y la síntesis. Standard Machines está vendiendo el entorno y la capa de medición que los desarrolladores de modelos necesitan antes de desplegar agentes en esos flujos de trabajo.

Peake dijo que Standard Machines cuenta con el respaldo de Y Combinator y forma parte de su cohorte Summer 2026. El lanzamiento coloca a Standard Machines en un punto de estrangulamiento específico en el empuje por automatizar la ingeniería de chips: los laboratorios de frontera pueden aportar modelos y cómputo, mientras que tareas, herramientas y recompensas confiables determinan lo que esos modelos realmente aprenden.

Reader comments

Conversation for this story loads after sign-in.