Standard Machines 推出用于训练 AI 代理进行芯片设计的强化学习(RL)环境
Apple GPU 架构的校友 Jacob Peake 正在面向前沿实验室推出封闭的芯片设计任务,并采用基于物理的评分。
By Ryan Merket · Published
Primary source: X
Why it matters
Chip design offers AI labs high-value, verifiable work, but weak graders can train agents to exploit tests. Standard Machines is betting that trusted environments become core model infrastructure.

Standard Machines 在 8 月 4 日推出了一组强化学习环境,让 AI 代理经历芯片设计循环,从编写 SystemVerilog 和运行仿真,到综合、物理设计预览和封闭评估。
创始人兼 CEO Jacob Peake (@jacobpeake) 在 8 月 5 日 在 X 上的一条线程中宣传了该发布。Peake 表示,Standard Machines 希望帮助前沿 AI 实验室在硬件工程任务上改进模型,长期目标是让小团队在数月内完成先进芯片的流片。
这一目标仍然是 Standard Machines 所宣称的雄心。初始产品面向问题的较早层面:构建训练任务和评分器,以判断 AI 生成的硬件设计是否正确、物理上可行且高效。
Peake 的背景解释了这种侧重。他在自己的 个人网站 上将自己标识为 Standard Machines 的创始人兼 CEO,并列出机器智能、计算机体系结构和硬件-软件协同设计为他的主要兴趣。在一篇 2024 年的 LinkedIn 帖子 中,Peake 表示他曾加入 Apple 工作六个月,与其平台架构团队一道从事 GPU 架构相关工作。Standard Machines 的发布文章将他描述为 Apple GPU Architecture 组织的第一位实习生兼最年轻的雇员,这一说法归于 Peake。
Training against the engineering loop
每个 Standard Machines 任务被构造为一个可执行合约,固定所需的计算、接口和物理限制。发布文章中的一个示例要求代理实现一个 INT8 矩阵乘法引擎,同时满足指定的吞吐量、功耗、面积和工艺设计约束。
代理接收一个包含规范和电子设计自动化工具的沙箱。它可以编写 RTL,编译并仿真设计,检查错误和波形,运行综合并使用有限预算的布局布线预览。环境将参考实现、隐藏测试和最终评分器保存在代理工作区之外。
当代理提交设计时,Standard Machines 表示这些文件会被冻结并在独立运行时中评估。评分器分阶段检查提交:是否合法且可综合、是否正确、是否满足时序和资源限制,最后评估其在延迟、吞吐量、面积和功耗方面的表现。
这种排序解决了强化学习中的一个核心问题。代理会优化它能观察到的奖励,包括测量系统中的任何缺陷。Standard Machines 认为,将正确性与性能加权合并的得分可能使得足够快但有缺陷的设计获得正奖励。其评分器会在检查性能前先对不正确的设计给出零分。
“环境的价值由其奖励的可信性决定,”Peake 在发布文章中写道。
Standard Machines 还建议根据其所谓任务的 '光速界限' 来对性能进行评分。系统根据操作计数、输入和输出宽度、依赖链以及任务指定的物理库计算理论下界。然后可以将设计作为该界限的百分比来衡量,而任何看起来超过该界限的结果都会被视为测试夹具损坏的证据。
A benchmark problem becomes a business
Peake 将 Standard Machines 定位于当前芯片设计评估的一个弱点:许多评估仅衡量模型是否能生成通过所给测试平台的相对较短的 RTL 片段。这种设置为测试污染、测试覆盖不完整以及代理反复查看评分器反馈直至满足基准的行为留下了空间。
公开得分已经在上升。NVIDIA 在 7 月报告称,其 ACE-RTL 代理配合 Nemotron 3 Ultra 在 Comprehensive Verilog Design Problems benchmark 的九个类别中取得了 97.1% 的平均通过率。NVIDIA 将 CVDP 描述为一个用于在硬件设计与验证任务上衡量模型和代理的框架。
Standard Machines 认为,这些结果表明现有基准正在失去区分领先系统的能力。其环境被设计为将任务延展到更长的工具使用会话,并评估决定设计能否成为有用硅片的物理权衡。
商业目标是前沿模型实验室,而不是单个芯片设计工程师。Peake 邀请强化学习、后训练和数据团队使用 Standard Machines 的任务进行训练和留出评估。同一封闭评分器可以对数千次训练尝试进行计分,然后运行私有的任务族来在不暴露答案的情况下评估模型。
这种侧重将 Standard Machines 与直接面向工程工作流程销售的芯片设计 copilot 区分开来。例如,同为 Y Combinator 支持的公司 SigmanticAI 推出了一套使用编译器和综合反馈来生成并迭代改进 Verilog 的系统。Standard Machines 则在销售模型开发者在将代理部署到这些工作流程之前所需的环境和测量层。
Peake 表示 Standard Machines 得到 Y Combinator 的支持,并是其 2026 年夏季批次的一部分。此次发布将 Standard Machines 放在推动芯片工程自动化进程中的一个特定瓶颈点:前沿实验室可以提供模型和计算资源,而值得信赖的任务、工具与奖励则决定这些模型实际学到的内容。