Standard Machinesが、AIエージェントにチップ設計を学習させる強化学習(RL)環境を公開

AppleのGPUアーキテクチャ出身のJacob Peakeは、非公開のチップ設計タスクと物理ベースの採点で最先端の研究機関を対象にしている。

By · Published

Primary source: X

Why it matters

Chip design offers AI labs high-value, verifiable work, but weak graders can train agents to exploit tests. Standard Machines is betting that trusted environments become core model infrastructure.

Illustration of Standard Machines' RL environment showing an agent iterating chip designs as layered circuit diagrams linked by arrows, suggesting physics-based grading of designs.

Standard Machinesは8月4日に、AIエージェントをチップ設計ループに通す一連の強化学習環境を立ち上げた。これらはSystemVerilogの記述やシミュレーションの実行から合成、物理設計のプレビュー、シールド評価までを含む。

創業者兼CEOのJacob Peake (@jacobpeake)は8月5日にXのスレッドでローンチを公表した。PeakeはStandard Machinesが最先端のAIラボがハードウェア工学タスクでモデルを改善する手助けをしたいと述べ、長期的な目標として小規模チームが数か月で高度なチップをテープアウトできるようにすることを掲げた。

その目標はStandard Machinesの公言する野心として残っている。初期製品は問題のより早い層を対象としている:AI生成のハードウェア設計が正しいか、物理的に実現可能か、効率的かを判定できるトレーニングタスクとグレーダーを構築することだ。

Peakeの経歴がこの焦点を説明している。彼は自身を個人サイトでStandard Machinesの創業者兼CEOと表記しており、そこで機械知能、コンピュータアーキテクチャ、ハードウェア・ソフトウェアの共同設計を主要な関心分野として挙げている。2024年のLinkedIn投稿では、PeakeはAppleに6か月間参加してプラットフォームアーキテクチャグループとともにGPUアーキテクチャの仕事をしたと述べている。Standard Machinesのローンチ投稿は彼をAppleのGPU Architecture組織での最初のインターンかつ最年少採用者として描写しており、その主張はPeakeに帰されている。

Training against the engineering loop

各Standard Machinesのタスクは、必要な計算、インターフェース、物理的制限を固定する実行可能な契約として構成されている。ローンチ投稿の一例は、指定されたスループット、消費電力、面積、プロセス設計の制約を満たしながらINT8行列乗算エンジンを実装するようエージェントに求めている。

エージェントは仕様書と電子設計自動化ツールを含むサンドボックスを受け取る。エージェントはRTLを書き、設計をコンパイルしてシミュレートし、エラーや波形を検査し、合成を実行し、限られた予算で配置配線(place-and-route)のプレビューを利用できる。環境は参照実装、隠しテスト、最終グレーダーをエージェントの作業領域の外に保持する。

エージェントが設計を提出すると、Standard Machinesによればファイルは凍結され、別個のランタイムで評価される。グレーダーは段階的に提出物をチェックする:法的で合成可能か、正しいか、タイミングおよびリソース制限を満たしているか、そして最後にレイテンシ、スループット、面積、消費電力のパフォーマンスがどうか、である。

その順序は強化学習における中心的な問題に対処している。エージェントは観測可能な報酬、測定システムの欠陥も含めて最適化するだろう。Standard Machinesは、正確性と性能を組み合わせた重み付けスコアは十分に高速だが不良な設計が正の報酬を得ることを許す可能性があると主張する。そこで同社のグレーダーは性能を調べる前に不正確な設計にはゼロ点を与える。

「環境の価値は、その報酬の信頼性によって決まる」とPeakeはローンチ投稿に書いた。

Standard Machinesはまた、タスクの「speed-of-light bound」に対して性能をスコアリングすることを提案している。システムはタスクで指定された操作数、入出力幅、依存チェーン、物理ライブラリから理論的な下限を計算する。設計はその下限のパーセンテージとして測定でき、下限を超えているように見える結果はテストハーネスの破損の証拠として扱われる。

A benchmark problem becomes a business

Peakeは現在のチップ設計評価の弱点を軸にStandard Machinesを位置付けている:多くはモデルが与えられたテストベンチを通過する比較的短いRTLスニペットを生成できるかを測定している。そうした設定はテスト汚染、不完全なテストカバレッジ、そしてベンチマークを満たすまでグレーダーのフィードバックを繰り返し確認するエージェントの余地を残す。

公開スコアはすでに上昇している。NVIDIAは7月に、Nemotron 3 Ultraと組み合わせた同社のACE-RTLエージェントがComprehensive Verilog Design Problems benchmarkの9カテゴリーで平均97.1%の合格率を達成したと報告した。NVIDIAはCVDPをハードウェア設計および検証タスクでモデルとエージェントを測定するためのフレームワークとして説明している。

Standard Machinesは、これらの結果が既存のベンチマークが先進システムを区別する能力を失いつつあることを示していると主張する。同社の環境はツール使用セッションをより長く伸ばし、設計が実用的なシリコンになり得るかを決定する物理的トレードオフを評価するように設計されている。

商業的なターゲットは個々のチップ設計者ではなく最先端モデル研究所である。Peakeは強化学習、ポストトレーニング、データチームに対してStandard Machinesのタスクをトレーニングとホールドアウト評価の両方に使用するよう招待した。同じシールドされたグレーダーは数千のトレーニング試行を採点し、その後プライベートに保持されたタスク群を実行してモデルを解答を露出させずに評価できる。

その焦点は、エンジニアリングワークフローに直接販売するチップ設計コパイロットとStandard Machinesを分けている。例えば、Y Combinatorが支援する企業SigmanticAIは、コンパイラや合成のフィードバックを使ってVerilogを生成し反復的に改良するシステムを市場に出している。Standard Machinesは、モデル開発者がエージェントをそれらのワークフローに展開する前に必要とする環境と測定レイヤーを販売している。

PeakeはStandard MachinesがY Combinatorの支援を受けており、同社のSummer 2026バッチの一員であると述べた。今回のローンチはチップ工学の自動化を推し進める上で特定のボトルネックにStandard Machinesを位置づける:最先端ラボはモデルと計算リソースを供給できる一方で、信頼できるタスク、ツール、報酬がそれらのモデルが実際に何を学ぶかを決定する。

Reader comments

Conversation for this story loads after sign-in.