EdotEnv、金融エージェントの訓練向けに市場由来のRL環境を提案
YC Summer 2026のスタートアップは、変化する市場レジームが静的なベンチマークよりも長期を見据えたエージェントをより良く訓練できると賭けている。
By Ryan Merket · Published
Primary source: EdotEnv
Why it matters
Agent performance increasingly depends on training environments, and EdotEnv is betting financial markets can supply harder, continuously changing experience than static datasets.

EdotEnvは、Y Combinator Summer 2026 に参加する企業で、Jay Azhang (@jay_azhang) および Matthew Siper に公に関連付けられており、金融市場データから構築された強化学習環境のサインアップを受け付けている。製品は、定量的な調査を行い、プロ向けツールを使用し、数日間にわたって結果が現れる意思決定を行うエージェントを訓練する研究者を対象としている。8月4日時点で、EdotEnvのウェブサイトは一般提供される製品ではなく、見込み利用者をウェイトリストに誘導している。 (edotenv.com)
EdotEnvの背後にある研究の道筋は、金融市場に焦点を当てたAI研究所であるNof1でのAzhangの仕事を経由している。Azhangは自身の個人サイトで、以前に300万ドルから2,000万ドルに運用資産を成長させたファンドを運営していたと述べている。SiperはNYU's Game Innovation LabのML博士課程の候補者で、以前の研究には強化学習や計算的ゲームデザインが含まれている。彼らの経歴はEdotEnvの中心的選択を説明している:金融市場を継続的に自分自身のルールを書き換える敵対的なゲームとして扱うことだ。 (jayazhang.com)
EdotEnvは、実際の市場データから組み立てた環境内で定量研究タスクをプログラム的に生成するとしている。エージェントは提供されたツールを使い、Bashで追加のツールを作成し、取引戦略を開発できる。意図された学習信号は、既知の解答がある固定の問いの集合ではなく、遅延報酬、不完全な情報、変化する条件から得られる。 (edotenv.com)
カリキュラムとしての市場
EdotEnvの主張は、静的な合成ベンチマークは最終的に予測可能になってしまうというものだ。市場は、収益性のある戦略が競争を引き寄せるため、取引エッジが減衰し、新しいレジームが以前に成功した行動を高コストにするため、常に変化し続ける。EdotEnvはその非定常性を再生可能な訓練タスクの供給源に変えようとしている。
同社のホームページは、T+00からT+96時間までの意思決定地平線を例示している。エージェントはまず部分的な情報でコミットする。露出(エクスポージャー)と機会費用が蓄積され、目的が変わり、エージェントは元の方針が期限切れになったことを認識しなければならない。4日間の例は概念的なものだが、これがEdotEnvが測定したい能力のタイプを示している:初期の選択が作業している状態を変えた後にエージェントが計画を修正できるかどうかだ。 (edotenv.com)
SiperはLinkedInでプロトタイプの詳細を提供している。彼はシステムが先見バイアス(look-ahead bias)、将来漏洩(future leakage)、サバイバーシップバイアス、市場影響、逆選択、部分約定、実行の不確実性およびポートフォリオ制約を考慮しなければならないと書いた。また、単一のNvidia T4 GPUで開始時間をずらした1,000並行リプレイ環境を実行し、学習カットオフ後のデータを使用し、Claudeを教師として歴史的軌跡を生成したと述べた。これらはSiperのプロトタイプに関する主張であって、EdotEnvの公表されたベンチマーク結果ではないが、プロジェクトが価格チャートをそのまま言語モデルに投入する以上の範囲に到達していることを示している。 (linkedin.com)
その作業はAzhangとSiperがすでに共同で行っている研究を拡張するものだ。2026年2月、彼らは共著でContinuous Program Searchを発表し、取引プログラムが連続潜在空間でどのように進化し得るかを研究した。論文はチームの適応的探索への関心を支持するが、EdotEnvの個別の製品主張を検証するものではない。 (arxiv.org)
ベンチマークの背後にあるビジネス
EdotEnvは、投資家に対して取引を販売するサービスではなく、AIラボや金融エージェント研究者向けのインフラ事業を提示している。その位置づけにより、Azhangとその共同研究者は環境、評価、訓練のレイヤーを収益化でき、顧客がエージェントを構築するコストとリスクを負担する形になる。
タイミングは、強化学習環境が独立したソフトウェアカテゴリとして投資家の関心を集めている時期に合致している。より広範な訓練環境企業であるDeeptuneは、2026年3月19日にAndreessen Horowitzが主導する4,300万ドルのシリーズAを発表した。Deeptuneは市場に焦点を当てるのではなくデジタル作業のシミュレーションを構築しているが、その資金調達は環境が能力あるモデルと信頼できるエージェントの間のボトルネックであるという投資家の賭けの大きさを示している。 (deeptune.com)
EdotEnvはY Combinatorの支援を表示している。YCによれば、受け入れられた企業に対する標準的な契約は50万ドルで、ポストマネーSAFEで7%に対して125,000ドル、非上限の最恵国待遇SAFEで375,000ドルを分割して提供するというものだ。EdotEnvは公の製品ページに資金調達の詳細を付記していないため、YCが公開している条件はアクセラレータ関係に関する文脈を提供するものであり、EdotEnvの調達額の確定的な説明ではない。 (ycombinator.com)
金融エージェント研究は既にオープンなフレームワークやライブ評価プロジェクトで混雑している。TradingAgentsは分析、リサーチ、トレーディング、リスク管理のための専門化されたLLMロールを調整する。 Agent Market Arenaは暗号通貨と株式市場のライブ取引でいくつかのエージェントアーキテクチャを評価しており、研究者はエージェント設計が基礎となるモデル選択よりも行動差を広く生み出したと報告している。EdotEnvの機会は、研究者がポリシーを実資本にさらす前に経験を繰り返し生成できるような、こうしたエージェントの下にある制御された訓練およびリプレイレイヤーになることだ。 (github.com)
EdotEnvが通過しなければならない試験
実市場データが自動的に信頼できる訓練環境を生み出すわけではない。将来情報が入力に漏洩したり、失敗した証券がデータセットから消えたり、シミュレートされた注文がライブ市場では得られなかった約定を受け取ったりすると、過去の取引システムは有能に見えてしまうことがある。Siper自身の要件リストは、グループがそうした失敗モードを理解していることを示している。EdotEnvの価値は、実装がそれらをどの程度一貫して防げるかに依存するだろう。
基盤となるモデルは、あまり動的でない金融作業に対しても弱いままである。最近のSEC提出書類から専門家が作成した研究質問に基づくベンチマークは、最も性能の高いモデルであるOpenAI o3でも46.8%の精度を報告した。別の研究は、リターンや精度スコアが事実の取り違え(ハルシネーション)、古いデータ、敵対的プロンプトでの失敗を隠す可能性があると主張している。したがって、収益を生むシミュレートされた軌跡は、エージェントが安全で信頼できるかどうかを測るには必ずしも良い指標ではない。 (arxiv.org)
EdotEnvの最も強いアイデアは、エージェントが改善するにつれて環境が難しくなるべきだという点だ。そのアイデアを証明するには、再現可能な評価ルール、時間ベースのデータ分割のクリーンさ、注文が測定される機会を変える方法を含む市場で行動するコストをモデル化するシミュレーションが必要になる。AzhangとSiperは、弱い仮定が迅速に罰せられる領域を選んだ。もしEdotEnvがその罰を有用な学習信号に変えられれば、その市場リプレイシステムは、静的ベンチマークでは提供できないものを金融エージェントに与える可能性がある:最初の答えの後に複利で積み重なる結果だ。