Andrew HoがOpenAIを退社し、科学向けAIのための強化学習データセットを構築へ

GeneBench-Proの共著者は、フロンティアラボがウェブスケールのトレーニングでは提供できない検証可能な生物学および統計学のタスクに対して対価を支払うと賭けている。

By · Published

Primary source: Andrew Ho on X

Why it matters

Ho is turning the benchmark methodology he built inside OpenAI into a data-supply company. The bet places scarce, verifiable expert tasks at the center of the next phase of model training.

Illustration of Andrew Ho and GeneBench-Pro examining biological pathway maps and statistical charts for verifiable scientific AI research.

Andrew Ho (@andrewho03) は、8か月の在籍を経て7月29日に OpenAI を退社し、X 上の発表で、AI ラボ向けの強化学習用データセットを作る会社を立ち上げると述べ、まずは生物学と統計的推論から始めると発表した。

Ho は OpenAI での仕事の一部を新しいベンチャーに持ち込む。彼は GeneBench-Pro を共著しており、これは6月30日に公開されたベンチマークで、AI エージェントが混沌とした生物学データを扱い、適切な解析手法を選び、初期の仮定が失敗したときに方針を修正できるかを試すものだ。

Ho によれば、会社は当面 2 種類のデータセットを構築する。第1は長期的な科学的推論を対象とし、エージェントに複雑なデータセットと既知のグラウンドトゥルースに照らして採点できる解答を与えるものだ。第2は日常的な科学作業に焦点を当て、セルカルチャープレートやウェスタンブロットの画像を含むマルチモーダルな質問を含む。Ho は最終的に化学、材料科学、医療、オフィスワークにも展開する計画だと述べた。

Turning an evaluation into training data

GeneBench-Pro は、Ho が売ろうとしているものの実例を提供している。プレプリント には 10 の科学領域と 21 のサブドメインにまたがる 129 の問題が含まれている。OpenAI によれば 82 問は外部専門家によるレビューを受け、代表的な 10 問が公開され、50 問は Artificial Analysis による独立ベンチマーク用に割り当てられたという。

OpenAI は、GPT-5.6 Sol が最も高い推論設定で 28.7% の問題を通過し、Proモードでは 31.5% に上昇したと報告した。各問題はシミュレートされたデータを使っており、設計者が基礎となる因果構造を制御し、既知の解答に対してエージェントを採点できる一方で、複数回の解析や判断を要求するようになっている。

その構成は Ho の提案の中心だ。実際の科学的仕事はしばしば複数の正当化可能な手法を許すため、クリーンな報酬信号を持つ強化学習データに変換するのが難しい。現実的なデータを生成してその生成方法を制御することで、研究の曖昧さを保持しつつも決定論的な採点ターゲットを残すタスクをベンダーは作成できる。

Ho は新会社がそのような問題を何千件も生成できると述べた。これは実証済みの生産量ではなく彼の主張だが、GeneBench-Pro は顧客候補にその方法論の詳細なサンプルを提供している。

発表はセールスの呼びかけも兼ねていた。Ho はデータ要件を持つラボに連絡するよう呼びかけ、「industry-standard pricing and terms」を提供すると述べた。彼の提案する利点は買い手への近接性である:Ho は OpenAI でデータ調達からモデル訓練までのプロセスを担当しており、ラボが大規模な訓練実行に組み込めるデータセットがどれかを直接知っていると述べた。

A founder with biotech data experience

Ho の経歴は OpenAI 在籍以前に遡る。彼は his professional profile によれば 2016 年に University of Washington で化学の学士号を取得し、OpenAI に入る前にゲノミクス企業 BGI で働いた後、2017 年に BioAge Labs に参加した。

BioAge では、Ho はゲノミクスとプロテオミクスデータのための機械学習パイプラインを構築し、100 ギガバイト以上の生物学的情報を管理し、創薬や臨床試験プログラムに取り組んだと述べている。彼の発表論文には research on biomarkers associated with human mortality が含まれる。彼の personal site には BioAge での 5 年が記載され、その後に金融と OpenAI での仕事が続いている。

その組み合わせが同社の初期市場を形作る。Ho は、エンコードされる科学的ワークフローとフロンティアモデルラボが課す技術要件の両方を理解している。当面の製品はデータだが、より困難なのは専門家の判断を、モデルが探索し失敗し信頼できるスコアを受け取れる環境に翻訳する作業にある。

Ho はモデルの能力が依然として「スパイキー」であり、閉じた十分に訓練された領域ではうまく機能する一方で、日常的で文脈依存の作業では弱い結果を出し続けると主張する。彼は、スケーリングだけでは無料で得られる能力が減るため、フロンティアラボはターゲットを絞ったデータ取得に $100 billion を超える支出をするだろうと予想している。その数字に対する期間や方法論は示しておらず、検証可能な予測というよりは市場への確信の表明だ。

より狭いビジネスケースはすでに見えている。GeneBench-Pro は、フロンティアモデルが慎重に構成された科学的推論スイートの 3 分の 1 未満しか解けなかったことを示した。Ho は、ラボがその差を埋めるための訓練素材を外部の供給者に支払うと賭けており、OpenAI 内での 8 か月がラボが実際に使うデータを構築するのに十分な知識を彼に与えたと考えている。

Reader comments

Conversation for this story loads after sign-in.