Andrew Ho 离开 OpenAI,转而构建用于科学 AI 的强化学习数据集

GeneBench-Pro 的合著者押注,前沿实验室会为那些网络规模训练无法提供的、可验证的生物学和统计学任务付费。

By · Published

Primary source: Andrew Ho on X

Why it matters

Ho is turning the benchmark methodology he built inside OpenAI into a data-supply company. The bet places scarce, verifiable expert tasks at the center of the next phase of model training.

Illustration of Andrew Ho and GeneBench-Pro examining biological pathway maps and statistical charts for verifiable scientific AI research.

Andrew Ho (@andrewho03) 在任职八个月后于7月29日离开了 OpenAI,并在在 X 上的一则公告 中表示,他将创办一家公司,为 AI 实验室制作强化学习数据集,起初关注生物学和统计推理。

Ho 将他在 OpenAI 的一项具体工作带入了新公司。他是 GeneBench-Pro 的合著者——该基准测试于6月30日发布,用于检验 AI 代理是否能够处理混乱的生物数据、选择合适的分析方法并在初始假设失败时修正其方法。

据 Ho 介绍,该公司最初将构建两种类型的数据集。第一类针对长远的科学推理,向代理提供复杂的数据集和可以与已知真实答案比对评分的答案。第二类则聚焦于常规科学工作,包括涉及细胞培养板和 Western blots 图像的多模态问题。Ho 表示,他最终计划扩展到化学、材料科学、医疗保健和办公室工作领域。

将评估转化为训练数据

GeneBench-Pro 提供了 Ho 想要出售的工作示例。预印本 包含跨越 10 个科学领域和 21 个子领域的 129 道题目。OpenAI 表示,82 道题目接受了外部专家评审,公开发布了 10 道代表性问题,另有 50 道题目分配给 Artificial Analysis 进行独立基准测试。

OpenAI 报告称,GPT-5.6 Sol 在其最高推理设置下通过了 28.7% 的题目,在 Pro 模式下上升到 31.5%。每个题目都使用模拟数据,这让设计者能够控制潜在的因果结构,并在仍然需要多轮分析和判断的情况下,根据已知答案对代理进行评分。

这种构造是 Ho 推销的核心。真实的科学工作通常允许多种站得住脚的方法,这使其难以被转化为具有清晰奖励信号的强化学习数据。通过生成逼真的数据并控制其生成方式,供应商可以创建既保留研究模糊性又保有确定性评分目标的任务。

Ho 表示,新公司可以生成数千道此类题目。这是他的主张,而非已证明的生产数据,但 GeneBench-Pro 为潜在客户提供了方法论的详细样本。

该公告也同时起到了推销的作用。Ho 邀请有数据需求的实验室与他联系,并表示该公司将提供“行业标准的定价和条款”。他提出的优势是接近买方:Ho 表示他在 OpenAI 的工作涵盖了从数据采购到模型训练的流程,使他直接了解哪些数据集可以被实验室纳入大型训练运行中。

一位具有生物技术数据经验的创始人

Ho 的背景早于他在 OpenAI 的工作。根据他的职业简介,他于 2016 年在 University of Washington 获得化学学士学位,并在加入 BioAge Labs 之前曾在基因组学公司 BGI 工作。

在 BioAge,Ho 表示他为基因组学和蛋白质组学数据构建了机器学习管道,管理了超过 100GB 的生物信息,并参与了药物发现和临床试验项目。他已发表的工作包括关于与人类死亡率相关的生物标志物的研究。他的个人网站 列出了在 BioAge 的五年经历,之后又在金融行业和 OpenAI 工作。

这种背景组合塑造了公司最初的市场定位。Ho 既理解被编码的科学工作流程,也理解前沿模型实验室所施加的技术要求。眼下的产品是数据,但更艰巨的工作在于将专家判断转化为模型可以探索、失败并获得可靠评分的环境。

Ho 认为,模型能力仍然“spiky”,在封闭且经过大量训练的领域表现良好,而在普通的、依赖上下文的工作上仍然表现薄弱。他预计,随着单靠扩展带来的能力递减,前沿实验室将在有针对性的数据获取上投入超过 1000 亿美元。他没有为该数字提供时间框架或方法论,使其更像是一种市场信念的陈述而非可检验的预测。

更窄的商业案例已可见端倪。GeneBench-Pro 显示,前沿模型在一套精心构建的科学推理题集中能解决的题目不到三分之一。Ho 打赌,实验室会支付外部供应商来创建弥补这一差距所需的训练材料,而他在 OpenAI 的八个月经历让他拥有足够的知识来构建那些实验室实际会使用的数据。

Reader comments

Conversation for this story loads after sign-in.