Ornith AI 发布了能够为自身编写训练课程的开放模型

该三模型家族将自我脚手架扩展到任务生成;其基准对比来自 Ornith AI 自行的评估运行。

By · Published

Primary source: Ornith AI

Why it matters

Ornith AI is betting that models can expand their own training curriculum, reducing dependence on hand-built tasks while making reward design even more consequential.

Exploded technical diagram of Ornith AI's three interconnected self-training models with callout labels and a human figure for scale.

Ornith AI 于 2026 年 8 月 19 日发布 Ornith-1.5,将其开源模型家族从生成答案和脚手架推进到生成训练任务本身。在一篇 公告 中,Ornith AI 描述了一个强化学习循环,该循环提出更难的问题、构建用于解决和评估它们的 harness(测试夹具),并生成作为下一轮学习经验的解答回放。

该发布来自一个将强化学习应用于具有严格、可机器检验奖励的问题的研究团队。Xiaoya Li、Guoyin Wang、Songqiao Su、Chris Shum 和 Jiwei Li 一同出现在 GrandCode paper 中,论文构建了一个用于竞赛编程的多智能体系统。几位相同的研究者参与了 CUDA-L2,该工作尝试以执行速度作为奖励来优化矩阵乘法内核。Stanford's NLP group 将 Jiwei Li 列为 DeepReinforce.ai 的关联成员。

这段历史解释了 Ornith-1.5 背后的核心押注。Ornith AI 试图将强化学习从围绕一组固定测试构建的过程,转变为能自己制造有用测试的过程。公开的研究脉络跨越了以 DeepReinforce 品牌标识的工作和 Ornith 品牌的模型仓库,包括 DeepReinforce Ornith repository。该发布由 Ornith Team 发布,并通过 @deep_reinforce 进行推广。

The model writes the assignment

Ornith-1.0(6 月发布)学会了生成围绕编码任务的脚手架:指令、工具、分解和协调,这些引导模型完成更长的任务。Ornith-1.5 在此基础上增加了任务生成。

每个训练周期从一个环境或代码库、关于期望问题类型的广泛指令以及模型已解决内容的历史开始。Ornith-1.5 提出一个更难的任务,创建或修订任务特定的脚手架,然后尝试求解。奖励在这三个阶段中流动,为模型提供关于题目质量、评估设置和答案的反馈。

Ornith AI 对生成的任务按有效性、难度和新颖性打分。一个被提出的任务必须是可执行且可验证的、位于模型当前能力前沿附近,并且与之前的工作有足够差异以提供有用的训练信号。Ornith AI 将目标解答成功率设为 0.2,偏好模型通常失败的任务,同时保留足够的成功回放用于强化学习。

harness(测试夹具)本身也会根据是否匹配任务、是否准确衡量解答质量以及是否能抵抗奖励滥用来获得奖励。这是设计中最难的部分。一个同时编写考试题目和评分脚本的系统,可能通过格式错误的测试、隐藏的捷径或奖励错误行为的评估标准为自己创造“简单分数”。官方的 Ornith-1.0 repository 记录了基准 harness、反作弊过滤器和资源设置,但未具体证明涉及 Git 历史移除或网络屏蔽的更具体评估协议。

“自我改进”标签描述了训练流程。下载的模型不会在用户的手机或工作站上持续自我再训练。Ornith AI 在模型开发期间运行该循环,然后发布得到的权重。

Three sizes, three different deployment bets

Ornith-1.5 在一个 Hugging Face collection 中发布,包含一个 3970 亿参数的 mixture-of-experts 模型、一个每 token 激活 30 亿参数的 35B MoE 模型,以及一个 9B 的密集模型。Ornith AI 还描述了 9B 模型的量化移动版本,供 iPhone 和 Android 部署。

397B 发布是 Ornith AI 的开源前沿押注。35B 模型面向能够在内存中容纳更大稀疏模型并愿意为较小激活参数数支付推理成本的开发者。9B 模型是三者中最易接近的:Ornith AI 记录了本地部署说明并为 Apple 硬件发布了一个 MLX build

移动和本地发布策略为开发者提供了一种在不依赖托管演示的情况下测试系统的方法。实际权衡仍取决于量化、可用内存、运行时支持以及任务长度。

对于上一代,Ornith AI 的 官方 Ornith-1.0 documentation 列出了在 MIT 许可下的 bf16、FP8 和 GGUF 检查点。Ornith-1.0-9B model card 列出在 bf16 下约 19GB 的占用和原生 262,144 token 的上下文窗口。Ornith AI 的官方文档并未声称存在大约 100 万 token 的 RoPE 或 YaRN 扩展。

Benchmarks carry a harness

Ornith AI reports Ornith-1.5-397B 在使用 Terminus-2 的 Terminal-Bench 2.1 上得分 86.1,在 DeepSWE 上得分 56.0。Ornith AI 将这些结果与 Claude Opus 4.8 的 85.0 和 59.0、DeepSeek-V4-Flash-0731 的 82.7 和 54.4 以及 GLM-5.2 的 81.0 和 46.2 进行比较。

在 35B 档,Ornith AI 报告在使用 Claude Code 的 Terminal-Bench 2.1 运行中得分 68.5,并在 SWE-bench Verified 上得分 79.0。9B 模型在相同两项评估中分别报告为 47.0 和 70.6。

这些细节限制了头条数字能证明的内容。Agentic 编码分数测量的是模型与 harness 的配对,改变脚手架会实质性改变结果。Ornith AI 的比较应被视为公司披露、公司运行的评估,直到外部评估者复现模型和 harness 配置为止。

Ornith-1.0 repository 报告了若干早期基准结果,作为五次运行的平均值,并公布了采样设置、上下文窗口、超时、计算分配和 agent harness。这些披露适用于 Ornith-1.0,不应被视为 Ornith-1.5 分数的文档说明。

不过该发布仍为开发者提供了可供测试的具体内容。Ornith AI 发布了模型权重、服务说明和量化格式,而不是仅限于托管演示。早期的 Ornith-1.0 repository 为这些新检查点提供了已有的开源起点。

Ornith AI's larger bet

Ornith AI 围绕一个约束进行构建:随着人工编写训练任务变得昂贵以及熟悉的基准逐渐失去辨别能力,这一约束变得更加重要。一个能识别自身能力缺口并围绕这些缺口构建有效练习的模型,可能会生成一个随模型进步而快速移动的课程。

弱点也同样清晰:只有当其评分环境保持忠实、困难并能抵抗被利用时,生成的任务才有用。Ornith AI 已将该评估层作为可学习系统的一部分,从而将更多责任放在奖励设计上。

Ornith-1.5 将这一研究论点变为三种可下载的模型规模。开放权重让开发者可以检查实际结果、运行已公布的配方并测试 Ornith AI 自生成课程是否能从基准环境转移到真实代码库。这是在模型自我评分结束后真正重要的测试。

Reader comments

Conversation for this story loads after sign-in.