Meta 宣称其 AI 在五项 STEM 奥林匹克竞赛中取得金牌级成绩

Meta 报告称在物理理论方面获得满分,但未说明所使用的模型和评估设置。

By · Published

Primary source: AI at Meta on X

Why it matters

Olympiad exams offer harder, fresher reasoning tests than saturated benchmarks, but Meta's scores cannot be compared cleanly until it identifies the models and test-time setup.

Meta claims gold-level AI results across five STEM Olympiads

Meta 在 8 月 6 日的一篇帖子中表示其 AI 模型在五项 STEM 奥林匹克竞赛中达到了金牌水平的表现,包括在亚洲物理奥林匹克竞赛和国际物理奥林匹克竞赛的理论考试中获得满分。

https://x.com/AIatMeta/status/2085388945148297322

poster=/api/storage/public-objects/tweet-videos/meta-ai-models-gold-stem-olympiads-reasoning-test-poster-68c88e89.jpg|来自 @AIatMeta 在 X 上的视频

该公告将这些竞赛归为检验 Meta 的模型是否在“推理方面取得真正进展”的一项测试。这比另一个基准分数要求更高。奥林匹克难题是为每年的比赛编写的,需要较长的推导,并可能包含图示或其他视觉信息。评判时会对中间步骤进行评分,而不是只看最终的多项选择答案。

Meta 附带的文字说明提到了两个物理成绩,但没有说明是哪些模型产生了这些结果。它也没有列出推理配置、尝试次数、工具访问、计算预算以及 Meta 是否从多个代理或多次运行中选择答案。这些细节决定了该结果在多大程度上衡量单个模型的推理能力,而不是更大规模测试时系统的性能。

满分的理论成绩涵盖了部分物理竞赛内容

Meta 指定其满分结果适用于理论考试。两项物理奥林匹克竞赛也都包含实验环节,使得该公司的分数比完整的人类竞赛结果范围更窄。

亚洲物理奥林匹克竞赛遵循国际物理奥林匹克竞赛的结构,包含五小时的理论考试和单独的实验室工作。根据赛事官方历史,2026 年亚洲赛在韩国釜山举行。

Meta 早前表示其在亚洲物理奥林匹克竞赛中的提交在理论考试中取得了 30 分(满分 30 分),并与前三名学生并列。8 月 6 日的帖子将公司的说明扩展至国际物理奥林匹克竞赛,Meta 表示一款模型也在该竞赛的理论考试中获得了满分。

该 IPhO 结果与今年人类参赛者达到的标准相匹配。越南 2026 年队的两名队员在理论考试中获得了 30 分(满分 30 分),据该国教育培训部并由 VnExpress 报道。因此,相关比较应该是与人类中最强的理论成绩进行对比,而不包括参赛者也完成的实验室考试。

未指明的模型是这一声明的核心

Meta 在 7 月 9 日发布了 Muse Spark 1.1,将其描述为用于编码、工具使用和代理任务的多模态推理模型。奥林匹克公告并未说明是 Muse Spark 1.1、另一款公开模型还是内部研究系统生成了所报告的解答。

这一区别很重要,因为 Meta 明确开发了可以在多个代理之间扩展推理的系统。当 Meta 在 4 月介绍最初的 Muse Spark 时,描述了一个“Contemplating”模式,该模式使多个代理并行推理。由这种编排产生的结果可以作为关于整体系统的有用证据,但它不能直接与在固定令牌预算下单次回答的单一模型进行比较。

最有力的证明方式是将成绩单与确切的提示、模型检查点、时间限制、工具权限、完整解答和评分记录配对。8 月 6 日的公告只提供了头条结果。

奥林匹克测试正在取代已饱和的基准

AI 实验室越来越多地转向近期学术竞赛,因为常被引用的基准套件可能会饱和或泄露到训练数据中。实时或新发布的奥林匹克试题降低了这种污染风险,并测试系统能否在不熟悉的问题上维持一系列推理。

难度仍然对方法论敏感。模型可以生成多个候选解,使用外部软件、搜索网络或依赖第二个模型来批评其工作。人类参赛者在固定的时间、工具和提交规则下比赛。只有在评估声明了保留了哪些约束时,奖牌标签才有意义。

HiPhO physics benchmark 发布的研究展示了性能进步的速度。其对 30 个语言和多模态模型的评估发现,封闭式推理系统可以在若干近期物理考试上达到金牌门槛,尽管大多数模型仍未达到满分。Meta 现在声称在两项 2026 年实时竞赛中获得了理论部分满分,并在五项奥林匹克竞赛中达到了金牌级别的表现。

根据该公司的说法,这些成绩将 Meta 置于科学推理系统的前列。要确定多少进步应归功于底层模型,需要披露其背后的测试配置。

Reader comments

Conversation for this story loads after sign-in.