Anthropic 称尚未发布的 Claude 改进了与黎曼猜想相关的一个界限

Anthropic 尚未公布旧的或新的界限、证明、其方法或独立验证,导致数学家无法评估所报告的结果。

By · Published

Primary source: Anthropic

Why it matters

A verified stronger bound would give Claude a concrete contribution to pure mathematics. The brief X post tests whether an internal model result can become auditable research that outside specialists accept.

Illustration of Anthropic's unreleased Claude depicted as a monumental AI confronting the Riemann Hypothesis and the zeta-function zeros on the critical line.

Anthropic,由 Dario 和 Daniela Amodei 共同创办的 AI 实验室,表示一个未发布的研究版 Claude 提高了一个与黎曼假设相关的下界,但它尚未公布旧数值或新数值、证明或独立的数学审查。

Anthropic 在 X 上

Anthropic 表示 Claude 并未证明该假设。该模型处理的是可以被证明位于临界线(实部等于 1/2)上的黎曼 ζ 函数非平凡零点的比例问题。

在为本篇文章审阅的公开材料中,无法确定该研究运行的日期,X 帖子的日期亦未被独立核实。Anthropic 未披露模型的方法、工具或计算资源。它也未指出研究人员或审稿人身份,或发布包含可检验推导的论文。

这些遗漏使得无法评估 Claude 是否改进了已发表的结果、重现了已知工作,或提出了能经受专家审查的论证。可供本篇文章查阅的 Anthropic 帖子文本在单词 "from" 之后立刻结束,并未给出任一下界数值。

A mathematical claim needs a checkable proof

黎曼假设指出,每一个 ζ 函数的非平凡零点都位于临界线。部分进展来自于证明越来越大比例的这些零点位于该直线上。

Kyle Pratt、Nicolas Robles、Alexandru Zaharescu 和 Dirk Zeindler 的论文 证明了超过十二分之五的零点位于临界线。那略高于 41.67%,为 Anthropic 的声明提供了一个公开的比较基准。现有证据并不能证明 Claude 超过了该指标。

模型生成的推导在专家能够检视其假设和证明、复现推理并寻找错误之后,才算成为数学上的进展。Anthropic 的帖子并未提供这些材料。它称该系统为 Claude 的“未发布研究版(unreleased research version)”,但没有将其与 Claude Opus、Claude Sonnet、Claude Science 或其他具名模型关联起来。

同样的信息披露缺口也存在于研究设置方面。Anthropic 尚未说明 Claude 是否使用了定理证明器、计算机代数软件、网络访问、代码执行或大量推理时的计算。它也未描述人类提供了多少引导,或在报告输出之前有多少次未成功尝试。

Anthropic 明确表示 Claude 并未解决黎曼假设。更窄的下界声明仍然需要像人类数学家所做工作那样的发表与审查。

The Amodeis are building auditable research workflows

Anthropic 是一家总部位于旧金山的公共利益公司,成立于 2021 年,创始团队由前 OpenAI 员工组成。根据 Anthropic 的公司资料,Dario 和 Daniela Amodei 与 Jared Kaplan、Jack Clark、Chris Olah、Sam McCandlish 和 Tom Brown 一同参与创办。

Dario Amodei 通过科学进入 AI 领域。根据他的个人简介,他以 Hertz Fellow 身份在 Princeton University 获得生物物理学博士学位,在 Stanford School of Medicine 完成博士后工作,随后在 Google Brain 和 OpenAI 工作。在创立 Anthropic 之前,他在 Google Brain 和 OpenAI 从事神经网络研究、语言模型扩展与 AI 安全方面的工作。一篇 OpenAI 的组织更新 表示,Amodei 在与构建 GPT-2 和 GPT-3 的团队协作时做出了贡献。

Daniela Amodei,Anthropic 的联合创始人兼总裁,曾在加入 Anthropic 前在 OpenAI 管理技术团队,后成为负责安全与政策的副总裁。她曾在斯坦福商学院的访谈中自述为通才,并讨论了好奇心与“激进责任感(radical responsibility)”。

科学研究也正成为一种付费的 Claude 工作流程。6 月 30 日,Anthropic 推出 Claude Science,一个将 Claude 连接到研究工具、数据库和计算资源的 AI 工作台。Anthropic 表示该产品保留了输出背后的代码、环境细节和消息历史,以便研究人员进行审计和复现。一个审稿代理会检查计算和引用,并标记那些与其底层代码不匹配的图表。

Claude Science 已进入 Pro、Max、Team 和 Enterprise 用户的测试阶段。Anthropic 在为本篇文章审阅的材料中未提供关于 Claude Science 的单独定价、客户、收入或使用数据。它也未表示黎曼实验使用了 Claude Science。

该产品的审计追踪解决了 AI 辅助研究中的一个商业障碍:客户需要能够通过数据、代码和假设追溯结果。Anthropic 尚未就黎曼声明提供可比较的记录。

Verification is becoming part of the competition

Anthropic 正在与将验证内置于研究系统的一般性 AI 实验室和专注于数学的公司竞争。

在 2 月 11 日的一则公告中,Google DeepMind 描述了 Gemini Deep Think 为一个在专家数学家和科学家指导下使用验证的研究系统。

OpenAI 在生命科学领域走了类似的路线。其 GPT-Rosalind research preview 将专门化模型与科学数据库和工具结合,同时将初始访问限制于合格机构。Google 另行描述了一个旨在协助研究人员提出科学假设和提案的多代理 Co-Scientist 系统

专门化的竞争对手正集中于数学领域。根据 Axios,Harmonic 正在开发 Aristotle。Axios 还报道称 Axiom Math 表示其 AxiomProver 生成可由机器检验的 Lean 证明,并由单独的校验器验证每一步。Axios 称 Axiom 在 2026 年 3 月以 16 亿美元估值融资 2 亿美元,其证明已被五个顶级期刊接受。

Anthropic 关于黎曼的结果目前无法通过其已公布的信息被复现。若公开旧数值与新数值、模型身份、研究日期、工具、计算资源与证明,数学家就能判断 Claude 是否贡献了原创结果,以及它是否超越了已发表的十二分之五基准。在此之前,现有证据支持的是 Anthropic 关于内部模型的声明,而非被接受的数学进展。

Reader comments

Conversation for this story loads after sign-in.