Anthropic 削减 Fable 5 的生物学回退措施,同时保持研究限制

对分类器的重写针对日常健康和临床查询,而病毒学、毒理学和分子设计仍然转由 Opus 5 处理。

By · Published

Primary source: Anthropic

Why it matters

Anthropic is turning safety classifiers into a distribution system for frontier capability. The unanswered question is whether fewer false alarms came without more dangerous requests getting through.

Anthropic cuts Fable 5 biology fallbacks while keeping research limits

在其 biology-safeguards announcement 中,Anthropic(由联合创始人 Dario Amodei 和 Daniela Amodei 领导)表示已收窄对 Claude Fable 5 的生物学过滤器。此更改在保留对可能助长生物武器开发研究的限制的同时,减少了被路由到能力较弱模型的合法问题数量。

Anthropic 表示,在其测试中,分类器更新将 与生物学相关的回退约减少了 85%。用户在询问实验室结果、症状、教育材料和一些临床工作时,应更少遇到从 Fable 5 切换到 Opus 5 的情况。Anthropic 仍将涉及病毒学、毒理学和分子设计的请求路由到 Opus 5,使得 Fable 5 在大量专业生物学研究和药物开发工作中不可用。

这一议题与 Dario Amodei 本人的研究背景密切相关。根据 Hertz Foundation profile,在加入 Anthropic 之前,Amodei 曾在 OpenAI 协助指导与 GPT-2 和 GPT-3 相关的研究。Anthropic 最新的产品决定正位于其创始人建立该组织以应对的问题之内:如何分发日益有用的模型,同时不向每一位用户无限制地开放其最危险的能力。

从发布刹车到产品调优

Anthropic 在 6 月 9 日发布了 Claude Fable 5,当时配备了覆盖生物学、化学、网络安全和模型蒸馏的广泛分类器。Anthropic 在发布时表示,几乎所有生物学查询都会回退到 Opus 模型,因为他们的优先目标是在不必等待数周或数月以获取更细粒度生物学控制的情况下,将 Fable 5 的其他能力投放到普遍使用中。

这种方法带来了有意的产品成本。安全分类器是一个较小的自动化系统,用来检查请求,并在本例中决定是否允许 Fable 5 回答。Anthropic 将初始边界设定得足够宽,以捕捉可能无害的问题。结果是,一个面向复杂专业工作的助手在对话一触及生物学话题时,常常变得能力下降。

在过去几周中,Anthropic 表示其重写了分类器规则,收集了内部和外部专家的反馈,构建了新的训练数据,重新训练了分类器,并测试它是否继续在有害和双重用途研究请求上触发。

这一修订显示了 Anthropic 在尚未完成所有防护措施的情况下尝试交付前沿模型的做法。Fable 5 以保守的边界发布,在 Anthropic 工作于更窄的替代方案时生成了关于误报的真实世界证据。此序列让用户更早获得访问权限,并使 Anthropic 能基于实际使用情况完善控制措施。它也使客户在调优期间成为参与者——在分类器赶上之前,合法工作会被削弱。

85% 这一数据留下了关键的测量空白

Anthropic 报告的改进基于其自有测试。8 月 7 日的公告未提供支撑该 85% 减少的数据样本量、测试集、提示分布或假阴性率。最后一项衡量尤为重要:减少误报只有在修订后的分类器仍能继续捕捉危险请求时才有用。

Anthropic 表示他们测试了新分类器是否继续在有害和双重用途的生物学内容上触发。但这并未说明被禁止的提示有多频繁地通过了防护、控制在对抗性规避下的表现如何,或是否有独立评估者测试过修订后的系统。

这一缺失细节尤为重要,因为 Anthropic 描述 Fable 5 在某些复杂生物学工作上能够胜过专家,并在其他任务上提供操作性协助。Anthropic 表示,这些能力既可能帮助研究人员开发医疗治疗,也可能显著提升恶意行为者开发生物武器的能力。这种双重用途风险正是 Anthropic 在发布 Fable 5 时将几乎所有生物学查询封锁的原因。

Roger Brent 和 T. Greg McKelvey Jr. 在一篇 2025 paper 中认为,常见的生物风险评估可能低估 AI 对既无经验用户又受训专家所提供的帮助。该研究早于 Fable 5,但它提高了 Anthropic 新分类器必须满足的标准。无害的提示需要能够通过,而不会把安全防护变成一个可预测的边界,使得复杂的参与者能够绕开。

Anthropic 的谨慎部分基于美国情报界的 2026 Annual Threat Assessment,该评估警告合成生物学和基因组编辑可能创造新的生物威胁,并表示一些对抗国家可能维持进攻性化学和生物武器项目。情报评估确立了威胁环境,但并不验证 Anthropic 的分类器或其性能主张。

受信任访问正成为商业分界线

Anthropic 的更广泛策略是将常见的生物学协助与前沿研究能力分离。普通用户在带有分类器控制的情况下获得 Fable 5。被选定的研究机构预计将通过有治理的项目获得访问,在这些项目中可以移除生物学防护措施,同时保留其他控制。

OpenAI 也采用了类似方法。该公司在 4 月通过针对合格美国组织的受信任访问计划推出了 GPT-Rosalind,并设定了资格、访问管理和治理要求。Anthropic 表示计划通过受信任访问途径为前沿生物能力缩小差距,但其 8 月 7 日的公告并未定义资格或提供申请时间表。

利害关系超越了安全政策。药物开发者和研究机构需要能够跨越文献、实验数据、科学工具和长期工作流程的系统。一个在分子设计方面反复回退的通用助手无法在该市场的最有价值工作中竞争。Anthropic 的分类器重写使 Fable 5 在医疗保健和教育方面更有用,而受限的研究层则是 Anthropic 可以追求更深层科学采用的领域。

Anthropic 的生物学变更紧随一次 6 月的出口管制暂停,该暂停在对一起网络安全防护绕过的审查后暂时使 Fable 5 在全球下线。根据其 redeployment announcement,Anthropic 在 7 月 1 日恢复了访问权限。

对于 Anthropic 的创始人来说,生物学为公司创立命题提供了直接检验。有用与危险的请求往往依赖相同的知识、术语和实验室技术。Anthropic 已使面向消费者的边界不那么严格。其下一项任务是以外部可检验的测量证明,更大的有用性并未扩大被滥用的路径。

Reader comments

Conversation for this story loads after sign-in.