Anthropic 据称为大额合同降低了 AI 安全防护措施,前员工称

在7月26日的X线程中,前Anthropic员工Adi Baradwaj声称该公司以安全为代价换取收入,并指出大多数黑帽黑客使用的是标准Claude Code订阅。

By · Published

Primary source: X

Why it matters

If true, the trade‑off between safety and revenue could expose enterprise customers to higher risk of AI misuse and trigger regulatory scrutiny.

Illustration of a compromised industrial data lock labeled "Claude", representing Anthropic and its alleged weakening of AI safeguards for large contracts.

来自前 Anthropic 员工的指控

前 Anthropic 工程师 Adi Baradwaj 于 2026 年 7 月 26 日在 X 发布了一篇三推连发,声称这家 AI 初创公司“为换取大额承诺支出合同而降低了保障措施”。Baradwaj 写道,他观察到 多个案例,Anthropic 在客户签署大额使用协议时降低了对其 Claude 模型的安全限制。完整帖文可在 此处 阅读。

Baradwaj 还声称“多数黑客使用标准的 Claude Code/Codex 订阅进行攻击,而白帽防御者……”并引用了第二位参与者的话称“保障措施不足以阻止一个有中等决心的行为者”。目前没有其他 Anthropic 员工或发言人证实这些说法,公司也尚未发表公开回应。

Anthropic 公开声明的安全立场

Anthropic 成立于 2020 年,由前 OpenAI 研究人员创立,以将伦理准则直接嵌入模型决策过程的 "Constitutional AI" 方法著称。公司在其官方网站上将 Claude 系列宣传为相较于竞争性大型语言模型更安全的选择,强调“稳健的护栏”与“以安全为先的迭代开发周期”。

2023 年,Anthropic 发布了一份 AI safety & policy 白皮书,描述了分层的内容过滤、拒绝机制以及持续更新的安全宪章。该白皮书承认模型能力与安全之间存在张力,并指出“高风险部署可能需要与客户协商的定制安全配置”。

Baradwaj 的指控表明,在实际操作中,这种协商可能已从定制化越过为对部分客户明确放宽保障措施的界限,可能是为了满足大型企业合同带来的商业压力。

企业合同与安全的经济学

Anthropic 的收入模式在很大程度上依赖基于使用量的 API 定价,并为承诺多年高量级支出的企业提供折扣档位。行业分析师估计,单笔企业合同的年额可达到数千万美元,尤其是在客户将 Claude 集成到面向客户的应用、内部知识库或代码生成流水线时。

如果该指控属实,意味着 Anthropic 在这些合同上优先考虑收入,而非对更广泛市场所宣传的一致性安全标准。这种做法可能造成双轨的安全体系:对低支出用户维持更严格的基线,而对高价值客户放宽一套护栏。

更广泛的 AI 安全格局

Baradwaj 所述“多数黑客使用标准 Claude Code/Codex 订阅”的观察,与近期安全研究结果相符:公开可得的 API 密钥常被改作非法用途,从自动化钓鱼到代码注入不等。Center for AI Safety 在 2025 年的一份报告记录了数十起针对 Claude 的越狱尝试,常通过模型的代码生成端点生成恶意脚本。

相反,同一报告也指出,合伦理的安全研究人员与红队成员经常依赖相同的订阅档位来测试防御,凸显了合法安全工作与滥用之间的模糊界限。

“保障措施不足以阻止一个有中等决心的行为者”这一说法突显出 AI 部署的长期矛盾:没有一套过滤机制能完全阻止决心坚定的用户诱导模型产生被禁止的行为。然而,指控的核心在于 Anthropic 可能是有意为某些客户削弱了这些过滤机制。

对客户与市场的潜在影响

若 Anthropic 确实提供了减少保障的合同,企业买家可能面临更高的模型滥用暴露、监管审查和声誉风险。依赖 Claude 提供客户服务聊天机器人、代码辅助或内容生成的组织,可能需要实施额外的下游监控,从而增加运营开销。

欧盟与美国的监管机构已开始起草 AI 风险框架,可能将安全保障减少视为风险状况的实质性变化,从而触发即将实施的 AI Act 条款下的报告义务。投资者也可能重新评估 Anthropic 作为以安全为卖点的品牌所获得的估值溢价。

验证的挑战与后续步骤

Baradwaj 的连发未提供直接证据——没有合同摘录、内部备忘录或更改模型配置的截图。缺乏其他 Anthropic 员工、客户或第三方审计的佐证,意味着该指控仍未得到核实。

业界观察者可能会寻求通过在不同合同条件下对 Claude 的 API 响应进行代码级分析,或通过举报者披露来独立核实。在此类证据出现之前,此事仍是一项严重的指控,并为正在进行的关于商业压力如何影响 AI 安全的讨论增添了新内容。

供读者参考的背景

Anthropic 在由 OpenAI、Google 和 Microsoft 等主导的拥挤生成式 AI 市场中,将其安全取向作为差异化要素。公司在 2024 年由 Andreessen Horowitz 和 Sequoia 领投的 40 亿美元 Series C 融资突出了其“长期安全关注”作为核心价值主张。若 Baradwaj 的指控属实,将与该叙事形成鲜明对比,并可能影响投资者、企业买家和监管者在评估 AI 服务的性能、成本与安全权衡时的判断。

Reader comments

Conversation for this story loads after sign-in.