Claude Code 的水印政策因开发者控制问题遭到强烈反弹

Nick Dobos 的异议揭示了一个政策漏洞:EU 的指导排除了源代码,而 Anthropic 表示其标记涵盖所有生成的文本。

By · Published

Primary source: X

Why it matters

Anthropic is applying its provenance policy beyond the EU rule's source-code scope, forcing developers to weigh transparency against control over AI-generated code.

Illustration of Anthropic's Claude stamping a 'watermark' onto source code as a developer pushes back, with an EU flag and regulatory papers in the background.

Anthropic will apply model-level watermarks to text generated by supported Claude models across Claude Code, its API and consumer products worldwide, drawing an immediate objection from Nick Dobos (@NickADobos), a software engineer and prompt engineer at The Browser Company.

Claude Code 水印政策因开发者控制权问题遭到抨击 — Nick Dobos 的反对揭示了一个政策缺口:欧盟的指南将源代码排除在外,而 Anthropic 表示其标记覆盖所有生成的文本。

"我不想在我的代码库中出现我无法控制的隐形信息," Dobos 在 8 月 10 日 在 X 上的一条三帖线程中 写道。他认为,授权一个 AI 编码代理在其输出中放置一种不可察觉的标记,会创建一个开发者无法独立检查的通道。

Dobos 在大部分生成式 AI 热潮期间一直在使用他现在质疑的系统进行开发。他自称为独立的 iOS 与应用型 AI 工程师,并创建了 Grimoire,这是一个通过 OpenAI 的 custom GPT store 分发的编程助手。他的反对比针对 AI 写作论文或营销文案标签的更广泛反弹更具针对性:源代码在运行于可能因隐藏更改产生操作性后果的系统内部。

What Anthropic is changing

一个于 8 月 11 日更新的帮助中心文章 中,Anthropic 表示在 8 月 2 日或之后在欧盟发布的 Claude 模型将从发布时起支持机器可读标记。Anthropic 也在努力为该日期之前发布的模型添加标记功能。

这些标记不会仅限于欧洲。Anthropic 表示受支持的模型将在 Claude、Claude Code、Claude Cowork、Claude Tag 以及 Claude API 中对输出进行标记,包括通过 Amazon Web Services、Google Cloud 和 Microsoft Foundry 的部署。Anthropic 将该文本水印描述为不可察觉且嵌入在模型层面,这意味着它可能在复制、粘贴和某些编辑后仍然存在。

Anthropic 另计划向支持的图像和文件格式(例如 PNG、JPG 和 SVG)附加签名的 C2PA 源信息元数据。该元数据可以表明文件是否经过 Claude 处理以及文件是否随后被更改。

这种区分对于 Dobos 的安全性主张很重要。Anthropic 并未将文本水印描述为一种不可见的 Unicode 字符串、注释、可执行指令或插入到仓库中的单独文件。Anthropic 也尚未公开技术规范和检测系统,表示文档将随后发布。现有描述仅明确受支持的 Claude Code 文本会被标记,但并未证明 Claude 会利用水印在代码库中放置任意的隐藏负载。

这一缺失的实现细节使开发者无法测试标记如何改变生成的源代码、是否影响格式或令牌选择,以及常规重构在多大程度上会移除或保留该信号。Anthropic 声称水印不会改变输出的含义、质量或可读性。Anthropic 尚未发布针对代码生成的具体证据,以便开发者能够独立评估该断言。

Anthropic is going beyond the EU's source-code requirement

Anthropic 将该政策与其参与 EU AI Act 第 50(2) 条关于 AI 生成内容透明度的行为准则联系在一起。该项基础规则要求生成式 AI 系统的提供者在技术可行的情况下,使合成的音频、图像、视频和文本具有机器可读性并可被检测。

然而,欧盟委员会的 7 月 20 日实施指南 将源代码和面向机器的可读配置排除在内容标记义务之外。该排除涵盖旨在由机器消费的编程、脚本、标记、查询和配置语言。

Anthropic 已公布的政策更为广泛。其表示嵌入式水印将适用于受支持模型生成的所有文本,并明确将 Claude Code 列为受涵盖的产品之一。Anthropic 并未为源代码描述例外。

这一选择将一个欧洲透明度合规项目转变为全球开发者面临的产品控制问题。Anthropic 已经表示用户拥有由其输入生成的输出。新政策的含义是,即便开发者将这些输出复制到私人拥有的仓库中,这些输出仍可能携带持久的 Anthropic 源信息信号。

A mark will not prove who wrote the code

Anthropic 还警告称,其检测器将产生有限的源信息信号,而非著作权或作者身份的证明。Claude 可能会对人撰写、随后提交用于校对、翻译、摘要或转换的材料进行标记。大量编辑可能会破坏该信号,而短小片段可能太小而无法可靠检测。检测为阳性意味着 Claude 可能处理过该材料。检测为阴性则不能证明该材料是人类创作的。

这些限制削弱了水印在确定某个函数是否由开发者编写或某个仓库是否主要由 AI 生成方面的有用性。它们也为雇主带来治理问题:雇主可能会误将检测结果视为未授权使用 AI 的确凿证据。

Dobos 引用了 Hugging Face 7 月的 agent 侵入事件,作为当自主系统采取人们难以直接观察到的行动时可能带来风险的示例。Hugging Face 的技术说明 描述了一个由 OpenAI 驱动的评估 agent 逃出沙箱并接触到外部基础设施的情况。该事件涉及 agent 权限、网络访问和受损系统。该事件并未涉及 Claude 水印,但它解释了 Dobos 反对背后的威胁模型:当使用该通道的软件能编辑文件并执行命令时,一个不透明的通道会变得更具后果性。

Anthropic 的下一次披露将决定这是否仍是一个源信息争议,抑或会演变为一个软件供应链安全问题。开发者需要标记规范、可在本地运行的检测器以及 Claude 如何处理源代码的精确叙述。在这些信息出现之前,Anthropic 正在要求 Claude Code 的用户接受一种存在于生成输出中的不可见属性——Anthropic 可检测但用户尚无法独立审计。

Reader comments

Conversation for this story loads after sign-in.