对 Claude Code 的逆向工程称存在隐藏的 Fable 5 模型切换
Lon 表示,一个 Claude Code 路径可以将请求路由到 Opus 4.8,而不会显示 Anthropic 自己的帮助页面所承诺的通知和选择退出选项。
By Ryan Merket · Published
Primary source: X
Why it matters
AI coding tools increasingly act on entire repositories for hours at a time. An undisclosed model switch can change capability, behavior and audit trails in the middle of production work.

Lon (@Lon) 于 7 月 30 日发布了一个 27 条推文的线程,声称 Anthropic 的 Claude Code 客户端可以在不显示用户界面警告且绕过用于禁用自动模型切换的设置的情况下,悄然将请求从 Claude Fable 5 转移到 Claude Opus 4.8。
这一指控触及了由兄妹 Dario Amodei 和 Daniela Amodei 创立、以构建可靠且可控系统为目标的 AI 实验室 Anthropic 的产品承诺。Anthropic 公开表示,会将部分 Fable 5 的请求作为安全措施路由到 Opus 4.8。争议焦点在于 Claude Code 是否包含用户不可见或不可控的额外回退路径。
Lon 表示,该发现来自对 Claude Code 已编译二进制内的压缩客户端代码进行逆向工程,并对比通过 npm 分发的版本。线程中附带的截图描述了三种可能的机制:一种可见的回退,会显示对话并尊重用户的切换偏好;一种静默的客户端重试;以及一种由服务器指示的模型更改。

根据 Lon 的分析,可见路径会检查 Claude Code 的 switchModelsOnFlag 设置。所称的静默路径则不会。Lon 还识别出一个标记为 tengu_convolute_arcades_retry 的遥测事件,线程将其作为证据,表明客户端可以通过回退机制重试请求而不显示通知。
Lon 将静默回退代码追溯到 Claude Code 版本 2.1.157,并表示在 7 月 20 日发布的 2.1.216 版本中,Fable 5 的模型注册表中新增了 refusal_fallback 功能。这些基于捆绑客户端代码的版本级别发现目前仍属指控。截图最多只能证明 Claude Code 包含能够处理回退事件的路径。它们并不能证明 Anthropic 的服务器调用这些路径的频率,也不能说明有多少用户收到了未被披露的替换。
Anthropic 承诺可见的切换
Anthropic 的文档描述了不同的行为。在一篇 7 月 1 日的帮助中心文章 中,Anthropic 表示自动回退应显示一条说明切换的通知并在响应上标注实际回答的模型。随后模型选择器应保持在 Opus 4.8,直到用户自行切换回来。
同一篇文章称,用户可以通过 Switch models when a message is flagged 设置禁用自动切换。关闭该选项后,Anthropic 表示被阻止的 Fable 5 请求应暂停会话,而不是在 Opus 上重新运行。Lon 的核心主张是,有一条客户端路线会忽略该控制。
Anthropic 并未将所有 Fable 到 Opus 的路由都表述为错误。Dario 和 Daniela Amodei 的公司在 6 月 9 日推出 Fable 5 时 表示,分类器会将涉及网络安全、生物学和化学、模型蒸馏以及某些前沿模型开发工作的请求重定向。Anthropic 表示这些分类器是刻意保守的,可能会拦截无害请求。
该公司还承诺,每当请求回退到 Opus 4.8 时会通知用户。即便底层路由是 Fable 5 预期的安全设计的一部分,这一可见性承诺也使得透明性问题具有重要意义。
其他用户也报告了回退问题
Anthropic 公开的 Claude Code 仓库中的报告证实了意外或破坏性切换的更广泛问题,尽管这些报告并未独立核实 Lon 所称的隐藏路径。在 6 月 10 日开启的一个 issue 中,一位用户称普通的 Rust 系统编程工作触发了 Fable 5 的分类器并将会话移到了 Opus 4.8。该报告包含了一个可见的切换横幅,这与 Lon 描述的行为不同,并称该回退在剩余会话期间保持粘性。
另一个 6 月 9 日的报告 描述了在开发者检查启动代码以查找漏洞时 Fable 5 切换到 Opus。那些投诉符合 Anthropic 的警告,即防御性安全工作可能产生误报。它们也说明了在长期编码会话中模型身份为何重要:一次切换会改变处理代码库的系统、其推理行为,以及可能正在进行任务的连续性。
这些模型也位于不同的产品层级。Anthropic 将 Fable 5 称为其最强大的广泛发布模型,并按每百万输入 token 收费 10 美元、每百万输出 token 收费 50 美元。Opus 4.8 的费用分别为 5 美元和 25 美元。Anthropic 表示,被输入阻止的请求会完全按 Opus 费率计费,而中途切换可能会导致两个模型的费用分摊。
对于因能力而非价格选择 Fable 的开发者来说,即便计费正确调整,隐藏的替换也会破坏可重现性和可审计性。眼下的事实问题比 Lon 最初的指控更为狭窄:Anthropic 的生产服务器是否使用了逆向工程所识别的那些静默客户端路径。仅凭客户端代码无法回答该问题。但它确实揭示了 Claude Code 看似能够支持的行为与 Anthropic 文档中所述的可见、用户可控回退之间的差距。