Anthropicが大口契約向けにAIの安全対策を緩和したと元従業員が主張
7月26日のXのスレッドで、元AnthropicのスタッフであるAdi Baradwajは、同社が安全性を収益と引き換えにしたと主張し、ほとんどのブラックハットハッカーが標準のClaude Codeサブスクリプションを利用していると指摘している。
By Ryan Merket · Published
Primary source: X
Why it matters
If true, the trade‑off between safety and revenue could expose enterprise customers to higher risk of AI misuse and trigger regulatory scrutiny.

元Anthropic従業員からの主張
元AnthropicのエンジニアAdi Baradwajは2026年7月26日にXで3ツイートのスレッドを投稿し、AIスタートアップが「大きなコミット支出契約と引き換えに安全対策を緩めた」と主張しました。Baradwajは、Anthropicが多額の利用契約を結んだ顧客に対してClaudeモデルの安全制限を緩和した複数の事例を観察したと書いています。スレッドは全文をこちらで読むことができます。
Baradwajはまた「ほとんどのブラックハットハッカーは標準のClaude Code/Codexサブスクリプションをハッキングに使っているが、ホワイトハットの防御者は…」と主張し、別の参加者の「安全対策は、ほどほどに献身的な行為者を止めるには十分ではない」という引用も挙げました。これらの発言を裏付ける他のAnthropicの従業員やスポークスパーソンはいませんし、同社は公的な回答を出していません。
Anthropicの公表された安全姿勢
Anthropicは2020年に元OpenAI研究者らにより設立され、「Constitutional AI」アプローチに基づいてモデルの意思決定プロセスに倫理的ガイドラインを直接組み込むことで評判を築いてきました。同社はClaudeシリーズを競合する大規模言語モデルに対するより安全な代替として売り出しており、公式サイト(https://www.anthropic.com)では「堅牢なガードレール」と「反復的な安全第一の開発サイクル」を強調しています。
2023年にAnthropicはAI安全性と方針のホワイトペーパーを公開し、コンテンツフィルタ、拒否メカニズム、継続的に更新される安全憲章の層状システムを説明しました。同論文は、モデルの能力と安全性の間に緊張があることを認め、「よりリスクの高い配備は顧客と交渉してカスタムの安全構成を要する場合がある」と述べています。
Baradwajの主張は、実際にはその交渉がカスタマイズの範囲を超えて安全対策の明確な緩和に至っている可能性があり、これは大口企業契約からの商業的圧力に応じたものだという示唆を与えます。
企業向け契約と安全性の経済学
Anthropicの収益モデルはAPIの利用量ベースの価格設定に大きく依存しており、企業が数年単位で大量利用を約束することで割引階層が適用されます。業界アナリストは、単一の企業契約が、特にクライアントがClaudeを顧客向けアプリ、社内ナレッジベース、コード生成パイプラインに統合する場合、年間で数千万ドルに達する可能性があると見積もっています。
もしこの主張が正確であれば、問題とされるトレードオフはAnthropicがこれらの契約からの収益を、より広い市場に向けて打ち出している一貫した安全基準よりも優先させていることを意味します。こうした動きは二層の安全体制を生み出す可能性があり、低支出ユーザーにはより厳格な基準を、高額顧客には緩和されたガードレールを適用することになります。
より広いAIセキュリティの状況
Baradwajの「ほとんどのブラックハットハッカーは標準のClaude Code/Codexサブスクリプションを使っている」という観察は、公開されているAPIキーが自動フィッシングからコードインジェクションに至るまで不正行為に再利用されることが頻繁にあるという最近のセキュリティ研究と整合します。Center for AI Safetyによる2025年の報告書は、Claudeを標的とした数十件のジャイルブレイク(jailbreak)試行を記録しており、多くはモデルのコード生成エンドポイントを悪用して悪意あるスクリプトを作成していました。
逆に、同報告書は倫理的なセキュリティ研究者やレッドチーマーが防御をテストするために同じサブスクリプション階層に頻繁に頼っていることにも言及しており、正当なセキュリティ活動と悪用の境界が曖昧であることを浮き彫りにしています。
「安全対策は、ほどほどに献身的な行為者を止めるには十分ではない」という主張は、AI配備における長年の緊張を示しています:決意したユーザーを完全に阻止できるフィルタは存在しません。しかし、主張の核心はAnthropicが顧客の一部に対して意図的にそうしたフィルタを弱めた可能性があるという点にあります。
顧客と市場への潜在的影響
もしAnthropicが実際に安全対策を削減した契約を提供しているのであれば、企業の買い手はモデルの誤用、規制の精査、評判リスクに対する露出が高まる可能性があります。顧客対応チャットボット、コード支援、コンテンツ生成などにClaudeを利用する組織は、追加の下流監視を実装する必要が生じ、運用負担が増加するかもしれません。
EUおよび米国の規制当局はAIリスクの枠組みを作成し始めており、安全対策の削減をリスクプロファイルの重要な変更と見なして報告義務を発生させる可能性があり、AI Actの規定下での対応を引き起こすことも考えられます。投資家はまた、安全重視ブランドとしてAnthropicに付与してきた評価プレミアムを再評価する可能性があります。
検証の課題と今後の展開
Baradwajのスレッドには直接的な証拠は示されていません—契約の抜粋、内部メモ、変更されたモデル設定のスクリーンショットなどはありません。他のAnthropicスタッフ、顧客、第三者監査からの裏付け証言が欠如しているため、この主張は未検証のままです。
業界の観察者は、異なる契約条件下でのClaudeのAPI応答のコードレベル分析や内部告発者の開示を通じて独立した検証を求める可能性が高いでしょう。そのような証拠が出るまでは、この話はAI安全性に影響を与える商業的圧力に関する継続的な議論に加わる重大な告発として位置づけられます。
読者向けの背景
Anthropicの安全性へのアプローチは、OpenAI、Google、Microsoftが支配する過密な生成AI市場における差別化要因でした。同社の最近の$4 billionのSeries Cラウンド(2024年、Andreessen HorowitzとSequoiaが主導)では、「長期的な安全重視」がコアのバリュープロポジションとして強調されていました。Baradwajの主張が事実であれば、その主張はその物語と著しく対照的なものとなり、投資家、企業の買い手、規制当局がAIサービスにおける性能、コスト、安全性のトレードオフを評価する際に影響を与える可能性があります。