Truffle Securityは、自社のHugging Faceスキャンで221,303件の有効な認証情報が見つかったと述べた。

Dylan Ayreyのソファ発のTruffleHogは、公開AIコーパスにまたがって再利用された鍵を発見した。そこでは、1つのソースを削除してもそのコピーを消すことはできない。

By · Published

Primary source: Truffle Security

Why it matters

Public AI datasets are copied and remixed faster than leaked keys are revoked, turning one exposed credential into a persistent supply-chain risk.

Illustration of TruffleHog as a truffle pig rooting through a pile of data and unearthing digital keys labeled as credentials, referencing Truffle Security's Hugging Face scan.

Dylan Ayrey (@InsecureNature)Truffle Security の共同創業者兼CEOは、自身のセキュリティスキャナーが Hugging Face でホストされている6,003の公開データセットにまたがって221,303件の有効な一意の認証情報を発見したと述べた。これらの発見は、Truffleが6月1日に発表した調査によると、7.6ペタバイトのデータをカバーするスキャンから得られたものだ。

この規模は、Ayreyが始めた当初とは大きく異なる。2017年、失業中で共同創業者のDustin Deckerのソファで寝泊まりしていた彼は、Gitの履歴からAPIキーを探しバグバウンティレポートを提出するための最初のバージョンのTruffleHogを書いた。その検索の一つで公開されたNetflixのリポジトリ内に認証情報が見つかり、Ayreyは後にNetflixでセキュリティ業務を行った。彼とDeckerは、Rochester Institute of Technologyの学生時代に出会い、オープンソースプロジェクトを2021年にTruffle Securityに発展させたと、RITの創業物語の説明は伝えている。

その元々の問題は、ソースコードリポジトリからAIシステム構築に使われる原材料へと広がっている。公開トレーニングコーパスは、コード、ウェブサイト、技術文書、チャットの書き起こしから組み立てられ、フィルタリング、コピー、再結合されて派生データセットになる。一度露出した認証情報は、元のファイルが削除された後でも多くのコピーにわたって生き残る可能性がある。

Truffleが報告した内容

Truffleは、Hugging Face上のすべての公開データセットリポジトリを、ブランチや大きなファイルオブジェクトを含めてクローンし、Parquet、Arrow、JSONLやアーカイブといったフォーマットをTruffleHogがスキャン可能なテキストに変換したと述べた。報告された作業量は、約81.5万のリポジトリにまたがる1億8690万のユニークファイルをカバーしたという。

投稿によれば、約67万のリポジトリは正常に完了した。丸めた数字に基づくと、正常に完了しなかったのは約14.5万リポジトリとなる。この差は、Truffleが「すべての公開データセット」をスキャンしたと主張することへの制約を生む:Truffleはプラットフォーム全体のカバレッジを試みたが、かなりの割合のリポジトリは正常に完了しなかった。

Truffleは、候補となる認証情報を発行元のサービスと直接照合して検証したと述べた。報告された発見には、8,557件の有効なGoogleサービスアカウントキー、8,594件の機能するデータベースログイン、3,343件のIDチェックを通過したAWSキー、231件のSlackトークン、5,654件のMailgunキーが含まれている。スキャンはまた、他のユーザーに配布されるソフトウェアを変更できる認証情報も見つけており、リポジトリへのフル書き込みアクセスを持つ223件のGitHubトークンや、イメージをプッシュできる318件のDocker Hubトークンなどが含まれる。

Ayreyのチームは、チェックを認証やメタデータ(データベースサイズ、ストレージ合計、権限など)に限定したと述べた。Truffleは、データベースの行を読み取ったり、保存されたオブジェクトを一覧表示したり、ファイルをダウンロードしたり、システムを改変したりはしていないと述べている。

最も重要な数字は重複率かもしれない。Truffleは、ユニークな有効認証情報の44%が複数のデータセットに出現し、19,380件が少なくとも10箇所で見つかったと報告した。あるInfuraキーは、チャットボットの会話に貼り付けられ、それが公開チャットログコーパスに取り込まれた後、1,131のデータセットと10,162のファイル位置に出現したと研究は述べている。

このようなコピーのパターンは、流出後に必要な対応を変える。あるリポジトリやデータセットから認証情報を削除しても、他のバージョンはそのまま残る。発行プロバイダでのローテーションが、あらゆるコピーを無効にする唯一の確実な方法だ。

Hugging Faceは既にアップロードをスキャンしていた

この調査は、Hugging Face自体が露出した認証情報の発生源であると断定するものではない。大半は、データセット作成者が後に収集した公開コード、ウェブサイト、会話に由来している。Truffleは、トレース可能なHugging Faceの書き込み(write)および組織管理(organization-admin)トークンのうち、およそ700件はデータセット公開者以外の誰かに属する資料からスクレイプされたもので、63件は所有者が自分の名前空間にアップロードしたものだったと述べた。

Hugging Faceのセキュリティドキュメントによれば、プラットフォームは各プッシュでTruffleHogを実行し、検証済みのシークレットを検出した際にユーザーにEメールを送信するという。Truffleは、Hugging FaceのCTOであるJulien ChaumondがTruffleHogにネイティブのストレージバケット走査サポートを寄与したとも述べている。

これらの制御は、アラート後にユーザーが露出した認証情報を取り消すことに依存している。Truffleのスキャンで見つかった有効なキーは、検出と修復の間のギャップを示している:警告は認証情報を無効化しないし、上流ソースからコピーされたシークレットは、アラートを受け取ったデータセット公開者と何ら関係のない誰かの所有物である可能性がある。

AyreyはオープンソーススキャナーをAIセキュリティ企業へと変えている

Hugging Faceのプロジェクトは、Truffle Securityに商用製品の中心にある検証エンジンの大規模デモンストレーションを提供する。TruffleHogは認証情報を分類し、それらがまだ認証に使えるかどうかを判定しようとするため、セキュリティチームは実際のアクセス権を持つものと単にキーに似た文字列を区別できる。

Truffle Securityは2021年にAndreessen Horowitz主導の1400万ドルのSeries Aを調達したと発表した。On November 6, 2025, Truffle announced a $25 million Series B led by Intel Capital and a16z、Abstract、Lytical Venturesおよび複数のセキュリティ幹部が参加した。評価額は開示されていない。

Series Bは、露出した認証情報の発見から各認証情報が何にアクセスできるかを分析する方向へのTruffleの拡張に資金を提供した。Hugging Faceの調査も同じ方向に従っている。キーの数を数えることは見出しを作るが、権限、到達可能なインフラ、重複経路を検証することがセキュリティチームに修復の優先順位を与える。

この研究はまたTruffleの商業的利益にも資する。人気のあるAIデータに認証情報が散在していることを示すスキャンは、公開やトレーニング前にコーパスをスキャンすることの正当性を直接的に示す。その整合性が発見を無効化するわけではないが、証拠の水準を引き上げる。

Truffleは、悪用を防ぐために影響を受けたデータセット名、ファイルパス、認証情報の素材を公開せずに手法と集計結果を公表した。その決定は認証情報の所有者を保護するが、外部の研究者が投稿だけから見出しの合計を再現することを不可能にしている。これらの数字は、独立して再現された計測ではなくTruffle自身の自己報告の結果のままである。

その制約があっても、根本的な失敗モードは明らかだ。AI開発者は公開データセットを不活性な入力とみなしてきた。Ayreyのスキャンは、それらがクラウドアカウント、データベース、通信システム、ソフトウェア配布チャネルへの実際に機能するアクセスを含み得ることを示している。各リミックスは所有者がローテーションするまで認証情報を保持するため、ソファで書かれたバグバウンティツールにAIデータサプライチェーンを監視する新たな役割を与えている。

Reader comments

Conversation for this story loads after sign-in.