Truffle Security dijo que su escaneo de Hugging Face encontró 221,303 credenciales activas.
El TruffleHog de Dylan Ayrey, creado en un sofá, encontró claves reutilizadas en corpora públicos de IA, donde borrar una fuente no puede eliminar sus copias.
By Ryan Merket · Published
Primary source: Truffle Security
Why it matters
Public AI datasets are copied and remixed faster than leaked keys are revoked, turning one exposed credential into a persistent supply-chain risk.

Dylan Ayrey (@InsecureNature), el cofundador y CEO de Truffle Security, dijo que su escáner de seguridad encontró 221,303 credenciales activas y únicas en 6,003 conjuntos de datos públicos alojados por Hugging Face. Los hallazgos provinieron de un escaneo que cubrió 7.6 petabytes de datos, según la investigación que Truffle publicó el 1 de junio.
La escala dista mucho de cómo empezó Ayrey. En 2017, mientras estaba desempleado y dormía en el sofá del cofundador Dustin Decker, escribió la primera versión de TruffleHog para buscar claves de API en el historial de Git y enviar informes para bug bounty. Una de esas búsquedas sacó a la luz una credencial en un repositorio público de Netflix; Ayrey más tarde hizo trabajo de seguridad para Netflix. Él y Decker, que se conocieron como estudiantes en Rochester Institute of Technology, convirtieron el proyecto de código abierto en Truffle Security en 2021, según la crónica de RIT sobre su historia de fundación.
Ese problema original se ha extendido desde los repositorios de código fuente hacia la materia prima que se usa para construir sistemas de IA. Los corpus de entrenamiento públicos se ensamblan a partir de código, sitios web, documentos técnicos y transcripciones de chats, luego se filtran, copian y recombinan en conjuntos de datos derivados. Una credencial expuesta una vez puede sobrevivir a través de muchas de esas copias mucho después de que se elimine su archivo original.
Lo que Truffle dice que encontró
Truffle dijo que clonó todos los repositorios de conjuntos de datos públicos en Hugging Face, incluidas ramas y objetos de archivos grandes, y luego convirtió formatos como Parquet, Arrow, JSONL y archivos en texto que TruffleHog pudiera escanear. La carga de trabajo reportada cubrió 186.9 millones de archivos únicos a lo largo de aproximadamente 815,000 repositorios.
Alrededor de 670,000 repositorios completaron el proceso sin problemas, según la publicación. Eso deja aproximadamente 145,000 que no lo hicieron, basándose en las cifras redondeadas de Truffle. La distinción limita la afirmación de Truffle de que escaneó "cada conjunto de datos público": Truffle intentó una cobertura de plataforma completa, mientras que una parte importante de los repositorios no se completó correctamente.
Truffle dijo que verificó las credenciales candidatas directamente con los servicios que las emitieron. Sus hallazgos reportados incluyeron 8,557 claves de cuentas de servicio de Google activas, 8,594 inicios de sesión de bases de datos que funcionaban, 3,343 claves de AWS que pasaron verificaciones de identidad, 231 tokens de Slack y 5,654 claves de Mailgun. El escaneo también encontró credenciales capaces de cambiar software distribuido a otros usuarios, incluyendo 223 tokens de GitHub con acceso completo de escritura a repositorios y 318 tokens de Docker Hub que podrían subir imágenes.
El equipo de Ayrey dijo que limitó sus comprobaciones a autenticación y metadatos, como tamaños de bases de datos, totales de almacenamiento y permisos. Truffle dijo que no leyó filas de bases de datos, listó objetos almacenados, descargó archivos ni modificó sistemas.
El número quizá más trascendente puede ser la tasa de duplicación. Truffle reportó que el 44% de las credenciales únicas y activas aparecieron en múltiples conjuntos de datos, con 19,380 apareciendo en al menos 10. Una clave de Infura apareció en 1,131 conjuntos de datos y 10,162 ubicaciones de archivos después de ser pegada en una conversación de chatbot y barrida hacia un corpus de registros de chat públicos, según la investigación.
Ese patrón de copiado cambia la respuesta requerida después de una filtración. Eliminar una credencial de un repositorio o conjunto de datos deja otras versiones intactas. La rotación en el proveedor emisor es la única manera confiable de dejar inútil cada copia.
Hugging Face ya estaba escaneando las cargas
La investigación no presenta a Hugging Face como la fuente de las credenciales expuestas. La mayoría se originaron en código público, sitios web o conversaciones que los compiladores de conjuntos de datos luego recolectaron. Truffle dijo que, entre los tokens de escritura y de administración de organización rastreables de Hugging Face, aproximadamente 700 habían sido raspados (scraped) de material perteneciente a alguien distinto del publicador del conjunto de datos, mientras que 63 fueron subidos por sus propietarios en sus propios espacios de nombres.
La documentación de seguridad de Hugging Face dice que la plataforma ejecuta TruffleHog en cada push y envía correos electrónicos a los usuarios cuando detecta un secreto verificado. Truffle dijo que el CTO de Hugging Face, Julien Chaumond, también contribuyó con soporte nativo de escaneo de buckets de almacenamiento a TruffleHog.
Esos controles dependen de que los usuarios revoquen las credenciales expuestas después de una alerta. Las claves activas en el escaneo de Truffle muestran la brecha entre detección y remediación: una advertencia no neutraliza una credencial, y un secreto copiado de una fuente ascendente puede pertenecer a alguien que no tiene relación con el publicador del conjunto de datos que recibe la alerta.
Ayrey está convirtiendo un escáner de código abierto en una empresa de seguridad para IA
El proyecto en Hugging Face le da a Truffle Security una demostración a gran escala del motor de verificación que está en el centro de su producto comercial. TruffleHog clasifica credenciales e intenta determinar si todavía autentican, permitiendo a los equipos de seguridad separar el acceso activo de las cadenas que solo se parecen a claves.
Truffle Security recaudó una Serie A de $14 millones liderada por Andreessen Horowitz en 2021. El 6 de noviembre de 2025, Truffle anunció una Serie B de $25 millones liderada por Intel Capital y a16z, con la participación de Abstract, Lytical Ventures y varios ejecutivos de seguridad. No se divulgó la valuación.
La Serie B financió la expansión de Truffle desde encontrar credenciales expuestas hacia el análisis de a qué puede acceder cada credencial. La investigación en Hugging Face sigue la misma dirección. Contar claves crea un titular; verificar permisos, infraestructura alcanzable y rutas de duplicación da a los equipos de seguridad un orden para la remediación.
La investigación también sirve a los intereses comerciales de Truffle. Un escaneo que muestre credenciales dispersas a través de datos de IA populares presenta un caso directo para escanear los corpus antes de su publicación y entrenamiento. Esa alineación no invalida los hallazgos, aunque eleva el estándar de la evidencia.
Truffle publicó la metodología y los resultados agregados mientras retuvo los nombres de los conjuntos de datos afectados, las rutas de archivos y el material de las credenciales para prevenir el abuso. Esa decisión protege a los propietarios de las credenciales, pero también significa que investigadores externos no pueden reproducir el total del titular solo a partir de la publicación. Las cifras siguen siendo resultados auto-reportados por Truffle en lugar de una medición replicada de forma independiente.
El modo de fallo subyacente está claro incluso con esa limitación. Los desarrolladores de IA han tratado los conjuntos de datos públicos como insumo inerte. El escaneo de Ayrey muestra que también pueden contener acceso operativo a cuentas en la nube, bases de datos, sistemas de comunicaciones y canales de distribución de software. Cada remix preserva la credencial hasta que su propietario la rota, dando a una herramienta de bug bounty escrita en un sofá un nuevo trabajo: vigilar la cadena de suministro de datos de IA.