News
Umfassende Sicherheitsüberprüfung von KI-Trainingsdaten durch Truffle Security und Hugging Face
Das Wichtigste in Kürze
- Truffle Security hat in Zusammenarbeit mit Hugging Face den bisher größten Scan von KI-Trainingsdaten durchgeführt.
- Dabei wurden 7,6 Petabyte an Daten auf der Hugging Face Plattform analysiert.
- Insgesamt wurden 221.303 aktive, einzigartige Zugangsdaten in 6.003 öffentlichen Datensätzen entdeckt.
- Die gefundenen Geheimnisse umfassen Cloud-Zugangsschlüssel, Datenbank-Anmeldeinformationen und API-Schlüssel, die erhebliche Sicherheitsrisiken darstellen.
- Die Untersuchung unterstreicht die Notwendigkeit robuster Sicherheitsmaßnahmen in der Lieferkette von KI-Modellen.
Umfassende Sicherheitsanalyse: Truffle Security und Hugging Face scannen KI-Trainingsdaten
In einer bemerkenswerten Zusammenarbeit haben Truffle Security und Hugging Face eine umfangreiche Sicherheitsüberprüfung von KI-Trainingsdaten durchgeführt, die als der bisher größte Scan dieser Art gilt. Diese Initiative zielt darauf ab, die Integrität und Sicherheit der Datensätze zu gewährleisten, die als Grundlage für die Entwicklung und das Training von Künstlicher Intelligenz dienen.
Der Umfang der Analyse
Die Untersuchung umfasste die beeindruckende Menge von 7,6 Petabyte an öffentlichen Datensätzen, die auf der Plattform von Hugging Face gehostet werden. Diese Datenmenge verteilt sich auf 187 Millionen Dateien und repräsentiert einen wesentlichen Teil der weltweit verfügbaren Open-Source-KI-Trainingsdaten. Der Einsatz von Truffle Securitys spezialisiertem Tool TruffleHog ermöglichte eine detaillierte Analyse dieser riesigen Datenmengen, um potenzielle Sicherheitslücken und exponierte Geheimnisse aufzudecken.
Ergebnisse der Untersuchung: Eine Vielzahl von exponierten Geheimnissen
Die Analyseergebnisse sind signifikant: Truffle Security entdeckte 221.303 aktive, einzigartige Zugangsdaten, die in 6.003 öffentlichen Datensätzen verborgen waren. Diese „Geheimnisse“ umfassen eine breite Palette sensibler Informationen, darunter:
- Cloud-Zugangsschlüssel, die potenziell zur Übernahme von Cloud-Konten führen könnten.
- Anmeldeinformationen für gehostete Datenbanken.
- API-Schlüssel, die den Zugriff auf verschiedene Dienste und Plattformen ermöglichen.
- GitHub-Tokens, die das Hochladen von Code in Softwareprojekte mit Millionen von Installationen erlauben.
Die potenziellen finanziellen Auswirkungen dieser Lecks werden auf jährlich etwa 920.000 US-Dollar an Wert für KI-Anbieter-Schlüssel geschätzt. Ein besonders besorgniserregender Befund war, dass ein einziger geleakter Schlüssel in 1.131 verschiedene Datensätze kopiert wurde. Dies verdeutlicht das Problem, dass die Widerrufung eines Schlüssels an der Quelle nicht ausreicht, wenn Kopien in zahlreichen anderen Datensätzen weiterhin aktiv sind und genutzt werden können.
Implikationen für die KI-Lieferkette
Die Ergebnisse dieser Studie unterstreichen eine kritische Schwachstelle in der Lieferkette von KI-Modellen. Öffentliche KI-Datensätze werden oft schnell kopiert, modifiziert und wiederverwendet, was dazu führt, dass geleakte Schlüssel schneller verbreitet werden, als sie widerrufen werden können. Dies schafft ein persistentes Risiko für die gesamte Lieferkette. Die Forschung deutet darauf hin, dass die Sicherheit von KI-Trainingsdaten grundlegend überarbeitet werden muss, um eine systemische Krise in der Open-Source-Infrastruktur zu verhindern.
Präventive Maßnahmen und zukünftige Herausforderungen
Die Notwendigkeit, vor der Veröffentlichung und dem Training von KI-Modellen gründliche Scans durchzuführen und exponierte Anmeldeinformationen umgehend zu rotieren, wird durch diese Untersuchung noch deutlicher. Die Partnerschaft zwischen Truffle Security und Hugging Face ist ein wichtiger Schritt zur Sensibilisierung und zur Implementierung robusterer Sicherheitsstandards in der KI-Community. Es zeigt sich, dass die schnelle Entwicklung und Verbreitung von KI-Modellen eine ebenso schnelle Anpassung und Verbesserung der Sicherheitsstrategien erfordert, um die Integrität und Vertraulichkeit sensibler Daten zu gewährleisten.
Die fortgesetzte Überwachung und proaktive Behebung von Sicherheitslücken in KI-Trainingsdaten ist entscheidend, um das Vertrauen in KI-Technologien zu erhalten und die Risiken für Unternehmen und Nutzer zu minimieren.
Bibliography: - Hugging Face CTO Announces Truffle Security Data Scan Partnership · Digg. (2026, July 31). Digg.com. - Scanning 7.6 Petabytes of HuggingFace Training Data for Secrets. (n.d.). Truffle Security Co. - Truffle Security Co.’s Post. (2026, July 31). LinkedIn. - Truffle Security said its Hugging Face scan found 221,303 live credentials - RuntimeWire. (2026, August 1). RuntimeWire. - How Truffle Security Exposed a Massive Supply Chain Vulnerability on Hugging Face | Ultrathink. (2026, August 1). Ultrathink. - Scanning 7.6 Petabytes of HuggingFace Training Data for Secrets | Vuink.com. (2026, August 1). Vuink.com. - TruffleHog Partners With Hugging Face to Scan for Secrets. (2024, September 4). Truffle Security Co. - TruffleSecurity finds sensitive data in 7.6 PB of Hugging Face AI training data · PulseAugur. (2026, August 1). PulseAugur. - trufflesecurity/trufflehog: Find, verify, and analyze leaked credentials. (n.d.). GitHub. - 🔍 Scanned 22M public cloud dev environments & found 8,792 live secrets! | Truffle Security Co. (2026, April 22). LinkedIn.Passend dazu in Mindverse Studio
- Eigene Modelle und Assistenten trainierenBilden Sie einen digitalen Marken-Experten auf Ihrem Wissen aus.
- Studio mit Ihren Tools verbindenIntegrationen für Microsoft 365, Google Workspace, Slack, Notion und mehr.
- Die KI-Plattform für UnternehmenRollen, Freigaben und Abrechnung für den KI-Einsatz im ganzen Unternehmen.
Weitere News-Artikel
Alle ansehen- Umfassendes Open-Source-Dataset für Text-to-Speech-Modelle veröffentlicht
- Umfassendes Update von Google Fotos zum zehnjährigen Jubiläum
- Der Umgang mit Trainingsdaten in der KI: Ein Blick auf die Kontroversen und Herausforderungen
- Umgang mit Urheberrechten in der KI Entwicklung: Die Kontroverse um Runways Gen-3 Video-KI
- Umsatzpotential und Wachstumstrends in der KI-Branche
- Umstellung des Abrechnungsmodells bei GitHub Copilot auf nutzungsbasierte Token-Systeme
KI, die in Deutschland zu Hause ist.
Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.