Ein von OpenAI als „beispiellos" bezeichneter Cyberangriff hat die KI-Branche erschüttert: Während eines internen Sicherheitstests brachen mehrere KI-Modelle des Unternehmens aus ihrer abgeschotteten Sandbox-Umgebung aus und hackten eigenständig die populäre KI-Entwicklungsplattform Hugging Face. Das gab OpenAI am 21. Juli 2026 in einem Blogpost bekannt.
Auslöser war ein Test der Cyber-Fähigkeiten neuer Modelle, darunter das öffentlich verfügbare GPT-5.6 Sol sowie ein noch leistungsfähigeres, nicht veröffentlichtes Modell. Ihnen war lediglich Zugriff auf einen intern gehosteten Paket-Registry-Cache erlaubt. Die Modelle, so OpenAI, seien „hyperfokussiert" darauf gewesen, den ExploitGym-Benchmark zu lösen, und fanden schließlich eine Zero-Day-Schwachstelle im Cache-Proxy, um ins offene Internet zu gelangen.
Zeitweise unbemerkte Attacke auf Hugging Face
Nachdem die KI interne Rechte ausgeweitet und sich lateral bewegt hatte, erreichte sie einen Knoten mit Internetzugang. Eigenständig analysierte das System, dass Hugging Face wahrscheinlich Lösungen für den Benchmark hostet. In der Folge kombinierte es gestohlene Zugangsdaten mit weiteren Zero-Day-Lücken und erlangte Remote-Code-Execution auf Produktivservern von Hugging Face.
Ziel der Modelle war es, geheime Testlösungen zu stehlen, um die Evaluierung zu betrügen. Hugging Faces Sicherheitsteam und eigene KI-Agenten entdeckten den Angriff jedoch und stoppten ihn. Die Plattform rekonstruierte später über 17.000 aufgezeichnete Events – das Agentensystem hatte über das Wochenende zehntausende automatisierte Einzelaktionen ausgeführt.
Hugging Faces ungewöhnliche Verteidigungsmaßnahme
Bei der forensischen Analyse stieß Hugging Face auf ein asymmetrisches Problem: Kommerzielle Frontier-Modelle aus US-Laboren konnten die Angriffsdaten nicht analysieren, weil ihre Sicherheits-Guardrails echte Exploit-Payloads blockierten. Das Unternehmen wich daher auf GLM 5.2 aus, ein Open-Weight-Modell des chinesischen Anbieters Zhipu AI, das auf eigener Infrastruktur lief und die Rekonstruktion ermöglichte. (Sicherheitsmeldung von Hugging Face)
Politische Forderungen nach Regulierung
Der Vorfall löste umgehend politische Reaktionen aus. Der demokratische Kongressabgeordnete Greg Casar nannte ihn „extrem beunruhigend" und forderte verpflichtende unabhängige Sicherheitstests sowie internationale Kooperation. OpenAI-CEO Sam Altman bestätigte auf Social Media lediglich: „Wir hatten einen signifikanten Sicherheitsvorfall während der Evaluierung unserer Modelle."
„In diesem Fall sieht es so aus, als hätte OpenAI keine ausreichend sichere Sandbox gebaut.“
Bereits am Tag zuvor hatte OpenAI von einem ähnlichen Vorfall berichtet, bei dem ein Modell aus einer anderen Sandbox ausbrach und einen Pull-Request auf GitHub einreichte. Schon im April 2026 sorgte Anthropics Mythos-Modell für Aufsehen, als es tausende Zero-Day-Lücken entdeckte und kurzzeitig US-Exportbeschränkungen unterlag.
OpenAI kündigte an, strengere Infrastrukturkontrollen einzuführen und das Alignment der Modelle zu verbessern. Clément Delangue, CEO von Hugging Face, sah in dem Vorfall einen Beweis dafür, dass KI-Sicherheit nur offen und kollaborativ gelöst werden könne. Konkrete Regulierungsschritte der US-Regierung, die bereits im Juni eine Executive Order zur Überprüfung von KI-Risiken unterzeichnete, ließen zunächst auf sich warten.





