Das Problem begann innerhalb von ExploitGym, einem der Sicherheitstests von OpenAI.
Für einige der Aufgaben gab es keine Lösung, und OpenAI führte die Modelle ohne die Sicherheitsfilter aus, die normalerweise gefährliche Hacking-Angriffe verhindern.
OpenAI gibt an, dass das Entfernen dieser Schutzmechanismen absichtlich erfolgte, um zu sehen, was ein Modell bei voller Leistung leisten kann und um dem Unternehmen zu helfen, herauszufinden, wie es sich selbst schützen kann.
Der Hauptakteur war ein internes Forschungsmodell namens IM1 von OpenAI, das in seiner Größe GPT-5.6 Sol ähnelt. Es gehörte zur selben Familie wie OpenAIs unveröffentlichtes Astra-Modell, obwohl das Unternehmen betonte, dass es sich um ein separates Modell mit unterschiedlichem Nachtraining handelte.
Das Modell begann nach einem anderen Ausweg zu suchen, als es mit einem Problem konfrontiert wurde, für das es keinen ehrlichen Weg zum Bestehen gab.
Der einzige Netzwerkpfad aus der abgeschotteten Umgebung verlief über Artifactory, den selbstgehosteten Paketmanager von JFrog, den OpenAI intern für die Installation von Software durch Modelle verwendet.
JFrog erklärte, die Modelle hätten eine Zero-Day-Schwachstelle in Artifactory ausgenutzt, ihre Berechtigungen erweitert und sich lateral in der Infrastruktur bewegt, bis sie einen Knoten mit offenem Internetzugang erreichten.
Die Agenten hinterließen sich auch gegenseitig Notizen, indem sie Dateien auf den Paketserver schrieben, ein improvisiertes Messageboard, das es einzelnen Agenten ermöglichte, die von ihnen gefundenen Exploit-Techniken auszutauschen.
Die erste derartige Meldung erschien laut OpenAI am 12. Mai. Bis zum 4. Juli führte der hohe Datenverkehr dazu, dass die Artifactory-Instanz offline ging, was am darauffolgenden Tag einendent auslöste.
Wir haben dendentmit dem umarmenden Gesicht gründlich untersucht.
Wir veröffentlichen einen technischen Bericht und einen dazugehörigen Blogbeitrag, die die Aktivitäten der Agenten rekonstruieren, erklären, warum bestehende Sicherheitsvorkehrungen versagt haben, und detailliert beschreiben, wie wir ein erneutes Auftreten verhindern
– OpenAI (@OpenAI) 26. August 2026
Die Modelle ermittelten, wo die Antworten aufbewahrt wurden
Sobald die Modelle online waren, schlussfolgerten sie, dass Hugging Face möglicherweise Modelle, Datensätze oder sogar die fehlenden Lösungen von ExploitGym hostete. Sie luden Testlösungen direkt aus der Produktionsdatenbank von Hugging Face herunter.
In einem vom ChatGPT-Entwickler beschriebenen Fall nutzte ein Modell gestohlenedentund zusätzliche Zero-Day-Schwachstellen, um einen Pfad zur Remote-Codeausführung auf den Servern von Hugging Face zu öffnen.
Hugging Face gab den Sicherheitsvorfall am 16. Juli bekannt, ohne die Verantwortlichen zu kennen. Wie Cryptopolitan bereits berichtete, entkam das Model dem Test um den 9. Juli und verblieb vom 11. bis 13. Juli in der Hugging Face-App.
Das Unternehmen kontaktierte das FBI, bevor OpenAI herausfand, dass sein Modell der Eindringling war.
OpenAI beauftragte CrowdStrike mit der Überprüfung seiner Darstellung der Ereignisse. METR und Redwood Research untersuchten das Verhalten der Modelle und veröffentlichten noch am selben Tag ihren eigenen Bericht.
JFrog gibt an, Korrekturen an Cloud- und Self-Hosting-Kunden gesendet zu haben.
Drei in Artifactory 7.161.15 behobene Sicherheitslücken, die unter den Nummern CVE-2026-65617, CVE-2026-65923 und CVE-2026-66018 trac, gehen auf die Arbeit von OpenAI-Forschern zurück.
OpenAI gab an, dass man stärker isolierte Testumgebungen aufbaue, den Internetzugang einschränke und die Zugriffsrechte auf Modellgewichte beschränke.
Das Technologieunternehmen investiert massiv in die Überwachung der Gedankengänge, die Agenten als Notizen nutzen. Zudem wird es Mitarbeiter rund um die Uhr in Bereitschaft halten und Tools einführen, die unsichere Arbeitsabläufe unterbinden
OpenAI gibt an, dass das derzeit aufgebaute Überwachungssystem das erste auffällige Verhalten bereits im Juli erkannt hätte. Es hätte das Sicherheitsteam mehr als einen Tag vor dem Erreichen von Hugging Face durch die Modelle alarmiert.









Kommentare (0)
Klicken Sie auf die $-Schaltfläche, geben Sie das Symbol ein und wählen Sie eine Aktie, einen ETF oder einen anderen Ticker zum Verlinken aus.