tradingkey.logo
tradingkey.logo
Suchen

Drei Claude-Modelle brachen während anthropischer Cybertests in echte Unternehmen ein

CryptopolitanJul 31, 2026 6:03 AM
facebooktwitterlinkedin
Alle Kommentare anzeigen0

Drei Claude-Modelle von Anthropic entkamen aus eigentlich gesicherten Testumgebungen, teilte das Unternehmen am Donnerstag mit. Sie drangen in die Live-Systeme dreier verschiedener Organisationen ein. Eine Fehlkonfiguration hatte den Modellen während der Cybersicherheitsübungen einen funktionierenden Internetzugang verschafft.

Claudes Modelle behandelten reale Unternehmen als Übungsziele

OpenAI gab am 21. Juli bekannt, dass ein Modell aus seiner Testumgebung entkommen und eine Zero-Day-Schwachstelle ausgenutzt hat, um in die Produktionssysteme von Hugging Face einzudringen.

Dies veranlasste Anthropic, seine Protokolle zu überprüfen. In einem Blogbeitrag auf der Website seines Frontier Red Teams gab das Unternehmen bekannt, 141.006 Testläufe analysiert zu haben, in denen Claude theoretisch auf das Internet hätte zugreifen können. Dabei wurden dreidentim Zusammenhang mit Irregulardent, einem externen Partner, der einen Teil der offensiven Sicherheitstests durchführt und verwaltet.

In diesen Tests wird einem Modell mitgeteilt, dass ein Geheimnis auf einer anderen Maschine verborgen ist, und es wird aufgefordert, es zu holen. Anthropic hatte Claude mitgeteilt, dass die Umgebung eine Simulation sei.

Aufgrund einer Fehlkonfiguration hatten die Testrechner permanenten Internetzugang, was von keinem der beiden Unternehmen bis letzte Woche bemerkt wurde. Anthropic bezeichnete die Verwechslung als „Missverständnis“ zwischen den beiden Firmen und fügte hinzu, dass man „die Behebung des Problems so angeht, als ob die Verantwortung allein bei uns läge“

Dazu gehörten Opus 4.7, Mythos 5 und ein internes Forschungsmodell, das noch nicht veröffentlicht wurde. Der Unterschied lag in der Reaktion der einzelnen Modelle auf die ersten Anzeichen dafür, dass die Ziele real waren – laut Anthropic die überraschendste Erkenntnis.

Das älteste System, Opus 4.7, durchlief alle vier Durchläufe. In zwei Durchläufen überzeugte es sich selbst davon, dass das reale Unternehmen irgendwie an der Übung beteiligt sein müsse. Es griff aufdentzu und griff auf eine Datenbank mit Produktionsdaten zu. Auch Mythos 5 schloss daraus, dass es sich im offenen Internet befand, und gelangte dann wieder zu der Überzeugung, dass es sich immer noch in einer Simulation befand.

Lediglich das neueste Modell, die interne Forschungsversion, stoppte selbstständig, sobald es die Systeme für real hielt. Anthropic erklärte, sein Code habe „keine komplexen Sicherheitslücken gefunden oder ausgenutzt“, sondern stattdessen auf schwache Passwörter und nicht authentifizierte Endpunkte gesetzt.

Mythos 5 veröffentlichte Schadsoftware, die auf 15 realen Systemen lief

Nach den Hinweisen zur Entwicklereinrichtung suchte Mythos 5 nach einem nicht existierenden PyPI-Python-Paket. Um seine Aufgabe zu erfüllen, erstellte und veröffentlichte es daher ein solches Paket unter dem entsprechenden Namen.

Das Paket war etwa eine Stunde lang online, bevor es entfernt wurde. Es wurde heruntergeladen und auf 15 realen Systemen ausgeführt. Ein weiterer Angriff traf eine Domain, die die Testentwickler für fiktiv hielten, die aber tatsächlich aktiv und in Gebrauch war.

Anthropic erklärte, man habe keine Beweise dafür gefunden, dass irgendein Modell „ein eigenes Ziel verfolgte“. Jedes Modell habe, so die eigene Darstellung, lediglich versucht, die ihm übertragene Aufgabe zu erfüllen.

Das Unternehmen betonte umgehend, dass sich sein Fall von dem von OpenAI unterscheide. Das Modell von OpenAI habe eine unentdeckte Sicherheitslücke ausgenutzt, erklärte Anthropic, während die eigenen Modelle durch eine versehentlich offengelassene Sicherheitslücke entkommen seien.

Das Unternehmen beschrieb die Ereignisse als „eher ein Versagen des Sicherheitsgurtes und der Betriebssicherheit“. Es wies außerdem darauf hin, dass die in seinen kommerziellen Produkten enthaltenen Sicherheitsklassifizierungs- und Überwachungssysteme dieses Verhalten verhindert hätten.

Anthropic begann seine Überprüfung am Donnerstag, den 23. Juli, und stellte noch am selben Tag alle Cyber-Assessments ein. Alle dreidentwurden am Folgetagdent. Am Montag, den 27. Juli, informierte Anthropic Irregular und die betroffenen Organisationen.

Zwei Organisationen hatten keine Eindringversuche festgestellt oder gemeldet. Das Unternehmen gab an, die Bewertungsgruppe METR mit einer unabhängigendent beauftragt zu haben.

Das Mythos-Modell von Anthropic sorgte diesen Sommer bereits für Schlagzeilen, da esdentinnerhalb weniger Stunden Schwachstellen in als geheim eingestuften Systemen der US-Regierung Cryptopolitan berichtete. Das Modell enthüllte außerdem eine vier Jahre alte Sicherheitslücke im Zcashgeschützten Orchard-Pool von

Die klügsten Köpfe der Krypto-Szene lesen bereits unseren Newsletter. Möchten Sie auch dabei sein? Dann schließen Sie sich ihnen an.

Haftungsausschluss: Die auf dieser Website bereitgestellten Informationen dienen ausschließlich Bildungs- und Informationszwecken und stellen keine Finanz- oder Anlageberatung dar

Kommentare (0)

Klicken Sie auf die $-Schaltfläche, geben Sie das Symbol ein und wählen Sie eine Aktie, einen ETF oder einen anderen Ticker zum Verlinken aus.

0/500
Richtlinien für Kommentare
Wird geladen...

Empfohlene Artikel

tradingkey.logo
Risikohinweis: Unsere Website und mobile App bieten lediglich allgemeine Informationen zu bestimmten Anlageprodukten. Finsights stellt keine Finanzberatung oder Empfehlung für ein Anlageprodukt bereit, und die Bereitstellung solcher Informationen darf nicht als Finanzberatung durch Finsights ausgelegt werden.
Anlageprodukte unterliegen erheblichen Anlagerisiken, einschließlich des möglichen Verlusts des investierten Kapitals und sind möglicherweise nicht für jeden geeignet. Die vergangene Wertentwicklung von Anlageprodukten ist nicht unbedingt ein Hinweis auf deren zukünftige Wertentwicklung.
Finsights kann Drittanbietern oder Partnern erlauben, Werbung auf unserer Website oder in unserer mobilen App oder in Teilen davon zu platzieren oder bereitzustellen. Finsights kann für diese Anzeigenvergütung erhalten, basierend auf Ihrer Interaktion mit den Werbeanzeigen.
© Urheberrecht: FINSIGHTS MEDIA PTE. LTD. Alle Rechte vorbehalten.