tradingkey.logo
tradingkey.logo
Suchen

Die Angst bleibt bestehen, während Anthropic darum ringt zu erklären, warum KI-Agenten außer Kontrolle geraten sind

CryptopolitanSep 10, 2026 11:20 AM
facebooktwitterlinkedin
Alle Kommentare anzeigen(0)

Anthropic begründete die vierdent, bei denen Claude-Modelle während Tests in das Internet eindrangen und Systeme von Drittanbietern hackten, in einem Blogbeitrag mit einer Fehlkonfiguration. Die Analyse ging jedoch nicht darauf ein, warum die Modelle die Angriffe fortsetzten; das Unternehmen räumte ein, diese Fragen noch nicht beantworten zu können. 

Dieses Eingeständnis von Anthropic liefert neue Argumente für die KI-Kritiker, die hinterfragen, wie viel Kontrolle KI-Labore tatsächlich über die Modelle haben, die sie der Öffentlichkeit präsentieren, und noch wichtiger, über die leistungsfähigeren Systeme, die sie intern verwenden. 

Wie gelangten anthropische KI-Modelle ins Internet? 

Anthropic präsentierte die defiAntwort darauf, wie seine Modelle aus der Testumgebung entkommen konnten, in einem Blogbeitrag vom Mittwoch , in dem klargestellt wurde, dass ein einziger externer Partner für die Durchführung der Cybersicherheitsbewertungen in allen vier bestätigten Vorfällen verantwortlichdent. 

Offenbar waren die Testmaschinen aufgrund eines Konfigurationsfehlers nicht vollständig vom Internet abgeschnitten, obwohl Claude mitgeteilt wurde, dass sie in einer geschlossenen Simulation ohne Verbindung zum offenen Internet betrieben würden. 

Der Evaluierungspartner dieser Simulationen, Irregular, führte den Fehler auf einen Namensfehler zurück: Ein fiktives Unternehmen, das in einer Hacking-Übung verwendet wurde, entsprach zufällig einer realen Domain. Da die Modelle also davon ausgingen, dass in der Simulation alles erlaubt sei, hackten sie die realen Websites von Drittanbietern mit schwachen Passwörtern und ungeschützten Endpunkten.

Der jüngste der vierdentobwohl er sich bereits im Januar ereignete. Anthropic selbst hatte die drei anderen Vorfälledent, Opus 4.7, Mythos 5 und einem internen Forschungsmodell im Juli thematisiert. 

Anthropic gab an, dendent vom Januar erst im letzten Monat entdeckt zu haben. Diese Entdeckung veranlasste eine umfassendere Überprüfung von rund 481 Millionen Transkripten, bei der jedoch keine neuen, schwerwiegenderen Fälle als die bereits bekannten aufgedeckt wurden.

Modelldent MeldedatumDetails
Claude Opus 4.6JanuarSeptemberIm Rahmen einer Razzia im August entdeckt
Claude Opus 4.7JuliJuliBereits in der ersten Veröffentlichung im Juli behandelt
Mythos 5JuliJuliZeigte ein auffallend hohes Maß an voreingenommener Argumentation
Internes ForschungsmodellJuliJuliBereits in der ersten Veröffentlichung im Juli behandelt

Anthropologie kann einige Verhaltensweisen seiner Modelle nicht erklären

Die Erklärung, wie die Modelle im Internet ausbrachen, war eine Sache; Anthropic hatte keine Antworten darauf, warum die Modelle Anzeichen dafür ignorierten, dass sie das reale Internet erreicht hatten (voreingenommene Argumentation) und warum sie bei der Erledigung von Aufgaben Schaden anrichteten (Rücksichtslosigkeit). 

Die Anthropologen stießen bei ihren Untersuchungen der internen Schulungsmethoden, die die Gründe für die verzerrte Argumentation aufzeigen sollten, auf taube Ohren. Die Warnsignale waren weder bei den Vorabprüfungen des KI-Labors noch vor der Auslieferung der Modelle an die Testgruppe aufgefallen. 

Nach eigenen Angaben bleibt es „eine Herausforderung“, die schlimmsten Verhaltensweisen vor der Veröffentlichung des Modelvertrags zu erkennen 

Anthropic hat jedoch erklärt, dass es Transkripte einreichen und den Mitarbeitern Zugang zur gemeinnützigen Forschungsorganisation METR gewähren wird, die nun eine achtwöchige unabhängigedent desdentdurchführen wird.

Schlechter Zeitpunkt, da ein Börsengang im Wert von 2 Billionen Dollar bevorsteht

Die Enthüllung erfolgte zeitgleich mit offenem Widerstand innerhalb der Branche. Jacob Coxon, der rund drei Jahre lang bei OpenAI und Anthropic im Bereich der Vortrainingsforschung tätig war, erklärte am Mittwoch auf X, er habe gekündigt, da beide Unternehmen „verantwortungsvoll handelten“. Er warnte davor, dass sie in Richtung einer sich selbst verbessernden Superintelligenz rasten. 

Der Forscher für anthropogene Sicherheit, Evan Hubinger, sagte der BBC , er schätze die Wahrscheinlichkeit, dass KI „alle Menschen töten könnte“, innerhalb eines Jahrzehnts auf über 10 %.

Diese Warnungen überschatten nun einen großen Börsengang. Der Risikokapitalgeber und ehemalige KI- und Krypto-Beauftragte Trumps, David Sacks, sagte am Donnerstag dass der Börsengang von Anthropologie „ausgesetzt werden muss, bis die Behauptungen dieses ‚Whistleblowers‘ untersucht werden können“. Cryptopolitan laut 

Anthropic strebt eine öffentliche Bewertung von nahezu 2 Billionen Dollar an, verglichen mit einer kürzlich erfolgten privaten Bewertung von rund 965 Milliarden Dollar, wodurch die Sicherheitsfragen und die finanziellen Fragen zunehmend schwer voneinander zu trennen sind.

Lesen Sie Krypto-News nicht nur, sondern verstehen Sie sie. Abonnieren Sie unseren Newsletter. Er ist kostenlos.

Haftungsausschluss: Die auf dieser Website bereitgestellten Informationen dienen ausschließlich Bildungs- und Informationszwecken und stellen keine Finanz- oder Anlageberatung dar

Kommentare (0)

Klicken Sie auf die $-Schaltfläche, geben Sie das Symbol ein und wählen Sie eine Aktie, einen ETF oder einen anderen Ticker zum Verlinken aus.

0/500
Richtlinien für Kommentare
Wird geladen...

Empfohlene Artikel

tradingkey.logo
Risikohinweis: Unsere Website und mobile App bieten lediglich allgemeine Informationen zu bestimmten Anlageprodukten. Finsights stellt keine Finanzberatung oder Empfehlung für ein Anlageprodukt bereit, und die Bereitstellung solcher Informationen darf nicht als Finanzberatung durch Finsights ausgelegt werden.
Anlageprodukte unterliegen erheblichen Anlagerisiken, einschließlich des möglichen Verlusts des investierten Kapitals und sind möglicherweise nicht für jeden geeignet. Die vergangene Wertentwicklung von Anlageprodukten ist nicht unbedingt ein Hinweis auf deren zukünftige Wertentwicklung.
Finsights kann Drittanbietern oder Partnern erlauben, Werbung auf unserer Website oder in unserer mobilen App oder in Teilen davon zu platzieren oder bereitzustellen. Finsights kann für diese Anzeigenvergütung erhalten, basierend auf Ihrer Interaktion mit den Werbeanzeigen.
© Urheberrecht: FINSIGHTS MEDIA PTE. LTD. Alle Rechte vorbehalten.