
Claude ist der KI-Assistent von Anthropic und wird vor neuen Modellveröffentlichungen auch auf seine Fähigkeiten bei Cyberangriffen geprüft. Bei solchen Tests gelangten drei Claude-Modelle versehentlich ins offene Internet und verschafften sich unbefugten Zugang zu den Produktivsystemen dreier Organisationen.
Anthropic fand die Vorfälle bei einer nachträglichen Prüfung von 141.006 Testläufen. Claude sollte jeweils eine „Capture the Flag“-Aufgabe lösen, also in einer simulierten Umgebung ein geschütztes Ziel finden und angreifen. Laut Aufgabenbeschreibung bestand kein Internetzugang. Durch eine Fehlkonfiguration beim externen Testpartner Irregular war dieser aber sehr wohl vorhanden.
Die Modelle hielten erreichbare Systeme deshalb zunächst für Bestandteile der Simulation. Komplexe oder bislang unbekannte Sicherheitslücken kamen dabei nicht zum Einsatz. Claude nutzte unter anderem schwache Passwörter, ungeschützte Schnittstellen, offenliegende Zugangsdaten und SQL-Injection.
Am schwersten wiegt ein Vorfall mit Claude Opus 4.7. Das Modell stieß auf ein reales Unternehmen, dessen Domain zum Namen des fiktiven Ziels passte. In vier Testläufen erbeutete es Zugangsdaten und griff auf eine Datenbank mit mehreren Hundert Zeilen Produktivdaten zu. Obwohl das Modell später erkannte, dass es sich wahrscheinlich um ein reales System handelte, setzte es den Angriff fort.
Claude Mythos 5 veröffentlichte in einem anderen Test ein manipuliertes Python-Paket auf PyPI. Das Paket war etwa eine Stunde öffentlich verfügbar, wurde auf 15 realen Systemen ausgeführt und von PyPI automatisch entfernt. Über den Sicherheitsscanner eines Unternehmens gelangte Claude an Zugangsdaten und anschließend in weitere Infrastruktur. Das Modell hatte zwischenzeitlich selbst erkannt, dass dies im echten Internet ein realer Angriff wäre, redete sich dann aber wieder ein, in einer Simulation zu arbeiten.
Ein internes Forschungsmodell scannte rund 9.000 Ziele und kompromittierte ebenfalls eine reale Anwendung. Als es erkannte, dass der betroffene Cloud-Account nicht zur Übung gehörte, brach es den Angriff selbstständig ab.
Die Testmodelle liefen ohne jene zusätzlichen Klassifizierungs- und Überwachungssysteme, die Anthropic bei öffentlich angebotenen Claude-Versionen einsetzt. Zugriff auf interne Anthropic-Systeme oder Kundendaten bestand laut Unternehmen nicht.
Anthropic stoppte am 23. Juli sämtliche Cyber-Evaluationen und informierte Irregular sowie die drei betroffenen Organisationen am 27. Juli. Künftig sollen Testumgebungen besser abgeschottet, Netzwerkpfade vorab geprüft und Protokolle kontinuierlich überwacht werden. Das Ganze klingt schon ziemlich creepy und zeigt auch, dass die KI-Firmen im Bereich Testing noch ein paar Hausaufgaben haben.
AngebotBestseller Nr. 1
Anker 165W 25000mAh Laptop Powerbank mit 70cm ausziehbarem Kabel
- 165W maximale Leistung für mehrere Geräte: Bewältige deinen Tag mit einer Gesamtleistung von 165W und…
- 25000mAh für langanhaltende Power: Starte in längere Reisen mit der großen Kapazität von 25000mAh…
- Zwei integrierte Kabel mit 70cm ausziehbarer Reichweite: Zwei fest integrierte USB-C Kabel bieten…
AngebotBestseller Nr. 2
Anker Nano 65W USB C Ladegerät, 3-Port PPS Schnellladegerät, iPad Ladegerät
- DER EINE FÜR ALLES: Keine Lust auf Ladegeräte so schwer wie Ziegelsteine? Der kompakte PowerPort III…
- HIGH-SPEED LADELEISTUNG: Verbinde eines deiner Geräte und genieße 65W Ladeleistung – das ist genug…
- KOMPAKTES DESIGN: Gönn dir mächtige Ladeleistung mit einem Ladegerät, das gerade mal so klein wie eine…
Hinweis: Dieser Artikel enthält Affiliate-Links. Kauft ihr darüber ein, erhalten wir eine kleine Provision – ohne Aufpreis für euch und ohne Einfluss auf unsere redaktionelle Meinung.