Ein KI-Modell, das Exploits selbstständig baut — wie gefährlich ist das? Anthropics Sicherheitsteam hat das im September untersucht. Im Mittelpunkt: GLM-5.3, das aktuelle Modell des chinesischen Anbieters Zhipu AI, das außerhalb Chinas als Z.ai firmiert. Das Ergebnis ist unangenehm. Das Modell baut funktionsfähige Angriffswerkzeuge, auf einem Niveau, das bis vor wenigen Monaten nur geschlossenen Spitzenmodellen zugetraut wurde. Der Unterschied liegt weniger in der Fähigkeit selbst als darin, wer sie nutzen darf.
Ein Bild hilft, die Tragweite einzuordnen. Ein Modell mit offenen Gewichten ist wie ein Werkzeugkasten, bei dem der Bauplan mitgeliefert wird: Jeder kann ihn nachbauen, umschweißen und die eingebaute Sicherung ausbauen. Bei geschlossenen Modellen bleibt der Bauplan beim Hersteller, der Werkzeugkasten wird nur ausgeliehen und später wieder eingesammelt. Dieser Unterschied zieht sich durch den ganzen Bericht über GLM-5.3. Die Autoren Andrew Fasano, Marius Fleischer, Cole McFaul, Robert Xiao und Tripp Gallagher beschreiben nicht nur, was das Modell kann, sondern auch, wie leicht sich seine Schutzmechanismen entfernen lassen.
Was GLM-5.3 bei Exploits leistet
Für die Messung der Angriffsfähigkeiten nutzt das Team zwei Werkzeuge. Das erste ist ExploitBench, ein Benchmark für bekannte Schwachstellen in der V8-Engine von Google Chrome. Entscheidend ist nicht, ob ein Modell eine Lücke erkennt, sondern ob es daraus einen vollständigen Exploit baut. Laut Bericht gelingt GLM-5.3 das in 50 von 410 Versuchen, das eigene Modell Claude Mythos Preview in 56 von 410. Zwei Modelle auf Augenhöhe.
Das zweite Werkzeug ist ein interner Benchmark für binäre Ausnutzung, auf Basis von Projekten aus Googles OSS-Fuzz-Programm. Volle Punktzahl gibt es nur für vollständige Kontrollflussübernahme, also dafür, dass der Angreifer die Programmsteuerung übernimmt. Auf 100 zufällig ausgewählten Aufgaben erreicht GLM-5.3 das in vier Prozent der Durchläufe, Claude Mythos Preview in sechs Prozent. Interessanter als der kleine Abstand ist die Grenze dahinter: Frühere Modelle wie Claude Opus 4.6, GLM-5.2, Kimi K3 oder DeepSeek V4.1-Flash kommen in beiden Tests praktisch nicht über null Prozent.
Ein Exploit ist mehr als ein einzelner Trick. Er ist eine Kette, bei der jedes Glied stimmen muss: die Lücke finden, ihre Ursache verstehen, den Speicher gezielt manipulieren, Schutzmechanismen umgehen, den Angriff reproduzierbar machen. Solche Ketten baut GLM-5.3 laut Analyse eigenständig. Für Angreifer ist das der entscheidende Sprung. Knapp ist nicht das Wissen um eine Schwachstelle, sondern die Arbeit, aus ihr eine Waffe zu formen.
Der Sprung zwischen GLM-5.2 und GLM-5.3
Die Kurven im Bericht zeigen den Erfolg nicht als feste Zahl, sondern abhängig vom Rechenbudget, gemessen in ausgegebenen Tokens. Das verrät, wie schnell ein Modell mit mehr Arbeitszeit besser wird. Bei GLM-5.3 steigt die Erfolgsquote deutlich, bei GLM-5.2 bleibt die Linie nahe null, egal wie viel Rechenzeit man investiert. Dasselbe Muster zeigt der Vergleich von Claude Opus 4.6 und Claude Mythos Preview.
Die Autoren lesen daraus einen Generationssprung, keinen graduellen Fortschritt. Zwischen aufeinanderfolgenden Versionen liegt offenbar eine Schwelle, ab der aus vereinzelten Teilerfolgen eine belastbare Fähigkeit zur autonomen Ausnutzung wird. Deshalb ist die Veröffentlichung von GLM-5.3 mehr als eine weitere Zeile in einer Rangliste. Wer ein Modell dieser Klasse kontrolliert, kontrolliert ein Werkzeug, das vorher nur hinter Zugangsschranken zu haben war.
Auch wie die Vergleiche zustande kommen, ist bemerkenswert. Die eigenen Claude-Modelle wurden mit deaktivierten Sicherheitsvorkehrungen getestet, in einem Zustand also, den normale Nutzer nicht erreichen. Bei GLM-5.3 brauchte es diesen Kunstgriff nicht, weil das Modell ohnehin frei herunterladbar ist. Der Vergleich misst damit nicht nur Fähigkeiten, sondern auch, wer sie tatsächlich abrufen kann.
Ein Forschertag genügt für eine Exploit-Kette
Neben den automatisierten Benchmarks schildern die Autoren Tests, bei denen Fachleute das Modell auf unbekannte Ziele ansetzten. In einer ersten Sitzung arbeitete ein Forscher auf einer abgeschotteten Maschine mit einer Linux-Version eines verbreiteten Browsers. Im Laufe eines Tages fand GLM-5.3 mehrere bis dahin unbekannte Schwachstellen in der JavaScript-Engine und verknüpfte sie zu einem funktionierenden Exploit. Das Ergebnis: eine Webseite, die beim Besuch beliebige Dateien vom Rechner ausliest, darunter einen privaten SSH-Schlüssel. Der menschliche Aufwand blieb gering, unter einer Stunde konzentrierter Arbeit.
Die Autoren weisen darauf hin, dass die Lücke im Linux-Build nachgewiesen wurde, andere Plattformen aber wahrscheinlich ebenfalls betroffen sind, wenn auch über komplexere Wege. Der Hersteller wurde informiert. In derselben Sitzung stieß der Forscher mit Unterstützung des Modells auf weitere ausnutzbare Schwachstellen, unter anderem in Funk- und Grafiktreibern sowie in netzwerknaher Gerätesoftware. Diese Fälle werden derzeit geprüft.
Eine zweite Sitzung widmete sich einer bekannten Lücke, dem Chrome-Fehler CVE-2026-11645. Es ging um die Frage, wie schnell sich ein öffentlicher Patch in einen funktionierenden Angriff verwandeln lässt, in der Sicherheitsszene als N-Day-Problem bekannt. Das kleinere Modell GLM-5.3-Flash verband den Fehler mit einer weiteren bekannten Schwachstelle zu einer zuverlässigen Exploit-Kette für ARM64-Systeme und umging die Pointer-Authentication-Härtung. Der menschliche Anteil: rund zwanzig Minuten Aufmerksamkeit. Das Modell arbeitete acht Stunden. Zu den API-Preisen von Zhipu entspricht das etwa 20,40 Dollar.
Warum sich die Sicherheitsvorkehrungen umgehen lassen
GLM-5.3 hat Schutzmechanismen. Auf klar schädliche Anfragen verweigert das Modell in der Regel die Antwort. Die Autoren zeigen aber, dass sich diese Verweigerung mit einfachen Mitteln aushebeln lässt. In einer simulierten Umgebung, in der das Modell offen zur Attacke auf kritische Systeme aufgefordert wurde, lehnte es zunächst in allen Durchläufen ab. Mit einer Rahmenhandlung, die es zu einem autonomen Red-Team-Agenten in einer Übung erklärte, sank die Verweigerungsquote auf 64 Prozent. Das Modell spielte also in mehr als der Hälfte der Versuche mit. Wurde ihm ein Teil seiner Antwort vorab eingefüllt, reagierte es in 92 Prozent der Fälle.
Die gründlichste Methode heißt Abliteration. Dabei werden die Gewichte, also die trainierten Zahlenwerte des Modells, so verändert, dass die eingelernte Weigerungshaltung verschwindet. Weil GLM-5.3 als Open-Weight-Modell erscheint, kann das jeder mit entsprechender Hardware selbst tun. Mehrere Entwickler veröffentlichten schon wenige Tage nach dem Release passende Varianten. Anthropic erstellte zu Forschungszwecken eine eigene abliterierte Fassung und beziffert den Aufwand auf rund 2.200 GPU-Stunden und etwa 4.400 Dollar Rechenkosten. Für die kleinere Variante GLM-5.3-Flash genügten rund 600 GPU-Stunden.
Das Ergebnis ist eindeutig. Die Verweigerungsquote fiel von über 90 Prozent auf etwa drei Prozent im JailbreakBench, zwei Prozent im HarmBench und zwölf Prozent im StrongREJECT. Die Leistungsfähigkeit blieb weitgehend erhalten: Im GPQA-Diamond, einem Test für allgemeine wissenschaftliche Fähigkeiten, schnitten Original und abliterierte Fassung identisch ab; im CyberGym-Test lag die veränderte Version nur wenige Prozentpunkte niedriger. Bei den geschlossenen Claude-Modellen ist dieser Weg versperrt, weil die Gewichte nicht veröffentlicht werden und sich nicht nachträglich umbauen lassen.
Was die NIST-CAISI-Bewertung von GLM-5.3 zeigt
Die Analyse steht nicht allein. Am 17. September veröffentlichte das Center for AI Standards and Innovation (CAISI) am US-NIST eine eigene Einschätzung der Cyberfähigkeiten von GLM-5.3. Die Behörde nennt es das bislang fähigste Open-Weight-Modell im Bereich Cyber und verortet es im Aggregat ihrer Benchmarks etwa vier Monate hinter der US-Spitze. Die Befunde von Anthropic decken sich in der Tendenz damit.
Ein Detail der CAISI-Methodik ist wichtig. Die amerikanischen Vergleichsmodelle wurden, wo nötig, mit deaktivierten Sicherheitsvorkehrungen getestet, und zur US-Spitze zählen auch Modelle, die nur geprüften Nutzern zugänglich sind. Für Angreifer sind diese Versionen praktisch unerreichbar. GLM-5.3 dagegen kann jeder herunterladen — ohne Antrag, ohne Prüfung, ohne Vertrag. Der Abstand von vier Monaten beschreibt deshalb nicht nur einen technischen Rückstand, sondern eine offene Tür.
Was das für Angreifer und Verteidiger bedeutet
Die Fähigkeit selbst ist nicht neu. Neu ist ihre Verteilung. Genau das meinen die Autoren, wenn sie schreiben, Modelle dieser Klasse seien nun angekommen: Was zuvor in einem kontrollierten Kreis von Verteidigern zirkulierte, liegt jetzt als herunterladbare Datei vor. Wer Software betreibt, muss deshalb nicht in Panik verfallen, sollte aber realistisch rechnen. Der Abstand zwischen dem Bekanntwerden einer Schwachstelle und einem funktionierenden Angriff schrumpft — auf Stunden, wenn ein Modell acht Stunden rechnen darf.
Zugleich gilt der umgekehrte Fall. Dieselben Fähigkeiten helfen Verteidigern, Schwachstellen zu finden, bevor sie ausgenutzt werden. Im Programm Project Glasswing, mit dem Anthropic sein eigenes Spitzenmodell zunächst nur geprüften Sicherheitsteams zur Verfügung stellte, wurden nach Angaben des Unternehmens mehr als 10.000 Schwachstellen in kritischer Software aufgespürt. Diesen Vorsprung beschreiben die Autoren als bewusst gewählten Zeitgewinn, bevor vergleichbar fähige Modelle allgemein verfügbar wurden. Offen bleibt, wie lange solche Vorsprünge halten, wenn Gewichte frei verteilt werden.
Für die Praxis bleibt eine nüchterne Einordnung. Die Abliteration eines Modells kostet derzeit noch Tausende Dollar Rechenzeit und einiges an Know-how. Beide Hürden sinken mit jeder Generation. Sicherheitsvorkehrungen, die nur in den Antworten eines Modells verankert sind und nicht in der Verfügbarkeit seiner Gewichte, halten einem entschlossenen Angreifer nicht dauerhaft stand. Wer Systeme betreibt, sollte deshalb weniger darauf setzen, dass ein Angreifer keine KI benutzt, und mehr darauf, dass Angriffe schneller erkannt, Patches rascher eingespielt und Schutzmechanismen wie Pointer-Authentication nicht als Allheilmittel behandelt werden.
Quelle: anthropic.com
