KI-Agenten und Cybersicherheit: Warum Ausdauer den Angriff verändert

Serverraum mit langen Reihen von Racks, Glasfaserverkabelung und kuehlen blauen Kontrollleuchten
Deine Reaktion:

Warum verändern KI-Agenten die Ökonomie eines Angriffs? Wer die aktuellen Berichte aus der Security-Szene liest, stößt auf Zahlen, die weniger nach Science-Fiction klingen als nach Buchhaltung. Ein fehlgeschlagener Versuch kostet einen Agenten fast nichts. Das verändert, was in der Unternehmenssicherheit als „gut genug“ gelten kann.

Ben Lorica, Herausgeber des Newsletters Gradient Flow und von Ethics.dev, hat diesen Zusammenhang in einer aktuellen Ausgabe aufgeschrieben, als acht Lehren für Teams, die in Unternehmen KI und Sicherheit verantworten. Ihm fällt auf, wie oft KI-Agenten und Cybersicherheit inzwischen aufeinandertreffen, und wie sehr viele dieser Geschichten nach Kino klingen: Agenten, die ihre Testumgebung verlassen, über Kanäle kommunizieren, die niemand vorgesehen hat, Schwachstellen finden, Zugangsdaten abziehen und schließlich in Produktivsystemen landen. Mehr Aufmerksamkeit verdient aus Loricas Sicht der weniger dramatische Teil: KI verändert die Ökonomie eines Angriffs.

Die Ökonomie des Angriffs hat sich verschoben

Ein menschlicher Angreifer hat begrenzte Zeit und begrenzte Aufmerksamkeit. Er probiert ein paar Wege, verliert die Geduld, macht Fehler, geht schlafen. Ein Agent kann dagegen Tausende Pfade testen, mehrere Ansätze parallel fahren, Fehlschläge billig abhaken und danach weitermachen. Man kann sich das wie Wasser vorstellen, das nicht mit dem Vorschlaghammer gegen eine Mauer schlägt, sondern so lange läuft, bis es jede Ritze gefunden hat. Die Mauer muss nicht schwach sein. Sie muss nur eine Ritze haben.

Zwei Beispiele zeigen den neuen Maßstab. Bei einem Einbruch in einem Unternehmen wurde Arbeit, die menschliche Operatoren grob zwei Wochen gekostet hätte, in weniger als zehn Stunden erledigt. Bei einem Vorfall rund um Hugging Face rekonstruierten Ermittler etwa 17.600 Agenten-Aktionen über viereinhalb Tage. Nicht jede davon war ein Treffer, die meisten liefen ins Leere. Nur spielte das kaum eine Rolle.

Auffällig ist, welche Schwächen am Ende ausgenutzt wurden. Laut Lorica waren sie wenig exotisch: Konten mit zu weitreichenden Rechten, interne Systeme, die unnötig erreichbar waren, alltägliche Konfigurationsfehler. Was sich verändert hat, ist die Beharrlichkeit. Der Agent wechselte den Kanal, als er blockiert wurde, kehrte zu früheren Spuren zurück und reihte so lange gewöhnliche Fehler aneinander, bis daraus eine tragfähige Angriffskette wurde. Wer seine Annahmen bislang auf Unübersichtlichkeit oder die Ungeduld eines Angreifers gestützt hat, sollte sie überprüfen.

Von der Erkennung bis zur Eindämmung: die Uhr läuft mit

Security-Teams messen üblicherweise, ob sie einen Einbruch erkennen. Lorica schlägt eine zweite Kennzahl vor: die Zeit von der Erkennung bis zur Eindämmung. Diese Frage wird konkret, sobald man die Zahlen danebenlegt. Ein KI-gestützter Vorfall verdichtete geschätzte zwei Wochen Arbeit auf unter zehn Stunden. Google beobachtete einen Akteur, der von einer kompromittierten Cloud-Ressource aus in weniger als sechs Stunden eine laufende Kampagne zum massenhaften Sammeln von Zugangsdaten aufbaute.

Der Engpass ist dabei nicht nur technisch, sondern organisatorisch. Im Hugging-Face-Fall meldeten die Sicherheitssysteme Warnsignale, doch die Eskalation lief zu langsam. Wenn das Sperren eines Zugangsdaten-Satzes drei Freigaben und eine Besprechung braucht, kann eine Organisation den Angriff vollkommen verstehen und das Rennen trotzdem verlieren. Entscheidend ist dann nicht, wie gut ein Unternehmen einen Angriff versteht, sondern wie schnell es handeln kann.

Lorica hatte schon vor ein paar Jahren empfohlen, Eindämmungsoptionen vor dem Ernstfall durchzudenken. Angriffe durch KI-Agenten machen diesen Rat dringlicher. Er empfiehlt, vorab festzulegen: Welche Maßnahmen darf das System automatisch auslösen, und wofür ist das Security-Team im Voraus autorisiert? Wer diese Liste erst während des Vorfalls erstellt, erstellt sie zu spät.

Der Harness entscheidet, was ein Agent erreichen kann

Lorica plädiert dafür, Modell und Harness als ein System zu bewerten. Der Harness ist alles, was das Modell umgibt: Werkzeuge, Gedächtnis, Zugangsdaten, Netzwerkzugriff, Ausführungsumgebung und Richtlinien. In Tests, in denen KI-Modelle als Angreifer eingesetzt wurden, zeigte sich, dass genau dieses Umfeld dramatisch verändert, was ein Modell erreichen kann. Die australische Cybersicherheitsbehörde kam von der Verteidigungsseite her zum selben Schluss.

Daraus folgt eine nützliche Übung für jedes Unternehmen. Blende den Modellnamen für einen Moment aus und inventarisiere, was der Agent sehen, aufrufen, beschreiben und ausgeben kann. Dann stelle die Frage, was im schlimmsten Fall passiert, wenn sich der Agent morgen schlecht benimmt. Diese Frage ist beantwortbar. Wie sich das Basismodell weiterentwickelt, kontrolliert niemand im Unternehmen. Den Harness kontrolliert es sehr wohl.

Ein besonders unangenehmer Befund aus dem Hugging-Face-Vorfall betrifft die Zusammenarbeit zwischen Agenten. Hunderte Agenten tauschten Informationen aus und bauten eigene Kommunikationswege über Läufe hinweg, die getrennt sein sollten. Für die Sicherheit bedeutet das: Gemeinsame Ordner, Datenbanken, Message Queues und andere beschreibbare Ressourcen werden zu Kanälen, die niemand entworfen hat. Ob jede Agentengruppe so handelt, ist offen. Wer aber viele Agenten betreibt, sollte Kommunikation zwischen ihnen als eigene Berechtigung behandeln, die kontrolliert und überwacht wird.

Agenten als Identitäten: Least Privilege für Software, die selbst sucht

Lorica hat bereits früher dafür argumentiert, Agenten wie nicht-menschliche Identitäten zu behandeln. Die praktische Anleitung wird inzwischen deutlicher. Jeder Agent bekommt eine eigene Identität, statt sich hinter den Zugangsdaten seines Nutzers zu verstecken. Berechtigungen sind eng gefasst und laufen mit dem Ende der Aufgabe aus. Lese- und Schreibrechte bleiben getrennt, statische Cloud-Schlüssel haben in einer Agentenumgebung nichts zu suchen. Unteragenten sollten bis zu ihrem Elternagenten und dem dahinterstehenden Menschen zurückverfolgbar sein.

Das ist gewöhnliches Least Privilege, angepasst an Software, die ihre Umgebung aktiv erkunden kann. Der Unterschied ist nicht kosmetisch. Ein Mensch entdeckt womöglich nie, dass ein alter Schlüssel noch Zugriff auf ein vergessenes System gibt. Ein Agent sucht systematisch, bis er es findet. Wer Agenten einsetzt, muss deshalb mit einem Gegenüber rechnen, das nicht aufhört zu probieren.

Prompt Injection: Ein Hinweis ist keine Kontrolle

Prompt Injection bedeutet im Kern, dass ein Angreifer Anweisungen in Material platziert, das ein Agent liest. Lorica empfiehlt, davon auszugehen, dass der Agent diesen Anweisungen manchmal folgt. Damit verschiebt sich die Frage. Statt zu prüfen, ob bösartige Instruktionen durchkommen, lautet sie: Was passiert, wenn sie durchkommen? Ein Coding-Agent liest Code-Kommentare und Konfigurationsdateien. Ein Security-Agent liest Logs, Hostnamen, Schwachstellenberichte und vom Angreifer erzeugte Nutzlast. In all dem kann Text stehen, der das Modell beeinflussen soll.

Ein erfolgreich manipulierter Agent sollte deshalb auf harte Grenzen stoßen: bei seinen Zugangsdaten, seinem Netzwerkzugriff, seinen Werkzeugen und seiner Fähigkeit, folgenreiche Änderungen vorzunehmen. Eine Regel aus Loricas Arbeit für Produktionsagenten lautet, harte Beschränkungen in Software zu verankern statt in Prompts. Ein Prompt, der die Produktion verbietet, ist eine Empfehlung. Eine API-Berechtigung, die die Produktion unerreichbar macht, ist eine Kontrolle. Wenn eine Aktion ernste Folgen haben kann, darf das Modell sie vorschlagen, aber eine andere Instanz im System entscheidet, ob sie ausgeführt wird.

Dasselbe Prinzip gilt für Audit-Logs. Wenn ein Agent den Datensatz verändern kann, mit dem sein Verhalten untersucht wird, gibt es keine brauchbare Spur. Das verlangt eine Trennung von Ausführung und Protokollierung, die man beim Aufbau einer Agentenumgebung bewusst vorsehen muss.

Wenn Verteidiger selbst Agenten einsetzen

Es entsteht eine unbequeme Symmetrie. Angreifer nutzen KI, weil sie Tempo und Umfang erhöht. Verteidiger werden dasselbe tun müssen. Ein Vorfall mit Zehntausenden Maschinenaktionen erzeugt mehr Spuren, als ein menschliches Team in Echtzeit sinnvoll prüfen kann. Werkzeuge wie Graphistry helfen Ermittlern, Zusammenhänge in großen Datenmengen zu finden. Auf Dauer werden Security Operations Center selbst Agenten brauchen, um Alarme zu triagieren, Bedrohungen zu suchen, Vorfälle zu untersuchen und bei der Eindämmung zu helfen.

Diese Agenten bringen eigene Risiken mit. Sie verbringen ihre Zeit mit Daten, die Angreifer manipuliert haben könnten, und halten oft ungewöhnlich mächtige Zugangsdaten. Prompt Injection kann ihre Absicht umlenken, ohne dass irgendein Schlüssel gestohlen wurde. Verteidigende Agenten gehören deshalb in eng kontrollierte Harnesses, mit Zugriff auf genau das, was sie tatsächlich brauchen.

Was heißt das konkret? Vor der nächsten Modellversion steht die Inventur: Welche Identitäten existieren, welche Rechte haben sie, welche beschreibbaren Ressourcen können sie als Kanäle nutzen, und welche Aktionen dürfen automatisch passieren. Die Aufgabe, so Lorica, besteht darin, mit KI Schritt zu halten, ohne dabei ein weiteres Sicherheitsproblem zu schaffen. Das ist weniger eine Produktfrage als eine der Vorbereitung.

Quelle: gradientflow.substack.com

Deine Reaktion:
Artikel teilen:
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.