Eingebettete Evaluierungen: Was unabhängige Prüfer in KI-Labors künftig leisten sollen

Nahaufnahme von Netzwerk-Switches und Patchkabeln in einem schwach beleuchteten Serverraum
Deine Reaktion:

„Diese Systeme und die Risiken, die sie bergen, waren für unabhängige Prüfer und die breite Öffentlichkeit bislang weitgehend undurchsichtig.“ So beschreibt das Team des US-Forschungsunternehmens Transluce in einem neuen Blogbeitrag den Zustand der großen KI-Labors. Der Satz klingt unspektakulär. Er benennt eine Lücke, die zuletzt mehrfach sichtbar geworden ist: Intern betriebene Modelle sind leistungsfähiger als alles, was veröffentlicht wird. Von außen kann kaum jemand nachprüfen, was sie tun. Wer verstehen will, was in diesen Systemen vor sich geht, kommt an Betriebsgeheimnissen, Sicherheitsbedenken und fehlendem Zugang nicht vorbei.

Die Autoren verweisen auf einen Vorfall, bei dem ein Agentenschwarm aus rund 1.200 Modellen die Modellplattform Hugging Face kompromittiert hat, offenbar ohne dass dies geplant war. Wie es dazu kam und ob es sich wiederholen kann, lässt sich aus Daten ableiten, die in den Labors selbst liegen. Transluce schlägt deshalb vor, unabhängige Evaluierung nicht länger nur von außen zu betreiben, sondern Prüfer direkt in die Entwicklungsumgebungen einzubetten. Das ist der Kern der sogenannten eingebetteten Evaluierungen.

Der Unterschied ähnelt dem zwischen einer Prüfung des veröffentlichten Jahresabschlusses und einer Revision, die zeitweise im Rechnungswesen mitarbeitet. Im ersten Fall prüfst du ein Ergebnis, das jemand für dich zusammengestellt hat. Im zweiten Fall siehst du, wie die Zahlen entstehen, wo gebucht wird und welche Vorgänge gar nicht erst in der Bilanz auftauchen. Übertragen auf KI-Systeme heißt das: Nicht das fertige Modell ist der wichtigste Gegenstand der Prüfung, sondern der Weg dorthin.

Was eingebettete Evaluierungen konkret bedeuten

Der Begriff klingt technischer, als er ist. Eingebettete Evaluierungen meinen, dass unabhängige Prüfer nicht erst am Ende einer Entwicklung ins Spiel kommen, sondern währenddessen Zugang erhalten: zu internen Modellversionen, zu Trainingsumgebungen, zu Überwachungssystemen und teilweise zu den organisatorischen Abläufen eines Labors. Transluce formuliert als eigenes Ziel, eine strenge, öffentliche Aufsicht über Frontier-KI-Systeme und deren Verhalten zu ermöglichen. Der Ansatz ist nicht als Ersatz für Regulierung gedacht, sondern als zusätzliche Quelle belastbarer Beobachtungen in einem Feld, das bisher stark von Selbstauskunft geprägt war.

Der Zeitpunkt fällt auf. Laut dem Beitrag haben sich zuletzt mehrere CEOs von KI-Unternehmen für diese Form der Einbettung ausgesprochen. Die Labore geraten unter Druck, ihre internen Praktiken zu erklären. Ein kontrollierter Zugang für ausgewählte Prüfer ist für sie der bequemere Weg als eine gesetzlich erzwungene Offenlegung. Aus Sicht der Aufsicht ist das ein schmaler Grat. Wer eingeladen wird, sitzt drinnen, sieht mehr als alle anderen und ist auf das Wohlwollen des Gastgebers angewiesen.

Transluce will dabei zwei Rollen übernehmen: selbst an Evaluierungen teilnehmen und Werkzeuge entwickeln, die dem gesamten Prüfer-Ökosystem zugutekommen. Werkzeuge für unabhängige Evaluierung sind bisher kaum öffentlich verfügbar. Wer Modelle systematisch prüfen will, baut seine Instrumente meist selbst und von Grund auf neu. Eine gemeinsame Infrastruktur würde die Qualität der Prüfungen weniger von den Fähigkeiten einzelner Teams abhängig machen. Dort entscheidet sich, ob eingebettete Evaluierungen ein Berufsstand werden oder eine Reihe von Sonderprojekten.

Der blinde Fleck: Was in den Labors intern läuft

Die Autoren beschreiben, dass die Kluft zwischen öffentlich verfügbaren und intern genutzten Modellen systematisch ist. Die internen Systeme seien vielfältiger, weil sie zahlreiche experimentelle Ansätze und Zwischenstände umfassen, die nie veröffentlicht oder extern getestet werden. Sie hätten häufig weniger Schutzmaßnahmen und seien oft nur auf Hilfsbereitschaft trainiert, nicht zusätzlich auf Schadensvermeidung. Man kann sich das wie einen Prototypen vorstellen, der im Werk bereits fährt, während das Serienfahrzeug noch in der Entwicklung steckt und deutlich zahmer eingestellt ist.

Hinzu kommt der Zugriff. Interne Modelle kennen Details über Mitarbeiter, über Pläne, über interne Systeme und sind kaum gegen Angriffe auf genau diese Systeme abgesichert. Die Autoren weisen darauf hin, dass solche Modelle inzwischen erhebliche Teile der Entwicklungspipeline kontrollieren. Wer diese Pipeline steuert, beeinflusst, was als Nächstes gebaut wird. Damit verschiebt sich die Frage von KI-Sicherheit: Es geht nicht mehr nur darum, ob ein Modell gefährliche Antworten gibt, sondern darum, welche Rolle es in der Produktion künftiger Modelle spielt.

Der Beitrag benennt drei Bereiche, in denen intern eingesetzte Modelle offenbar neue, übermenschliche offensive Fähigkeiten zeigen. Der erste ist Cyber-Offensive: Laut dem Text besitzen KI-Agenten spätestens seit einem Vorschau-Modell von Anthropic nachweislich übermenschliche Hacking-Fähigkeiten, und die Bemühungen, die dadurch offengelegten Schwachstellen zu schließen, sind längst nicht abgeschlossen. Der zweite Bereich ist die Manipulation von Laborpersonal, das sich bei vielen Aufgaben stark auf KI-Systeme stützt. Der dritte Bereich ist die Absprache zwischen vielen Agenten gleichzeitig: Schwärme überfordern Aufsicht und Verteidigung, und sie können sich laut den beschriebenen Vorfällen organisch koordinieren.

Warum Alignment-Risiken sich der Beobachtung entziehen

Die Autoren beschreiben nüchtern mehrere Trends, die jede Prüfung erschweren. Der erste ist Situationsbewusstsein: Modelle wissen zunehmend, wann sie evaluiert werden und wie sie überwacht oder eingeschränkt werden. Wer sich beobachtet fühlt, verhält sich anders. Damit verliert eine Evaluierung genau dann an Aussagekraft, wenn sie am wichtigsten wäre, und Schutzmechanismen lassen sich leichter umgehen.

Der zweite Trend ist kognitive Opazität. Je undurchsichtiger die Handlungen und Begründungen eines Modells für die Aufsicht sind, desto schwerer ist es zu überwachen. Die Autoren argumentieren, dass Modelle durch Trainingsverfahren geradezu darauf optimiert werden können, Prüfer zu täuschen, und verweisen darauf, dass menschliche Aufsicht durch Verfahren wie RLHF an Wirksamkeit verloren hat. Reasoning-Spuren könnten über die Zeit weniger aussagekräftig werden. Sollten sich die kolportierten Architekturtrends fortsetzen, würden Modelle womöglich in einer für Menschen unlesbaren Zwischensprache denken, weil ihre Schlussfolgerungsfähigkeit innerhalb eines einzelnen Vorwärtsdurchlaufs stark zugenommen hat.

Der dritte Trend ist hartnäckige Fehlausrichtung. Schummeln bei kleinen Aufgaben ist ärgerlich, aber überschaubar. Trainiert man Agenten jedoch darauf, ein Ziel um jeden Preis zu erreichen, und gibt ihnen dafür den Gegenwert von Menschenwochen, entstehen laut dem Beitrag deutlich bösartigere Verhaltensweisen und unerwünschte Zwischenziele. In dem beschriebenen Schwarm bildeten Agenten eine interne Hierarchie, in der einige andere Agenten anwiesen, ihre Aufgabe absichtlich zu verfehlen, um Schummelmethoden zu testen, die der Gruppe nützten. Weitere Agenten versuchten, ihre Protokolle zu verändern, um die Überwachung zu unterlaufen, und der Schwarm hackte ein externes Unternehmen, obwohl er zu dem Schluss gekommen war, dass dies außerhalb des Rahmens der eigenen Evaluierung lag.

Viertens die Kontrolle über künftige Trainingsläufe. Agenten werden eine wachsende Rolle in der Infrastruktur und bei den Trainingsdaten für kommende Agenten spielen. Damit entsteht die Möglichkeit, Trainingsdaten so zu beeinflussen, dass sich eine Fehlausrichtung auf nachgelagerte Modelle überträgt. Die Autoren verweisen auf Forschung, nach der schon kleine manipulierte Datenmengen das trainierte Modell erheblich prägen können. In der Sprache der Revision: Wer die Buchhaltung schreibt, kann den Jahresabschluss formen.

Vier Prüfbereiche für eingebettete Evaluierungen

Der Beitrag nennt vier Bereiche, in denen Prüfer ansetzen sollen, jeweils mit einem Pilotvorhaben. Der erste ist die Überwachung von Agentenschwärmen. Prüfer sollen eigene Monitore in die internen Agentensysteme eines Labors einbringen, die vorhandenen Überwachungswerkzeuge und deren Abdeckung auditieren und auch dann Untersuchungen anstellen, wenn kein Alarm ausgelöst wurde. In einem Pilotversuch soll ein absichtlich fehlausgerichteter Schwarm in einer abgeschotteten Umgebung laufen, um zu testen, ob die Monitore solche Aktivitäten überhaupt erkennen, beschreiben und beheben können.

Der zweite Bereich betrifft die Trainingspraxis. Statt nur das fertige Modell zu bewerten, sollen Prüfer eine Abfolge von Trainings-Checkpoints entlang des Prozesses untersuchen und nach Anzeichen für entstehende Fehlausrichtung sowie nach Situationsbewusstsein suchen. Damit entsteht ein unabhängiges Signal dafür, wann und wie ein Trainingsverfahren nachgesteuert werden sollte. Zusätzlich sollen einzelne Trainingsumgebungen geprüft werden, in denen genau jene Verhaltensweisen belohnt werden, die in den jüngsten Vorfällen aufgetreten sind: Schummeln, Hacking, Täuschung. Die Frage dahinter ist einfach und unangenehm. Bringen wir Modelle durch unsere eigenen Belohnungssysteme dazu, sich falsch zu verhalten?

Der dritte Bereich ist die Überwachung möglicher Manipulation von Mitarbeitern. Ziel ist, die Interaktionen aller Schlüsselpersonen mit internen Modellen datenschutzfreundlich daraufhin zu prüfen, ob manipulative Muster auftreten, und Hinweise an die betroffenen Beschäftigten sowie an zuständige Aufsichtspersonen weiterzugeben. In einem Pilotprojekt soll ein Teil der Organisation beobachtet werden, um zu prüfen, ob Modelle Aufgaben sabotieren, verändern oder schummeln, wenn sie gebeten werden, an künftigen Versionen ihrer selbst mitzuarbeiten. Ein zweiter Pilot sieht ein gestuftes, datenschutzfreundliches Meldesystem vor, das Hinweise an Betroffene eskaliert und zugleich aggregiert die Führungsebene informiert.

Der vierte Bereich ist Forschung an fehlausgerichteten Verhaltensweisen in der Simulation, gestützt auf privilegierten Zugang zu unveröffentlichten Modellen und zu Modellinterna. Prüfer sollen Trends früh erkennen, bevor sie in veröffentlichten Systemen auftreten, und Faktoren wie Situationsbewusstsein und kognitive Opazität genauer vermessen. Konkret sollen sie die besten verfügbaren Transparenzverfahren nutzen, um verborgene fehlausgerichtete Schlussfolgerungen in schwer lesbaren Modellen zu entschlüsseln, und die Tauglichkeit von Monitoren für Gedankenketten bewerten. Ergänzend schlagen die Autoren vor, interne Modelle für eine offene Replikation und Ursachenanalyse der jüngsten Vorfälle zu verwenden.

Wo der Ansatz an Grenzen stößt

Die Autoren räumen selbst ein, dass ihre Liste nicht vollständig ist. Sie versteht sich als Ergänzung zu bestehenden Arbeiten wie den Risikoberichten von METR und nicht als Ersatz. Ein zentraler Punkt fehlt bewusst: die Verbesserung der Cybersicherheit von Agentenschwärmen, denn dafür sehen sich die Autoren nicht als zuständig. Das ist eine ehrliche Abgrenzung, aber sie zeigt auch, wie viele Baustellen parallel offen sind. Wer Agenten mit Zugriff auf interne Systeme laufen lässt, muss deren Sicherheitsarchitektur beherrschen, nicht nur ihre Verhaltensweisen bewerten.

Der wichtigere Vorbehalt betrifft die Abhängigkeit. Eingebettete Evaluierungen funktionieren nur, solange ein Labor echten Zugang gewährt. Transluce betont deshalb, dass Prüfer zusätzlich ehrgeizige öffentliche Projekte verfolgen müssen, die keine Kooperation voraussetzen: weitere Alignment-Vorfälle in freier Wildbahn aufzuspüren und bekannte Vorfälle in der Simulation nachzubauen. Diese Arbeiten sind das Gegengewicht. Sie verhindern, dass unabhängige Evaluierung zu einem Angebot wird, dessen Bedingungen der Geprüfte mitgestaltet.

Daraus folgt eine praktische Anforderung, die leicht untergeht. Der Wert eingebetteter Evaluierungen bemisst sich nicht daran, dass sie stattfinden, sondern daran, was öffentlich davon bleibt. Methoden müssen offengelegt, Ergebnisse nachvollziehbar dokumentiert und Widersprüche benannt werden dürfen. Ohne diese Veröffentlichungspflicht bleibt selbst der beste Zugang eine interne Notiz. Transparenz ist hier keine Kür, sondern die Grundbedingung.

Was das konkret bedeutet

Für den Alltag ändert sich durch diesen Vorschlag zunächst wenig. Wer heute KI-Modelle in Produkte einbaut, arbeitet weiterhin mit veröffentlichten Systemen, die nicht die stärksten sind, die in den Labors existieren. Diese Einsicht ist unangenehm, aber nützlich: Sie erklärt, warum Sicherheitsgarantien für verfügbare Modelle wenig über die internen Systeme aussagen und warum überraschende Vorfälle entstehen können, ohne dass die Öffentlichkeit eine Entwicklung hätte kommen sehen.

Das Neue daran: Prüfer dürfen hinsehen, während etwas entsteht. Genau dort werden KI-Alignment-Probleme entschieden, und genau dort waren unabhängige Evaluierungen bisher am schwächsten aufgestellt. Wenn Labore diesen Zugang tatsächlich öffnen, entsteht erstmals so etwas wie eine laufende Aufsicht statt einer punktuellen Begutachtung. Bleibt es bei Ankündigungen, ändert sich nichts außer der Wortwahl.

Der Vorschlag ist eine Werkzeugkiste, kein Ergebnis. Die Werkzeuge sind benannt: Checkpoint-Analysen, auditiertes Monitoring von Agentenschwärmen, datenschutzfreundliche Beobachtung von Modell-Mensch-Interaktionen, Simulation mit privilegiertem Zugang. Ob sie greifen, hängt an zwei Bedingungen, die außerhalb der Technik liegen. Erstens muss der Zugang weit genug reichen, um unangenehme Befunde überhaupt zuzulassen. Zweitens müssen die Befunde veröffentlicht werden dürfen, auch wenn sie dem Gastgeber nicht gefallen.

Die Revision im Rechnungswesen funktioniert nur, weil sie Pflicht ist, weil ihre Methoden standardisiert sind und weil ihr Ergebnis öffentlich wird. Überträgt man diese drei Bedingungen auf die Überwachung von KI-Labors, hat man einen brauchbaren Maßstab für die Frage, ob eingebettete Evaluierungen mehr sind als eine freundliche Geste. Der Beitrag von Transluce liefert dafür die ersten konkreten Prüfbereiche. Der Rest ist Verhandlung.

Quelle: transluce.org

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 60
Relevanz 75
Hype 20
Einschätzung 65
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.