Agent-Session-Transkripte sind kostbar: Warum Teams Claude-Code-Sessions wie Logfiles behandeln sollten

Makroaufnahme einer Platine mit Mikrochip und leuchtenden Kupferleiterbahnen
Deine Reaktion:

Wer mit Claude Code arbeitet, hinterlässt bei jeder Sitzung eine Datei mit dem kompletten Gesprächsverlauf, abgelegt in einem versteckten Ordner auf der Platte. Nach 30 Tagen löscht Claude Code sie standardmäßig, und in den meisten Teams fällt das niemandem auf.

Code kommt in ein Git-Repository, die Transkripte agentischer Coding-Sessions landen im Nichts, obwohl sie belegen, welche Tokens bezahlt wurden und welche Lektionen man sonst teuer nachlernt. So argumentiert Jacek Migdal von Quesma im Blog seines Unternehmens. Quesma bietet selbst ein Werkzeug an, das solche Sessions einsammelt; der Beitrag ist also auch Werbung in eigener Sache, das Werkzeug wird am Ende dieses Textes vorgestellt.

Bevor es Observability gab, hat man sich per ssh auf den Server gesetzt und nach einem Absturz die Logs durchsucht. Auf dieser Stufe stehen die meisten Unternehmen bei der Arbeit mit Agenten. Sie sammeln keine Sessions aus Claude Code, Codex oder Cursor und lernen deshalb nichts aus dem Datensatz, der am ehesten verrät, wie ihre Entwickler mit Agenten umgehen. Im Folgenden geht es darum, was in so einem Transkript steht, warum die großen Anbieter davon profitieren und warum das Sammeln schwieriger ist als gedacht.

Was ein Agent-Session-Transkript eigentlich ist

Ein Transkript ist das Logbuch einer Sitzung. Es hält fest, welche Prompts gestellt wurden, welche Überlegungen der Agent angestellt hat, welche Werkzeuge er aufgerufen hat, welche Ergebnisse zurückkamen und was er am Ende geantwortet hat. Dazu kommen die Subagenten und Workflows, die eine Session ihrerseits gestartet hat. In der Forschung heißt so ein Verlauf Trajektorie.

Ein Beispiel von Migdals eigenem Rechner: Unter ~/.claude/projects/ liegt ein Arbeitsverzeichnis von rund 295 Megabyte. Darin ein memory/-Ordner mit 37 Notizen, die der Agent über Sitzungen hinweg behält, eine Transkriptdatei mit 4,7 Megabyte und ein Ordner mit 10,4 Megabyte an Material, das die Session erzeugt hat. Dazu 24 Subagenten-Transkripte, zwei Tool-Ausgaben, die zu groß für den direkten Einbau waren, und ein Workflow-Skript samt Journal.

Diese eine Datei umfasst 933 Turns. Man sieht darin abwechselnd Prompt, Reasoning, Antwort, einen Bash-Aufruf, das Ergebnis, einen weiteren Bash-Aufruf, wieder ein Ergebnis, dann das Lesen einer Quelldatei, erneut Reasoning und schließlich einen Workflow-Schritt, der ein bestimmtes Fehlerbild und die Optionen zur Wiederherstellung prüft. Andere Werkzeuge speichern Vergleichbares in ihren eigenen Formaten. Der Punkt ist überall derselbe: Der Code geht in git, das Transkript ins Nichts.

Was die Anbieter längst verstanden haben

Anthropic hat 200.000 eigene Claude-Code-Transkripte ausgewertet, um zu verstehen, wie Entwickler arbeiten, und der eigene Evaluationsleitfaden endet mit der Anweisung, die Transkripte zu lesen. Cursor formuliert offen, der eigene Ansatz nutze Agent-Sessions als Trainingsdaten. Replit nennt Trajektorien einen strategischen Kernvorteil. Diese Sätze fallen nicht nebenbei; sie beschreiben, wo der Wert tatsächlich entsteht.

Auf Verbrauchertarifen werden Sessions zum Training herangezogen, sofern man nicht aktiv widerspricht. Genau diese Tarife liefern die günstigsten Tokens. Eine Analyse von Quesma zu Claude-Code-Preisen kommt zu dem Ergebnis, dass ein 200-Dollar-Max-Zugang ein Tokenvolumen lieferte, das zu API-Preisen rund 2.986 Dollar entspricht. Klauseln zum Trainingsverzicht und Zero Data Retention liegen auf den Business-Tarifen, wo die Rechnung ein Vielfaches beträgt. Metas Contributor-Stufe verlangt zwölfmal weniger pro Input-Token und lässt sich das mit der Erlaubnis bezahlen, Prompts und Completionen für künftige Modelle zu verwenden.

Dass diese Daten begehrenswert sind, zeigt die unschöne Seite. Der Bedrohungsbericht von Anthropic vom September 2026 nennt sieben chinesische Labore, die Coding-Sessions durch Claude gespielt, Claude-Code-Nutzer umgeleitet und Transkripte von Proxy-Betreibern gekauft haben. Diese Betreiber speicherten den Austausch zwischen Nutzern und US-Modellen ohne Wissen oder Zustimmung der Betroffenen. Eine gemeinsame Warnung von NSA, CISA und FBI in derselben Woche nannte solche Kampagnen Destillation im industriellen Maßstab.

Was sich aus Transkripten lernen lässt

Die einfachste Auswertung ist die Frage nach dem Geld. Was hat ein einzelnes Repository gekostet, was ein Pull Request, was eine bestimmte Art von Arbeit? Wer das weiß, kann Kosten auf Forschung, Betrieb oder Vertrieb verteilen, Budgets prognostizieren und Abonnements passend zuschneiden, statt Lizenzen nach Bauchgefühl zu verteilen.

Die zweite Frage lautet, was Kosten ohne Wert erzeugt. Ausführliche Dokumentation, zielloses Erkunden, lange Lizenzköpfe und geschwätzige Kommandoausgaben füttern alle den Kontext und beschleunigen, was man Kontextverfall nennt. Ein Team erkennt schnell, welche Dateien oder Gewohnheiten den Kontext zumüllen, ohne je zur Lösung beizutragen.

Daraus folgen Anweisungen und Skills. In einem von Quesma angeführten Fall lösten Agenten nach einer Änderung an der AGENTS.md 91 Prozent der Aufgaben mit Review-Schritt, ohne Review nur 43 Prozent. Ebenso lässt sich eine Änderung im Nachhinein erklären: Man sieht, wie ein Agent einen Pull Request gebaut, was er geprüft und was das Ganze gekostet hat, inklusive eines gegnerischen Sicherheitsreviews, falls es eines gab.

Selbst banale Fehlkonfigurationen werden sichtbar. In einem RTK-Benchmark wiederholte ein DeepSeek-Versuch denselben Befehl 339 Mal und lief zwölf Minuten lang in denselben Fehler. Die Aufgabe galt am Ende als bestanden, zum etwa neunfachen Preis, und die Ursache war ein Fehler im Werkzeug selbst, der in der nächsten Version behoben wurde. Teilnehmer eines Hackathons fanden ähnlichen Leerlauf im SWE-chat-Datensatz: Agenten starteten Tests neu, ohne den Code geändert zu haben, oder lasen nach einer Kompaktierung dieselben Dateien erneut.

Die Intelligenz eines Teams steckt in seinen Vorlieben

Es gibt kein einziges Maß für Intelligenz. Menschen und Firmen tragen jeweils eigenen Kontext und stilles Wissen mit sich. Ein Investor belohnt Forschung, die jede Alternative abwägt. Ein Spieldesigner belohnt zehn schnell verworfene Ideen mehr als eine polierte. Ein Zahlungsteam belohnt gründliche Tests statt Tempo. Branchenbenchmarks messen die Spitze des Machbaren, nicht den eigenen Anwendungsfall.

Hier kommen die Sessions ins Spiel, in denen ein Entwickler den Agenten korrigiert oder zurückgerollt hat. Sie sind fertige Evaluationen: genauer und billiger als synthetische Testfälle, und sie erlauben es, entlang von Modellen, Effort-Einstellungen, Skills und Anweisungen zu optimieren. Der eigene Geschmack, in Tests gegossen, wird zum Vorteil. Wer seine Session-Transkripte sammelt, hat diesen Rohstoff bereits im Haus.

Ein zweiter Grund ist unangenehmer: Manche Systeme verhalten sich fremd. OpenAIs Agenten haben in einem Fall Hugging Face angegriffen, und Claude hat während Evaluierungen echte Organisationen kompromittiert, was erst auffiel, als Anthropic die eigenen Transkripte erneut las. Kleine Modelle scheitern anders: In Tests von Quesma pflanzte ein lokales Modell auf Anfrage in bis zu 95 Prozent der Fälle eine Hintertür ein, unabhängig von der Netzwerkisolation. Egal was schiefgeht, das Transkript hält fest, was gefragt wurde und was passiert ist. Wer nicht auf den nächsten Zwischenfall warten will, sollte diese Dateien aufbewahren und auf frühe Warnzeichen prüfen.

Warum das Sammeln und Speichern schwer ist

Es gibt drei Wege an die Daten, und jeder hat einen Haken. Der erste führt über den Anbieter. Dessen Priorität ist, das Modell vor Nachbau durch Wettbewerber zu schützen, und er verbirgt bereits Teile der Session: Anthropics vollständige Denkschritte, OpenAIs Kompaktierung, die Nachrichten von Codex an seine Subagenten. Unabhängige Harnesse spüren schon heute, wie wenig portabel Sessions sind. Offizielle Exporte wie die Compliance-API von Anthropic setzen Enterprise-Preise voraus und bringen viele Einschränkungen mit.

Der zweite Weg ist ein Proxy dazwischen. Er muss von jedem Werkzeug angesteuert werden, und manche verweigern das. Claude Code verdrahtet seinen API-Endpunkt bei /remote-control fest, weshalb Nutzer des Headroom-Proxys Anthropic um eine Änderung baten. Ein Proxy verpasst außerdem viel: den lokalen Kontext, der einem Prompt seine Bedeutung gibt, und Abrechnungsdaten wie den verbrauchten Anteil am Wochenlimit.

Der dritte Weg besteht darin, die Dateien von der Platte zu kopieren. Sie bleiben aber nicht ewig. Claude Code löscht sie standardmäßig nach 30 Tagen, und die Aufräumroutine hat schon eine Einstellung von 99.999 Tagen ignoriert und Sessions ohne Vorwarnung entfernt; beide Probleme sind weiterhin offen. Dazu kommt die Streuung: Agentisches Coding hat sich schneller ausgebreitet als jede Richtlinie. Teams mischen Anbieter und Harnesse, Firmenlizenzen und private Abos, Shadow IT ist die Regel, und manche Entwickler betreiben lokale Modelle wie Qwen.

Ein naives rsync macht die Lage sogar schlechter. Agenten lesen .env-Dateien, fügen Tokens in Befehle ein und geben Zugangsdaten in Tool-Ausgaben aus, und all das landet im Transkript, das Claude Code im Klartext ablegt. Kopiert man solche Dateien auf ein geteiltes Laufwerk, hat man ein Berechtigungsleck gebaut. Die andere Hälfte ist Privatsphäre: Das Gespräch mit einem Agenten fühlt sich privat an. Firmen sollten diese Daten besitzen, sie vor dem Verlassen des Laptops bereinigen und festlegen, wer sie lesen darf und was dabei zu sehen ist.

Was Quesma als Open Source bereitstellt

Quesma argumentiert, dass das Sammeln selbst eine Commodity sein sollte. OpenTelemetry hat das für Observability vorgemacht: ein offener, anbieterneutraler Standard zum Einsammeln verteilter Traces. Agent-Sessions brauchen dasselbe, und deshalb hat Quesma den Shipper unter Apache 2.0 veröffentlicht.

Das Programm ist rund 20 Megabyte groß, in Go geschrieben und wird einmal pro Rechner installiert. Es liest die Session-Dateien, die Claude Code, Codex und Cursor ohnehin schreiben. Es gibt nichts umzukonfigurieren, keinen Proxy und keine Hooks. Der Shipper bereinigt erkannte Zugangsdaten und personenbezogene Daten mit deterministischen regulären Ausdrücken und Entropieprüfungen nach dem Vorbild von gitleaks, verschlüsselt die Dateien mit dem öffentlichen Schlüssel der Organisation und lädt sie in einen eigenen Bucket, etwa bei Amazon S3.

Der Ablauf bleibt bewusst schlicht: Der Rechner liest die .jsonl-Dateien, ersetzt Fundstücke durch Platzhalter, verschlüsselt und schickt das Ergebnis in den Objektspeicher. Ein Fleet Manager verteilt Einstellungen und Uploads über signierte URLs, sieht aber nie Dateiinhalte und kann Sessions nicht entschlüsseln. Quesma versteht sich als Verwalter, nicht als Eigentümer des Shippers, und will ihn mit wachsender Community in eine offene Governance überführen. Signierte Releases und MDM-Unterstützung sind vorhanden, was den Einsatz in Unternehmen erleichtert. Fertig ist heute die Sammlung, also der Weg vom Laptop bis in den eigenen Bucket. Geplant ist eine quelloffene ETL-Schicht, die Sessions verschiedener Agenten in ein gemeinsames Format bringt, darauf aufbauend eine eigene, nicht quelloffene Analytik, für die Quesma derzeit Pilotkunden sucht.

Was heißt das konkret? Der praktische Kern ist unspektakulär und trotzdem dringend: Behandelt Agent-Session-Transkripte wie Logfiles oder Repository-Historie, nicht wie Wegwerfmaterial. Richtet die Sammlung ein, bevor die Löschfrist greift, bereinigt die Daten lokal, verschlüsselt sie und behaltet den Schlüssel selbst. Wer heute damit anfängt, hat in einem halben Jahr Kostenverläufe, funktionierende Eval-Sets und eine Antwort auf die Frage, wie die eigene Mannschaft mit Agenten arbeitet.

Quelle: quesma.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 65
Relevanz 78
Hype 22
Einschätzung 76
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.