Claude-Schreibstil nachgemessen: Was Opus 5.5 wirklich besser macht

Ruhige Schreibtischszene mit Notizbuch, Laptop und Papieren im warmen Seitenlicht
Deine Reaktion:

„We fixed the writing“ – mit diesem Satz kommentierte Sholto Douglas von Anthropic den Start von Opus 5.5. Sein Kollege Tom Brown brachte dasselbe in vier Wörter: „we fixed the accent.“ Ein Akzent ist ein gutes Bild dafür, und ein verdächtiges: Akzente verschwinden nicht per Ankündigung. Man kann höchstens zählen, wie oft einer noch durchbricht. Genau das hat ein Entwickler bei Arize gemacht und die Ankündigung in einen kompletten Eval-Lauf übersetzt.

In der offiziellen Mitteilung heißt es, man habe „major improvements to the way Opus 5.5 writes and communicates“ erzielt, eines der häufigsten Feedback-Themen zu Opus 5, und das Modell sei „less likely to use jargon or idiosyncratic phrases“. Das Fachmagazin The Decoder machte daraus die Schlagzeile, Anthropic verspreche weniger „Claudish“. Solche Sätze sind keine Meinung, sondern eine Behauptung, die man testen kann. Wer regelmäßig mit Claude schreibt, ist vom Ergebnis direkt betroffen.

Claudismen: ein Akzent, den man nicht per Beschluss loswird

Die Rede ist von Sätzen wie diesen: Etwas „isn’t just a tool, it’s a mindset“, ein Detail „is doing a lot of work“, und man solle kurz innehalten und das wirken lassen. Menschen schreiben selten so. Claude schon – und alle, die Claudes Ausgabe unverändert in einen LinkedIn-Post kopieren, ebenfalls. Der Autor des Tests arbeitet bei Arize, einem Anbieter von Evaluierungs-Werkzeugen. Seine erste Reaktion auf die Ankündigung war keine Zustimmung, sondern der Satz, den man in der Branche kennen sollte: Zeig mir den Eval.

Bauchgefühl zählt nicht, egal ob es das eigene ist oder das eines Anbieters. Also baute er ein Projekt namens claude-compare und arbeitete denselben Loop ab, den man für jede Änderung an einem Agenten nutzen würde: einen Datensatz bauen, Experimente darüber laufen lassen, die Ausgabe von Hand annotieren, daraus einen Evaluator bauen und ihn laufen lassen. Das ist mehr Arbeit als eine Stichprobe mit drei Ausgaben. Anders kommt man aber nicht an ein belastbares Ergebnis.

Der Versuchsaufbau: 20 eingefrorene Briefings, ein identischer Prompt

Ein Datensatz ist die feste Menge von Eingaben, gegen die getestet wird. Jedes Experiment läuft über dieselben Beispiele, damit eine veränderte Punktzahl auf die getestete Änderung zurückgeht und nicht auf andere Eingaben. Für einen Schreibtest sind die Eingaben Schreibaufgaben: 20 Recherche-Briefings, jedes mit Notizen für einen Blogpost, damit genug Langtext zum Prüfen entsteht. Die Themen decken fünf Genres ab – Meinung, technische Erklärung, Tutorial-Einstieg, Nachrichtenanalyse, Produktankündigung – und fünf Domänen: KI, Reisen, Kochen, Spiele, Bücher.

Ein Datensatz aus lauter KI-Themen hätte nur gezeigt, wie Claude über KI schreibt. Zwei Eigenschaften machen diese Sammlung belastbar. Sie ist eingefroren: Opus 5 hat jedes Thema einmal per Websuche recherchiert, die Briefings sind versioniert und per Hash gesperrt, und das schreibende Modell bekommt weder Werkzeuge noch Netzzugang. Und die Eingaben tragen den Stil nicht, den man messen will – sie bestehen aus Stichpunkten, damit Opus 5’ Eigenheiten nicht schon im Prompt stecken. Am Briefing hängt der ganze Test.

Dann kommt das Experiment, also ein Durchlauf der Aufgabe über den gesamten Datensatz. Wer zwei Modelle vergleichen will, ändert zuerst nur das Modell und nagelt alles andere fest. Beide bekamen denselben Prompt, und die Effort-Stufe wurde auf medium fixiert, weil Opus 5 standardmäßig auf high läuft und Opus 5.5 auf medium – mit den Voreinstellungen hätte man zwei verschiedene Dinge gemessen. Zusätzlich prüfte die Testumgebung bei jeder Antwort, welches Modell tatsächlich diente. Weil Modellausgaben von Lauf zu Lauf schwanken, lief jedes Modell zweimal: vier Experimente, 80 Posts, rund 110.000 Wörter.

Die Annotation: Claudismen sind keine Phrasen, sondern rhetorische Moves

Annotationen sind menschliche Labels auf den Ausgaben, also die Grundwahrheit, an der sich später der Evaluator messen muss. Wer den Evaluator vor der Annotation baut, weiß nicht, was er eigentlich misst. Der Autor legte alle 40 Opus-5-Posts in ein einziges Textdokument und las sie komplett – 53.000 Wörter – und machte an jede Wendung, die ihn zusammenzucken ließ, einen Kommentar mit dem Wort Claudism. Am Ende standen 153 Markierungen in 38 der 40 Texte.

Dann kam die Überraschung. Er hatte eine handschriftliche Liste der berühmten Claudismen: „load-bearing“, „delve“, „crucially“, „genuinely“ und so weiter. Diese Liste traf ganze neun der 153 Fundstellen. „Load-bearing“, die Phrase, über die sich alle lustig machen, kommt in 53.000 Wörtern Opus-5-Text dreimal vor. Was tatsächlich auffiel, waren rhetorische Bewegungen, nicht Wörter.

Die größte Gruppe war die salience flag: etwa 48 Stellen, an denen der Text behauptet, etwas sei wichtig, statt zu zeigen, warum – „The interaction matters“, „a fact worth internalising“, „deserves a moment“. Danach folgten contrast reframes (etwa 30), also Umdeutungen der Form „It’s a topology, not a genre“, verdict intensifiers wie „the honest answer“ (rund 25), signposts, die eine Erkenntnis anmoderieren statt sie zu liefern (rund 20), stock metaphors (rund 10) und gotcha framing wie „the trap is“ (rund 7). Der Rest fiel in eine Sammelkategorie. Claudismen erkennen und vermeiden heißt also nicht, eine Wortliste zu verbieten. Man muss die Muster erkennen, nicht die Wörter.

Vom Span-Judge zum Messwert

Der erste Evaluator war ein LLM-Richter, der jedem Text eine Note von 1 bis 5 gab, wie sehr er nach Claude klingt. Schnell gebaut, kaum prüfbar: Wenn ein Text eine 4 bekommt, welche Sätze machen ihn zur 4? Eine Einzelnote lässt sich nicht gegen 153 menschliche Markierungen auflegen. Deshalb blieb die Variante, die jede gefundene Stelle als wörtliches Zitat zurückgibt, im selben Format wie die Annotationen. So kann man Zitat für Zitat gegen die eigenen Markierungen legen und die Trefferquote direkt messen.

Auch die Kategorien stammen aus den Annotationen: salience flag, contrast reframe, verdict intensifier, signpost, gotcha framing und stock metaphor. Die Annotationen dienen zugleich als Testfälle – alle drei „load-bearing“-Sätze müssen gefunden werden, sonst gilt der Lauf als gescheitert. Drei weitere Entscheidungen sind auf fast jeden Evaluator übertragbar: Em Dashes brauchen kein Sprachmodell, das übernimmt ein reiner Code-Evaluator. Kein Modell darf die eigene Familie benoten; als Richter diente deshalb OpenAIs gpt-6-luna. Und weil Opus 5.5 rund acht Prozent länger schreibt, werden die Werte auf die Textlänge normalisiert: gezählt wird pro 1.000 Wörter.

Das Ergebnis: Em Dashes fast bei null, Claudismen halbiert

Der Em Dash ist tatsächlich verschwunden. Opus 5 setzt 12,9 Em Dashes pro 1.000 Wörter, Opus 5.5 verwendet zwei in seinen gesamten 57.000 Wörtern Ausgabe, also 0,05 pro 1.000 Wörter. Das sind 99,6 Prozent weniger. Hier zählt ein Code-Evaluator, da steckt kein Richterurteil und kein Spielraum drin. Brodie Robertson kommentierte das mit dem Satz, die Em Dashes seien gelöscht, er wiederhole, die Em Dashes seien gelöscht.

Bei den übrigen Claudismen ist das Bild gemischt. Der Span-Judge fand 4,79 Claudismen pro 1.000 Wörter in Opus 5 und 2,38 in Opus 5.5 – ein Rückgang um die Hälfte, und jede einzelne Kategorie ging zurück. Verdict intensifiers fielen um 65 Prozent, stock metaphors um 70, contrast reframes um 56, salience flags um 44, signposts um 33. Nur das gotcha framing bewegte sich kaum, von 0,16 auf 0,13 – bei acht gegen sieben Vorkommen ist das zu dünn für eine Aussage. Der Abstand hält in jedem getesteten Genre und jeder Domäne.

Für den Vergleich Opus 5 gegen Opus 5.5 heißt das: Die Ankündigung stimmt in der Richtung, aber nicht im Ausmaß. Salience flags sind in beiden Modellen der häufigste Claudismus, die Grundbewegung bleibt also erhalten, nur leiser. Wer den Stil verbessern will, sollte dort anfangen: bei Sätzen, die Wichtigkeit behaupten, statt sie zu belegen.

Neue Ticks, getauscht statt abgelegt – und was „fixed“ konkret bedeutet

Opus 5.5 hat sich außerdem neue Gewohnheiten zugelegt. Eine einfache Auszählung ergab etwa zweieinhalbmal so viele fett gesetzte Aufzählungseinstiege wie bei Opus 5, 35 Prozent mehr Dreierlisten und acht Prozent mehr Text. Ein Teil der alten Tics wurde also nicht abgelegt, sondern eingetauscht. Detail am Rande: Anthropics eigener Prompting-Leitfaden für Claude Fable 5.1 warnt vor „mannered prose“ und führt ausgerechnet „this point earns its keep“ als Beispiel an. Opus 5.5 schrieb trotzdem, eine Küchenmaschine „earns its counter space“ und eine Brattechnik „earns its place“.

Der Akzent ist also leiser geworden, aber er ist nicht weg. „Fixed“ ist zu stark, „halbiert“ trifft es besser – und halbiert ist nicht null. Für alle, die mit Claude arbeiten, heißt das zwei Dinge. Erstens sinkt die Aufräumarbeit, wenn Claude-Texte weiterverwendet werden. Ein Filter gegen Em Dashes und das Entfernen von Wichtigkeitsfloskeln bleiben trotzdem sinnvoll. Zweitens zeigt der Aufbau, wie sich KI-Textqualität mit Evals messen lässt: eingefrorene Eingaben, ein Test pro Modell, Handannotation als Grundwahrheit, ein Evaluator, der Zitate statt Noten liefert. Ein Verbot einzelner Wörter erwischt neun von 153 Fällen. Wer die Muster misst, findet den Rest.

Quelle: arize.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 72
Relevanz 70
Hype 25
Einschätzung 78
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.