Zehn Evaluations laufen mit festen Gewichten durch dieselbe Auswertung, am Ende steht eine Zahl. Diese Zahl ist der Artificial Analysis Intelligence Index in Version 4.3.2, und für Claude Opus 5.5 – gemessen in der Konfiguration „max with fallback“ – setzt sie sich aus Ergebnissen zusammen, die sich einzeln nachvollziehen lassen. Wer die Zahl liest, sieht ein Resultat. Ein Profil entsteht erst, wenn man die zehn Bestandteile auseinandernimmt und ihnen die Kosten pro Aufgabe gegenüberstellt. Darum geht es hier: nicht nur um die Rangliste, sondern um die Bauweise.
Zuerst die Eckdaten. Claude Opus 5.5 erreicht im Index 58 Punkte und steht damit auf Platz 1 von 211 Modellen seiner Vergleichsklasse, der Median liegt bei 26. Der Preis beträgt 4 US-Dollar pro Million Eingabe-Token und 20 US-Dollar pro Million Ausgabe-Token, jeweils doppelt so viel wie der Median von 2 und 10 Dollar; auf Cache-Treffer gibt es 95 Prozent Rabatt. Eine Aufgabe aus dem Index kostet im Schnitt 5,98 Dollar. Auffällig ist die Wortfülle: Für den gesamten Index erzeugte das Modell 260 Millionen Ausgabe-Token, der Median liegt bei 88 Millionen. Das Kontextfenster umfasst eine Million Token, als Eingabe versteht das Modell Text und Bilder. Artificial Analysis fasst das so zusammen: an der Spitze bei der Intelligenz, verglichen mit Modellen ähnlicher Preisklasse aber eher teuer.
Das Bild dahinter ist ein Assessment-Center mit zehn Stationen. Jede prüft etwas anderes – Schreiben, Recherchieren, Programmieren, Physik, Dokumentenarbeit – und am Ende steht kein Mittelwert der Einzelnoten, sondern ein gewichteter Gesamtwert. Ein Modell kann an einer Station glänzen und an einer anderen einbrechen; die Gesamtzahl bleibt trotzdem eine Orientierung. Sie sagt nur nichts darüber, welche Station für deinen Fall die entscheidende ist.
Was der Intelligence Index v4.3.2 zusammenfasst
Laut Artificial Analysis fließen in Version v4.3.2 zehn Evaluations ein: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR v1.1. Jede geht mit eigenem Gewicht in den Gesamtwert ein, die Methodik ist im Detail dokumentiert, einschließlich der Durchführung der einzelnen Läufe. Für einen Benchmark-Vergleich von Modellen wie Claude Opus 5.5 heißt das: Zwei Modelle mit ähnlichem Indexwert können völlig unterschiedliche Stärken haben.
Die Bewertung trennt außerdem zwischen offenen und proprietären Gewichten. Modelle mit verfügbaren Gewichten werden gekennzeichnet; eingeschränkte kommerzielle Nutzung erscheint als „Commercial Use Restricted“, ein grundsätzliches Verbot als „Non-commercial“. Für die Praxis ist diese Einordnung oft wichtiger als der Indexwert, denn sie entscheidet, ob ein Modell überhaupt in ein Produkt eingebaut werden darf. Ein Spitzenwert auf einer Rangliste hilft wenig, wenn die Lizenz den Einsatz im eigenen Geschäftsmodell ausschließt.
Die zehn Stationen und was sie prüfen
AA-Briefcase v1.1 ist ein von Artificial Analysis entwickelter Benchmark für agentische Wissensarbeit. Der Elo-Wert fasst drei Dinge zusammen: die Bestehensquote bei Kriterienkatalogen, die analytische Qualität und die Qualität der Präsentation. Die Rubric-Ergebnisse werden über synthetische Paarvergleiche in Elo umgerechnet, die Konfidenzintervalle an der Nullgrenze gekappt. Bewertet wird also nicht nur, ob eine Antwort richtig ist, sondern auch, wie brauchbar sie aufbereitet wurde.
GDPval-AA v2.1 misst agentische Aufgaben aus der realen Arbeitswelt, ebenfalls auf Elo-Basis; AutomationBench-AA prüft agentische Workflows in SaaS-Umgebungen. Terminal-Bench 4.0 deckt agentisches Programmieren und die Arbeit in der Kommandozeile ab. SciCode steht für naturwissenschaftliches Coding, Humanity’s Last Exam für breit gestreute, schwere Wissensfragen. GDP.pdf bewertet die Auswertung professioneller Dokumente nach dem Alles-oder-nichts-Prinzip, CritPt prüft physikalisches Schlussfolgern, AA-LCR v1.1 das Schlussfolgern über lange Kontexte.
Bei allen Unterschieden gilt derselbe Satz, den die Quelle selbst formuliert: Modellintelligenz überträgt sich grundsätzlich auf verschiedene Anwendungsfälle, einzelne Evaluations können für einen konkreten Zweck aber relevanter sein als der Durchschnitt. Wer ein Modell für Vertragsanalyse sucht, erfährt aus GDP.pdf mehr als aus SciCode. Der Intelligence Index erklärt also nicht, welches Modell du nehmen sollst; er sagt dir, wo du genauer hinsehen musst.
AA-Omniscience: der Index, der Halluzinationen bestraft
Ein Bestandteil verdient eigene Aufmerksamkeit, weil er einer anderen Logik folgt als die übrigen Benchmarks. Der AA-Omniscience Index misst Wissenszuverlässigkeit und Halluzinationsneigung auf einer Skala von -100 bis 100. Korrekte Antworten erhöhen den Wert, falsche senken ihn, eine Verweigerung wird nicht bestraft. Null bedeutet, dass ebenso viele richtige wie falsche Antworten gegeben wurden; negative Werte stehen für mehr falsche als richtige.
In der Assessment-Center-Analogie ist das die Station, an der man ausdrücklich sagen darf: „Das weiß ich nicht.“ Wer rät und daneben liegt, verliert Punkte; wer die Lücke offen benennt, verliert nichts. Das verschiebt den Anreiz weg vom selbstsicheren Auftreten hin zur Kalibrierung. Für Anwendungen, in denen Fehler teuer sind – Auskünfte, Recherche, Compliance – ist diese Kennzahl deshalb oft aussagekräftiger als ein hoher Gesamtwert aus einem Mix ganz anderer Fähigkeiten.
Kosten pro Intelligence-Index-Task und die Pareto-Linie
Der zweite große Block ist die Preisanalyse. Artificial Analysis stellt dem Intelligence Index die gewichteten durchschnittlichen Kosten pro Index-Task gegenüber und berechnet sie aus fünf Tokenarten: Eingabe, Cache-Treffer, Cache-Schreibvorgang, Reasoning und Antwort. Die Kosten jeder Evaluation werden durch die Zahl ihrer Aufgaben geteilt und anschließend mit dem Gewicht multipliziert, das die Evaluation im Index trägt. Entscheidend: Es handelt sich nicht um den Listenpreis pro Million Token, sondern um die Kosten für eine erledigte Aufgabe.
Aus dieser Gegenüberstellung entsteht ein Streudiagramm, in dem ein Quadrant als besonders attraktiv markiert ist und eine Pareto-Linie die effizienten Modelle verbindet. Modelle auf dieser Linie lassen sich nur noch in einer Dimension verbessern, indem man in der anderen schlechter wird. Für den Preis-Leistungs-Vergleich von Claude Opus 5.5 heißt das: Die interessante Frage lautet nicht, ob das Modell teurer ist als ein anderes, sondern ob der zusätzliche Intelligenzgewinn die zusätzlichen Kosten pro Aufgabe rechtfertigt. Die Bezeichnung „max with fallback“ weist zudem darauf hin, dass die Werte an eine bestimmte Betriebsart gebunden sind; wer eine andere Stufe wählt, sollte Token- und Kostenwerte nicht ungeprüft übernehmen.
Token-Verbrauch, Cache-Preise und das Kontextfenster
Ein Modell kann auf dem Papier günstig sein und im Betrieb teuer werden, wenn es für dieselbe Aufgabe deutlich mehr Token produziert. Deshalb weist Artificial Analysis zusätzlich die durchschnittliche Zahl der Ausgabe-Token pro Index-Task aus, berechnet aus den Ausgabe-Token je Evaluation, gewichtet nach Benchmark und geteilt durch die Aufgabenzahl ohne Wiederholungen. Erst zusammen mit den Tokenpreisen ergibt dieser Wert die Kosten pro Aufgabe. Zwei Modelle mit identischem Tokenpreis können sich hier erheblich unterscheiden.
Die Preisangaben selbst werden in drei Kategorien zerlegt: Cache-Treffer, Eingabe und Ausgabe, jeweils in US-Dollar pro Million Token. Der Cache-Treffer-Preis gilt für bereits verarbeitete Prompts und liegt typischerweise deutlich unter dem regulären Eingabepreis; Cache-Schreibvorgänge und Cache-Speicherung werden getrennt abgerechnet und unterscheiden sich je nach Anbieter. Wer die Gesamtkosten hochrechnet, muss diese Nebenkosten mitnehmen, sonst fällt die Rechnung im Betrieb anders aus als im Vergleich auf der Übersichtsseite.
Das Kontextfenster rundet das Bild ab. Angegeben wird die maximale Zahl kombinierter Eingabe- und Ausgabe-Token, wobei das Limit für Ausgabe-Token häufig deutlich niedriger liegt und je nach Modell variiert. Große Kontextfenster sind vor allem für RAG-Workflows relevant, also für Verfahren, bei denen ein Modell große Datenmengen durchsucht und darin nach den passenden Stellen sucht. Ein großes Fenster allein garantiert keine gute Antwort; es erhöht zunächst nur die Menge an Material, die hineinpasst.
Was das für den praktischen Einsatz bedeutet
Nach dieser Aufschlüsselung bleibt eine nüchterne Einordnung. Der Intelligence Index von Claude Opus 5.5 ist ein zusammengesetztes Maß aus zehn unterschiedlichen Prüfungen, dessen Aussagekraft davon abhängt, wie ähnlich diese Prüfungen deiner eigenen Aufgabe sind. Die Kosten pro Index-Task sind die ehrlichere Währung als der Preis pro Million Token, weil sie Tokenverbrauch und Gewichtung bereits enthalten. Und die Lizenzangaben entscheiden, ob ein Modell für den kommerziellen Einsatz überhaupt in Frage kommt.
Der pragmatische Weg ist deshalb, den Index als Filter zu benutzen und nicht als Urteil. Nimm die zwei oder drei Evaluations, die deinem Anwendungsfall am nächsten liegen, vergleiche dort, und rechne die Kosten mit deinem eigenen Prompt-Muster nach – mit deiner Eingabelänge, deiner Cache-Trefferquote und deiner typischen Ausgabelänge. Ein Benchmark-Vergleich liefert dir die Landkarte; die Route durch dein eigenes Projekt musst du selbst messen.
Quelle: artificialanalysis.ai
