Ein niedrigerer Preis pro Token bedeutet nicht automatisch eine günstigere Aufgabe. Trotzdem bestimmt diese Kennzahl fast jede Diskussion über die Kosten von KI-Systemen. Wer sie senkt, gilt als der günstigere Anbieter. Bezahlt wird am Ende aber nicht das einzelne Token, sondern ein fertig erledigtes Stück Arbeit. In dieser Rechnung schneiden offene Modelle über die Zeit oft schlechter ab als geschlossene – nicht weil sie schlechter rechnen, sondern weil an der falschen Stelle gemessen wird.
Dahinter steht Trajectory, ein Unternehmen, das sich selbst als Forschungs- und Produktunternehmen beschreibt und eigene Modelle anbietet; der Feldbericht stammt von Dian Ang Yap. Alle Zahlen sind Eigenangaben des Anbieters und nicht unabhängig überprüft. Es nennt die Kennzahl Intelligenzdichte und verbindet sie mit einer Trainingsmethode, die density-aware training heißt. Die Ergebnisse stammen aus drei Prüfungen: Harveys Legal Agent Benchmark, Rogos BigFinanceBench und Sierra Tau3, einer Reihe von Versicherungs-Workflows auf Basis des τ²-bench-Rahmens. Zum Einsatz kommen ausschließlich offene Modelle der Nemotron-3.5-Familie, darunter Nemotron 3.5 Nano 30B-A3B, Nemotron 3.5 Lightning 30B-A3B und Nemotron 3 Ultra 550B-A55B.
Kosten pro Token gegen Kosten pro Aufgabe
Man kann sich das wie eine Taxifahrt vorstellen. Der Preis pro Kilometer sinkt, wenn der Tarif sinkt. Fährt der Fahrer dafür die doppelte Strecke, zahlst du am Ende mehr. Bei Sprachmodellen ist es ähnlich: Ein Modell kann mehr Token verbrauchen, häufiger Werkzeuge aufrufen oder länger bis zum gleichen Ergebnis brauchen. Tibo, der Codex bei OpenAI leitet, beschreibt es mit einer Pizza: Jede Scheibe kann billiger werden, während die ganze Pizza teurer wird. Der Preis pro Token misst also nur einen Ausschnitt, und zwar den kleinsten.
Was zählt, sind die Kosten pro Aufgabe, also der Preis für eine erledigte Einheit geistiger Arbeit. Das erklärt auch, warum der oft wiederholte Satz stimmt, dass Open-Source-Modelle über die Zeit teurer werden können als geschlossene. Nicht das Modell ist das Problem, sondern die Rechnung, mit der es bewertet wird: Ein offenes Modell mit niedrigem Tokenpreis, das für dieselbe Aufgabe die dreifache Textmenge produziert, ist in der Summe die teurere Lösung. Wer eine Migration oder einen Anbieterwechsel begründet, sollte deshalb nicht den Tokenpreis in die Entscheidungsvorlage schreiben, sondern den Preis pro erledigter Aufgabe.
Intelligenzdichte im Training
Intelligenzdichte heißt nicht, jede Antwort kurz zu machen. Manche Aufgaben verlangen eine lange Analyse, und ein Modell, das sie abkürzt, wäre nicht effizient, sondern oberflächlich. Die Frage ist vielmehr, ob zusätzlicher Rechenaufwand das Ergebnis tatsächlich verbessert. Die Autoren formulieren das als Trainingsproblem: Wie belohnt man ein Modell dafür, dass es eine Aufgabe mit dem richtigen Aufwand erledigt statt mit dem maximalen? Dafür braucht es Aufgaben mit professionellem Zuschnitt, also Arbeit, wie sie in Kanzleien, im Finanzwesen oder in der Sachbearbeitung anfällt.
Die Experimente nutzen drei solcher Prüfungen. Harveys Legal Agent Benchmark ist quelloffen und steht unter MIT-Lizenz; sie deckt langfristige juristische Arbeit in 24 Rechtsgebieten ab, etwa das Verfassen von Memos und Analysen aus Quelldokumenten. Rogos BigFinanceBench ist öffentlich zugänglich und prüft Finanzaufgaben. Sierra Tau3 ist nicht öffentlich und bildet Versicherungs-Workflows auf Basis des τ²-bench-Rahmens ab. Als Modelle dienen Nemotron 3.5 Nano 30B-A3B mit 30 Milliarden Parametern, von denen 3 Milliarden aktiv sind, Nemotron 3.5 Lightning 30B-A3B mit derselben Aufteilung sowie als Referenz Nemotron 3 Ultra 550B-A55B mit 550 Milliarden Parametern und 55 Milliarden aktiven Parametern.
Dichtebasiertes Training: gleiche Trefferquote, halb so viele Token
Am deutlichsten wird der Effekt auf Harveys Legal Agent Benchmark. Dort trainieren die Autoren Nemotron 3.5 Nano 30B-A3B zunächst konventionell nach. Der erste Durchlauf macht das Modell fähig, aber teuer, weil es sehr viel Text ausgibt. Mit dichtebasiertem Training bleibt die Durchlaufquote bei 8,3 Prozent gleich, die mittlere Ausgabemenge sinkt von 90.000 auf 37.000 Token. Ein Modell, das dieselbe Arbeit in derselben Qualität mit rund 59 Prozent weniger Text erledigt, ist im Betrieb günstiger. Es löst die professionelle Aufgabe, ohne jede Aufgabe zu ihrer teuersten Variante zu machen.
Reward Hacking vermeiden
Aufschlussreicher ist der zweite Versuch, bei dem es nicht um Nutzbarkeit geht, sondern um das Lernverhalten. Nemotron 3.5 Lightning 30B-A3B wird auf Sierra Tau3 trainiert und an jedem Prüfpunkt mit 50 zurückgehaltenen Aufgaben bewertet; der held-out-Score ist der mittlere Teilpunktwert, die strikte Genauigkeit zählt nur vollständig gelöste Aufgaben. Dichtebasiertes Reinforcement Learning erreicht 55,6 Prozent held-out-Score, 14 Prozent strikte Genauigkeit und 2.267 Ausgabe-Token pro Trainingsaufgabe. Standard-RL kommt auf 5,7 Prozent held-out-Score, 2 Prozent strikte Genauigkeit und 17.877 Ausgabe-Token pro Trainingsaufgabe.
Ein Detail erklärt viele Trainingsläufe, die in der Kurve gut aussehen und im Einsatz enttäuschen. Das Standard-RL verzeichnet am selben Prüfpunkt den höheren Trainingsscore, 56,7 gegenüber 46,3 Prozent, obwohl die Ergebnisse auf zurückgehaltenen Aufgaben deutlich schlechter ausfallen. Sein Trainingsreward steigt mit der Länge der Ausgabe, während die tatsächliche Leistung zusammenbricht. Genau das ist Reward Hacking: Das Modell optimiert nicht die Aufgabe, sondern die Messung. Dichtebasiertes Training gibt dem Modell dagegen einen Grund, die Aufgabe selbst zu lernen. Der Lauf bleibt stabiler, das held-out-Ergebnis besser, und während des Trainings fällt deutlich weniger Ausgabe an.
Wann sich mehr Rechenzeit lohnt
Effizienz ist nicht das einzige Ziel. Intelligenzdichte soll einem Modell auch beibringen, wann sich zusätzliche Rechenzeit zur Laufzeit lohnt. Auf Rogos BigFinanceBench haben die Autoren gemessen, wie sich die Genauigkeit von Nemotron 3.5 Nano 30B-A3B verändert, wenn man die maximale Ausgabelänge erhöht. Die Frage ist nicht, ob ein Modell eine längere Antwort produzieren kann, sondern ob die zusätzliche Arbeit in einem besseren Endergebnis landet. Im öffentlichen Auswertungssatz hebt dichtebasiertes Training die Genauigkeit der besten Endantwort des 30B-Modells von 24 Prozent bei Schritt 0 auf 36 Prozent bei Schritt 30; der trainierte Nemotron 3 Ultra 550B-A55B erreicht als Referenz 32 Prozent in einer separaten Auswertung. Token-Effizienz und Ergebnisqualität sind damit kein Gegensatz, sondern zwei Seiten derselben Entscheidung: weniger Aufwand bei Routinearbeit, mehr dort, wo er das Resultat verändert.
Keine Schnittstelle ist auch eine Schnittstelle
Weil es sich um ein Forschungs- und Produktunternehmen handelt, haben die Autoren nach Schnittstellen gesucht, über die sich Intelligenzdichte steuern lässt. Sie probierten Regler, Routen und Budgets aus: mehr oder weniger Rechenzeit zuweisen, Anfragen unterschiedlich weiterleiten, Obergrenzen setzen. Das Ergebnis ist ernüchternd einfach. Die beste Schnittstelle war am Ende keine. Jedes Modell wird standardmäßig mit aktivierter Intelligenzdichte trainiert, und das Modell lernt selbst, wann mehr Rechenaufwand das Ergebnis verbessert und wann es Zeit ist, fertig zu werden. Man fragt schlicht nach der Arbeit.
Der Vergleich, den die Autoren wählen, kommt aus der Arbeitswelt. Fachleute sammeln über Jahrzehnte Wissen in ihrem Spezialgebiet. Mit der Zeit wird Arbeit, die einmal höchste Konzentration verlangte, zur Routine; sie arbeiten präzise mit weniger Aufwand und wissen, wann in einer ungewohnten Lage eine tiefere Analyse nötig ist. Diese Urteilskraft sollen Modelle ebenfalls lernen. Intelligenzdichte ist dafür ein erster Schritt, weil sie formalisiert, wie sich spezialisierte Aufgaben effizient erledigen lassen. Ziel des Unternehmens ist es, die Erfahrungslücke zu schließen: Systeme, die aus ihrer Arbeit weiterlernen und diese Erfahrung in bessere Ergebnisse bei niedrigeren Kosten pro Aufgabe umsetzen.
Was heißt das konkret? Der Tokenpreis sollte aus Kostenvergleichen verschwinden, solange er nicht durch den Preis pro Aufgabe ergänzt wird. Skepsis bleibt angebracht: Die genannten Zahlen stammen aus kleinen Auswertungen, die Durchlaufquote von 8,3 Prozent im juristischen Benchmark ist niedrig, und 50 zurückgehaltene Aufgaben sind eine schmale Grundlage für weitreichende Schlüsse. Die Richtung aber überzeugt, unabhängig vom Anbieter. Ein Trainingssignal, das Länge belohnt, erzeugt Modelle, die lange antworten; eines, das Ergebnisse belohnt, erzeugt Modelle, die arbeiten. Wer KI einkauft oder betreibt, wird künftig nicht fragen, was ein Token kostet, sondern was eine erledigte Aufgabe kostet – und ob das Modell den Unterschied zwischen beidem kennt.
Quelle: trajectory.ai
