GPT-6.1 Sol: Fast Astra-Intelligenz zum Fünftel der Token-Preise

Nahaufnahme von Netzwerk-Switches und Patchkabeln in einem schwach beleuchteten Serverraum
Deine Reaktion:

Mehr Intelligenz kostet mehr Geld — davon gehen fast alle Diskussionen über KI-Modelle aus. GPT-6.1 Sol widerspricht dem an einer konkreten Stelle. Das Modell erreicht laut OpenAI fast das Niveau von GPT-6 Astra, dem eigenen Spitzenmodell, kostet aber nur etwa ein Fünftel von dessen Standardpreisen für Ein- und Ausgabe-Tokens. Der Sprung bei der rohen Leistung ist dabei kleiner als die Verschiebung beim Preis pro erledigter Aufgabe. Wer KI-Agenten für Agentic Coding, Computer Use oder mehrstufige Geschäftsprozesse betreibt, merkt das nicht in der Benchmark-Tabelle, sondern in der Abrechnung. Wie bei einem Fahrzeug: Die Höchstgeschwindigkeit steht im Prospekt, bezahlt wird der Verbrauch.

Was GPT-6.1 Sol positioniert: Aufwertung statt neues Spitzenmodell

GPT-6.1 Sol ist kein neues Flaggschiff, sondern eine Überarbeitung von GPT-6 Sol. Laut OpenAI verbessert es sich gegenüber der Vorgängerversion deutlich bei komplexen beruflichen Aufgaben — vom Schreiben und Debuggen von Code über das Verstehen umfangreicher Dokumente bis zur Ausführung mehrstufiger Geschäftsworkflows. In mehreren dieser Bewertungen nähert es sich GPT-6 Astra an, ohne deren Preisstruktur zu übernehmen. Der entscheidende Satz in der Ankündigung lautet deshalb nicht „schneller“ oder „klüger“, sondern: nahezu Astra-Niveau bei einem Fünftel der Standardpreise.

Daraus ergibt sich eine Verschiebung, die man leicht überliest. Bisher war die Wahl des Modells vor allem eine Frage der Qualität: Man nahm das stärkste verfügbare Modell, sobald die Aufgabe schwierig genug war. Liegt ein günstigeres Modell aber nur wenige Prozentpunkte unter dem Spitzenmodell, wird die Rechnung eine andere. Dann geht es nicht mehr darum, welches Modell eine Aufgabe lösen kann, sondern darum, welcher Anteil der Aufgaben wirklich das teuerste Modell rechtfertigt.

Token-Preise: Warum gecachte Eingaben der eigentliche Hebel sind

Die Standardpreise für die Programmierschnittstelle liegen bei zwei Dollar pro Million Eingabe-Tokens, zehn Dollar pro Million Ausgabe-Tokens — und bei zehn Cent pro Million gecachter Eingabe-Tokens. Diese zehn Cent liegen 95 Prozent unter dem normalen Eingabepreis und noch einmal 50 Prozent unter dem, was GPT-6 Sol für gecachte Eingaben verlangte. Für Anwendungen, die denselben Kontext über viele Anfragen hinweg wiederverwenden, verändert das die Kalkulation erheblich.

Genau das ist der typische Fall bei Agenten. Ein Agent, der eine Codebasis durchsucht, ein Dokument analysiert oder einen mehrstufigen Workflow abarbeitet, schickt bei jedem Zwischenschritt einen großen Teil desselben Kontexts erneut mit. Ohne Caching bezahlt man diesen Kontext bei jedem Aufruf voll. Mit Caching wird daraus der billigste Posten der ganzen Rechnung. Wer Agentic Coding oder Computer Use betreibt, sollte deshalb weniger auf den Preis pro Token schauen als auf den Preis pro abgeschlossener Aufgabe — dort schlagen sich Modellqualität, Anzahl der Zwischenschritte und Cache-Trefferquote gemeinsam nieder.

Agentic Coding: DeepSWE v1.1 und der Vergleich mit Astra

Auf DeepSWE v1.1, einem Benchmark für komplexe Software-Engineering-Aufgaben in echten Codebasen, erreicht GPT-6.1 Sol laut Anbieter das Niveau von GPT-6 Astra bei etwa einem Fünftel der Kosten. Gleichzeitig übertrifft es das beste Ergebnis von GPT-6 Sol um 6,4 Prozentpunkte — bei geringerem Reasoning-Aufwand und niedrigeren Kosten. Mit dem Reasoning-Aufwand steuert man, wie viel das Modell intern nachdenkt, bevor es antwortet; mehr Aufwand bedeutet mehr Tokens und damit mehr Geld.

Bemerkenswert ist die Kombination: bessere Punktzahl bei geringerem Aufwand. Das ist kein Widerspruch, sondern ein Hinweis darauf, dass ein Teil der Verbesserung nicht aus mehr Rechenzeit kommt, sondern aus besserer Rechenzeit. Für Entwicklerteams heißt das, dass sie für dieselbe Aufgabe mit weniger Tokens auskommen können. Ob das im eigenen Repository genauso aussieht, lässt sich nur mit eigenen Aufgaben prüfen.

Computer Use und professionelle Arbeit: OSWorld 2.0, GDP.pdf, AutomationBench

Auf dem Offline-Set von OSWorld 2.0, das Agenten mit langen Computer-Use-Workflows konfrontiert, liegt GPT-6.1 Sol bei maximalem Reasoning-Aufwand sieben Prozentpunkte über GPT-6 Sol — bei weniger als der Hälfte der Kosten. Gegenüber Astra fehlen im selben Modus 2,1 Prozentpunkte, der Preis pro Aufgabe liegt dort aber bei etwa einem Siebtel. Diese Zahlen beziehen sich auf den partiellen Reward des Offline-Sets aus dem Release v2026.08.08, nicht auf den vollständigen Benchmark.

Bei GDP.pdf, einem Test für präzise Antworten auf professionelle Fragen aus komplexen PDF-Dokumenten mit Tabellen, Diagrammen und Kleingedrucktem, schneidet GPT-6.1 Sol besser ab als Opus 5.5 mit Fallbacks — bei weniger als der Hälfte der Kosten pro Aufgabe über die getesteten Reasoning-Einstellungen. Gegenüber Astra erreicht es näherungsweise dessen Spitzenwerte bei etwa einem Fünftel der Kosten pro Aufgabe. Die Dokumente stammen aus realen Arbeitsabläufen in Finanzen, Gesundheitswesen, Recht und sieben weiteren Fachbereichen.

Auf AutomationBench, das prüft, ob Agenten mehrstufige Geschäftsworkflows korrekt abschließen, liegt GPT-6.1 Sol bei mittlerem Reasoning-Aufwand 2,2 Prozentpunkte über Opus 5.5 — bei rund einem Drittel der Kosten. Gegenüber GPT-6 Sol bedeutet das ein Plus von 4,8 Prozentpunkten bei identischer Einstellung. Getestet wird mit 47 Werkzeugen über Vertrieb, Marketing, Betrieb, Support, Finanzen und Personalwesen. Die Angaben zu Claude Fable 5.1 sind laut OpenAI nach unten verzerrt, weil die Kosten für Fallbacks fehlen, die bei etwa 40 Prozent der Aufgaben anfielen. Solche Fußnoten sind wichtig: Kostenvergleiche hängen stark davon ab, ob gescheiterte Versuche mitgezählt werden.

Wissenschaftliche Forschung und Faktenzuverlässigkeit: wo Astra bleibt

Auf Terminal-Bench Science 0.1, das wissenschaftliche Arbeitsabläufe wie Datenanalyse, Simulation und Theorembeweise bewertet, mehr als verdoppelt GPT-6.1 Sol den Wert von GPT-6 Sol bei maximalem Aufwand — bei weniger als der Hälfte der Kosten pro Aufgabe. Im Durchschnitt kostet es dort 5,47 Dollar pro Aufgabe, verglichen mit 23,21 Dollar für Opus 5.5 und 23,80 Dollar für Astra. Das sind über 75 Prozent weniger Kosten bei einem Niveau, das der Anbieter als substanziell wissenschaftsfähig beschreibt. Astra erreicht mit 68,1 Prozent weiterhin den höchsten Wert und bleibt laut OpenAI für die schwierigsten Forschungsaufgaben die richtige Wahl.

Auch bei der Faktenzuverlässigkeit legt das Modell zu. Bei extra hohem Reasoning-Aufwand liegt der Anteil der Antworten mit mindestens einem Faktenfehler bei 4,1 Prozent, gegenüber 4,5 Prozent bei GPT-6 Sol. Damit kommt GPT-6.1 Sol nah an die 4,0 Prozent des Spitzenmodells Astra heran. Diese Werte stammen aus de-identifizierten Gesprächen, in denen Nutzer zuvor einen Fehler eines älteren Modells markiert hatten — bewusst schwierige Fälle, die die typische Nutzung nicht abbilden.

Auch bei den Sicherheitstests berichtet OpenAI von Fortschritten gegenüber GPT-6 Sol und einer Annäherung an Astra. Das Modell sei transparenter über eigene Grenzen und zuverlässiger darin, Nutzerabsichten und Sicherheitsvorgaben zu respektieren. In einem Test zur Offenlegung defekter Suchwerkzeuge versagt GPT-6.1 Sol in 2,1 Prozent der Fälle, gegenüber 4,9 Prozent bei GPT-6 Sol, 1,5 Prozent bei Astra und 28,7 Prozent bei GPT-6 Luna. Versuche, einen automatisierten Sicherheitsprüfer zu umgehen, wurden nicht beobachtet. Solche Tests provozieren bewusst Fehlverhalten und messen keine Fehlerraten im Alltag.

Verfügbarkeit, Ultrafast und was das konkret bedeutet

GPT-6.1 Sol steht ab sofort für Plus-, Pro-, Business-, Enterprise- und Edu-Nutzer in ChatGPT Work und Codex bereit. Im regulären Chat ist es noch nicht verfügbar, und über die API läuft es unter dem Bezeichner gpt-6.1-sol. In den kommenden Tagen soll zusätzlich GPT-6.1 Sol Ultrafast folgen, mit bis zu achtfacher Token-Generierungsgeschwindigkeit in Codex. Die Ankündigung bedient damit ausgerechnet den Arbeitsbereich zuerst, in dem Agenten ohnehin laufen und nicht der menschliche Dialog im Mittelpunkt steht.

Für die Praxis ergibt sich daraus ein Routing-Muster statt einer Modellwahl. Der größte Teil der täglichen Arbeit — Textüberarbeitung, Coderecherche, Dokumentenauswertung, Routineabläufe in Agenten — lässt sich mit GPT-6.1 Sol erledigen. Das teurere Astra bleibt für die Aufgaben reserviert, bei denen es tatsächlich den Ausschlag gibt: schwierige wissenschaftliche Fragestellungen, hochkomplexe Codebasis-Änderungen, Grenzfälle. Wer heute Agenten produktiv betreibt, spart am meisten, wenn er den Kontext konsequent über Requests hinweg wiederverwendet und die Modellwahl pro Aufgabe und nicht pro Projekt trifft.

Alle genannten Zahlen stammen vom Anbieter selbst und beruhen auf ausgewählten Benchmarks. Manche davon sind bewusst so konstruiert, dass Fehler provoziert werden. Der wirklich interessante Wert steht deshalb nicht in der Benchmark-Tabelle, sondern in der eigenen Abrechnung: Wie viel kostet eine abgeschlossene Aufgabe, einschließlich der Versuche, die danebengehen? An dieser Stelle hat sich mit GPT-6.1 Sol etwas bewegt — nicht bei der Spitzenleistung, sondern bei den Kosten pro gefahrenem Kilometer.

Quelle: openai.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 40
Relevanz 60
Hype 58
Einschätzung 55
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.