Ein neues Frontier-Modell gilt als Erfolg, wenn es jede Bestenliste anführt und den Preis nach oben schraubt. Grok 4.7 von SpaceXAI macht es anders: Der Token-Preis bleibt gleich, und der Anbieter räumt selbst ein, dass die Führung nicht überall gilt. Kein Alleskönner also, sondern ein Modell mit klar umrissenem Profil.
Entscheidend ist nicht, wer die ersten hundert Meter am schnellsten läuft, sondern wer über Stunden konzentriert bleibt. Bei Grok 4.7 stehen drei Dinge im Mittelpunkt: Ausdauer, Selbstkontrolle und der Umgang mit langem Kontext. Wer sich mit grok 4.7 für coding und knowledge work beschäftigt, sollte deshalb nicht nach dem einen großen Sprung suchen, sondern nach dem Verhalten auf langen Strecken.
Ausdauer statt Sprint: die Unterschiede zwischen Grok 4.7 und Grok 4.6
Grok 4.7 läuft auf einem neuen und größeren Basismodell als Grok 4.6, das nach Angaben von SpaceXAI mit einem längeren Reinforcement-Learning-Zyklus trainiert wurde. Die Aufgabenmischung wurde härter gewichtet, hin zu Arbeiten, die viele Stunden dauern können. Trainiert wird also nicht auf schnelle Einzelschritte, sondern auf Durchhaltevermögen.
Daraus ergeben sich die Eigenschaften, die der Anbieter nennt. Das Modell soll bei schwierigen Aufgaben länger dranbleiben, seine eigene Ausgabe sorgfältiger prüfen und mit ausgedehntem Kontext umgehen. Zusätzlich wurde Grok 4.7 nativ auf dem Grok-Bot-Harness trainiert, was auf konversationelle Aufgaben und allgemeine Wissensarbeit zielt.
Verfügbar ist das Modell nicht nur im eigenen Haus. Der Zugang reicht von Cursor über Grok Build und die Grok API bis zu Coding-Harnessen Dritter, Model-Routern und Cloud-Plattformen. Wer heute ki-modelle für programmierung auswählt, entscheidet also zunehmend innerhalb bestehender Werkzeugketten. Das senkt die Hürde, macht die konkreten Zahlen aber wichtiger.
Grok 4.7 Benchmarks und Testergebnisse im Detail
Die veröffentlichten Werte zeigen Fortschritte gegenüber Grok 4.6, aber keine gleichmäßigen. Auf CursorBench 4.0 kommt Grok 4.7 auf 46,3 Prozent und liegt damit über den 40,4 Prozent des Vorgängers. Auf DeepSWE v1.1 erreicht es 71,0 Prozent, wobei dieser Wert unter der Einstellung mit hohem Aufwand erzielt wurde. Die Zahl ist nicht ohne ihre Konfiguration zu lesen.
Weitere Ergebnisse: 64,0 Prozent auf EEBench, 1.657 Punkte auf AA Briefcase v1.1, 38,0 Prozent auf Terminal-Bench 4.0 und 19,6 Prozent im Harvey Legal Agent Benchmark. Zusammen mit den GDPval-Resultaten deuten vor allem die Briefcase-Werte auf stärkere Dokumenten- und Präsentationsarbeit in typischen Berufsfeldern hin. Genannt werden Juristinnen, Pflegekräfte und Finanzanalysten.
Die Liste ist schief. Ein großer Teil der Benchmarks stammt aus dem Umfeld Software-Engineering, Terminal und Agentenaufgaben. Das Modell ist dort am stärksten, wo Arbeit schrittweise abgearbeitet und zwischendurch überprüft wird. Wer einen grok 4.7 vs grok 4.6 unterschiede sucht, findet ihn weniger in der Breite des Wissens als in der Fähigkeit, eine Aufgabe zu Ende zu bringen.
Grok 4.7 Preise pro Million Tokens und die schnelle Variante
Bei den grok 4.7 preise pro million tokens bleibt SpaceXAI auf der Linie des Vorgängers: 2 Dollar für eine Million Eingabe-Tokens und 6 Dollar für eine Million Ausgabe-Tokens. Damit ist das Modell günstiger als andere Frontier-Systeme, ohne dass die Preisliste nach oben korrigiert wurde. Hinzu kommt eine Fast-Variante, die die doppelte Ausgabegeschwindigkeit zum doppelten Preis bietet.
Ein Sonderangebot ist das nicht. Lange Aufgaben bedeuten viele Ausgabe-Tokens, und dort liegt der teurere Teil der Rechnung. Ein Modell, das eine Stunde länger an einem Problem arbeitet, kann billiger pro Token sein und trotzdem teurer pro erledigter Aufgabe. In Grok Build lässt sich das Modell kostenlos ausprobieren, was den Einstieg erleichtert, aber nicht die spätere Kalkulation ersetzt.
Für Teams, die mehrere Anbieter parallel testen, ändert sich damit der Maßstab. Der Frontier-Modelle-Vergleich findet nicht mehr nur auf der Benchmark-Tabelle statt, sondern auf der Rechnung hinter dem Projekt. Wer ohnehin mehrere Harnesses betreibt, kann austauschen, was am Ende am wenigsten Umweg kostet.
Grok 4.7 Sicherheit und Jailbreak-Resistenz
Neben den Benchmarks geht es um Absicherung. SpaceXAI spricht von einem vollständig neuen Safeguard-Stack und nennt Grok 4.7 sein bislang stärkstes Modell bei Verweigerung und Widerstand gegen Jailbreaks. Auf dem Biosicherheits-Benchmark von LatchBio werden 62,4 Prozent erreicht, und auf HackerBench v0.3 ließ das Modell nur 3,3 Prozent riskanter Dual-Use-Prompts durch.
Interessanter ist der zweite Teil dieser Zahl. Dem Anbieter zufolge lehnt Grok 4.7 legitime Sicherheitsarbeit nur selten ab – ein Problem, das viele gehärtete Modelle plagt und das in der Praxis mehr stört als die gelegentliche Fehlverweigerung in der Demo. Ausgewählte Cybersicherheitspartner erhalten zudem einen zugangsbeschränkten Einblick in die Red-Team-Fähigkeiten für Verteidigungsforschung.
Solche Angaben sind mit Vorsicht zu lesen, weil sie vom Anbieter selbst stammen und die Testverfahren nicht offenliegen. Sie zeigen aber, wohin die Argumentation zielt: Sicherheit wird hier nicht als Anhang behandelt, sondern als Produktversprechen. Bei einem Modell, das über Stunden eigenständig an Aufgaben arbeitet, ist das keine Nebensache.
Wo der Vorsprung endet: HealthBench und die Grenzen der Zahlen
Nicht überall liegt Grok 4.7 vorn. Mit 56,7 Prozent auf HealthBench Professional bleibt es hinter GPT-5.6 Sol Max und Fable 5.1 Max zurück. Der Anbieter benennt diese Lücke selbst, was den Rest der Zahlen glaubwürdiger macht. Ein Modell kann bei Software-Aufgaben führen und bei medizinischen Fragen dennoch Zweiter sein.
Frontier-Modelle unterscheiden sich heute weniger in ihrer allgemeinen Qualität als in ihrer Form: Wo das eine breit antwortet, hält das andere länger durch. Wer diese Unterschiede ignoriert, kauft am Ende das Modell mit dem besten Marketing und nicht das mit dem passenden Profil.
Hinzu kommt die Frage der Übertragbarkeit. Benchmark-Ergebnisse entstehen in einem bestimmten Harness, mit bestimmten Einstellungen und oft mit erhöhtem Rechenaufwand. In der eigenen Umgebung, mit eigenen Werkzeugen und eigenen Aufgaben, verschieben sich diese Werte regelmäßig. Ein Testlauf mit echten Aufgaben aus dem eigenen Repository sagt mehr als jede Fremdtabelle.
Was das konkret für Coding- und Knowledge-Teams bedeutet
Für SpaceXAI hat die Veröffentlichung eine doppelte Funktion. Einerseits bindet Grok 4.7 die Modelllinie enger an die eigenen Coding-Produkte, andererseits öffnet sie den Zugang über externe Entwicklerwerkzeuge und Infrastrukturen. Die Kombination aus längerer Aufgabenausführung, Selbstprüfung, wettbewerbsfähigen Token-Preisen und engeren Schutzmechanismen richtet sich an Teams, die derzeit unter mehreren Kandidaten wählen müssen.
Wer ein Modell für lange, mehrstufige Arbeit sucht, sollte Grok 4.7 in die engere Auswahl nehmen und dabei zwei Dinge messen, die in keiner Benchmark stehen. Erstens die Token-Menge, die eine Aufgabe tatsächlich verbraucht, denn Ausdauer kostet Ausgabe-Tokens. Zweitens die Zahl der Eingriffe, die ein Mensch noch leisten muss, bis das Ergebnis brauchbar ist.
Ein Modell, das lange Strecken durchhält, zwischendurch nachprüft und bezahlbar bleibt, ist kein spektakulärer Sprung. Ob Grok 4.7 im Alltag hält, was die Zahlen versprechen, zeigt sich nicht in den ersten Testläufen, sondern in der täglichen Arbeit.
Quelle: testingcatalog.com
