„Current benchmarks substantially understate frontier models‘ ability to solve well-posed physics problems.“ So steht es in einer Studie, die im September 2026 unter der arXiv-Nummer 2609.13009 erschienen ist. Sie stellt die Bewertung von KI-Modellen in der Physik in Frage. Wer heute auf Ranglisten schaut, auf denen Frontier-Modelle in der Physik weit hinten landen, misst womöglich weniger die Denkfähigkeit dieser Systeme als die Mängel der Prüfungen. Der Befund trifft nicht die Modelle, sondern die Prüfungen, auf die sich Forschung und Produktentscheidungen seit Jahren stützen. Ein Blick auf die Mechanik solcher Physik-Benchmarks zeigt, was daran neu ist.
Was Physik-Benchmarks messen, wenn sie nicht Physik messen
Ein Benchmark ist im Kern eine Klausur mit automatischer Korrektur. Es gibt Aufgaben mit verifizierbaren Endantworten, ein hinterlegtes Lösungsblatt, und eine Maschine, die die Antwort des Modells mit diesem Blatt vergleicht. Solange alle drei Teile stimmen, funktioniert das gut. Sobald aber das Lösungsblatt falsch ist oder die Aufgabenstellung mehrere gültige Lesarten zulässt, produziert die Maschine Noten, die nichts über das physikalische Reasoning des Modells aussagen.
Die Autoren um Ali Ansari haben genau dort angesetzt und sechs weit verbreitete Physik-Benchmarks neu untersucht: HLE-Physics, CMT-Benchmark, CritPt, UGPhysics, PRISM-Physics und PHYBench. Beschränkt wurde sich auf rein textbasierte Aufgaben mit eindeutig prüfbarer Endantwort, weil nur dort der Vergleich zwischen Modellantwort und Referenz sinnvoll möglich ist. Anschließend saßen Fachleute aus den jeweiligen Teilgebieten vor den Aufgaben und prüften jede einzelne Bewertung von Hand. Beteiligt waren Professorinnen und Professoren ebenso wie Doktoranden, also Menschen, die das Problem selbst lösen könnten, wenn man ihnen Papier und Stift gäbe.
Die Handprüfung ist der Kern der Arbeit. Sie unterscheidet nicht nur zwischen richtig und falsch, sondern zwischen vier Kategorien: echte Fehler des Modells, Fehler des automatischen Bewerters, falsche Referenzlösungen und Fragen, die mehrdeutig oder unzureichend spezifiziert sind. Das klingt nach Buchführung, ist aber wichtig. Ohne diese Unterscheidung lässt sich nicht sagen, ob ein niedriger Physik-Score auf fehlendes Verständnis oder auf ein kaputtes Messinstrument zurückgeht.
Drei Fehlerquellen, die wie Denkfehler der KI aussehen
Das Ergebnis der Handprüfung ist unbequem für alle, die Benchmark-Zahlen für harte Fakten halten. In den meisten überprüften Fällen, die zunächst als falsche Modellantwort gewertet wurden, lag das Problem nicht beim Modell, sondern beim Benchmark selbst. Die Modelle hatten auf eine Frage geantwortet, die so nicht eindeutig beantwortbar war, oder sie hatten eine physikalisch korrekte Lösung geliefert, die von der hinterlegten Referenz abwich. In beiden Fällen schlug die automatische Korrektur zu, ohne dass damit etwas über wissenschaftliches Reasoning gesagt wäre.
Man kann sich das wie eine Prüfung vorstellen, in der die Musterlösung aus einem älteren Skript stammt und stillschweigend andere Konventionen verwendet als die Aufgabenstellung. Der Prüfling rechnet sauber, verwendet die in der Aufgabe genannten Vorzeichen, und bekommt den Punkt trotzdem nicht. Über hundert solcher Fälle hinweg entsteht der Eindruck, die Kandidaten seien schwach. Genau das verzerrt laut dieser Arbeit die öffentliche Wahrnehmung von KI-Modellen in der Physik.
Die zweite Fehlerquelle ist die Ambiguität. Physikaufgaben aus echten Lehrveranstaltungen enthalten oft stillschweigende Annahmen: welche Näherung gilt, welches Koordinatensystem gemeint ist, ob der Grenzfall eingeschlossen ist. Wer die Vorlesung besucht hat, weiß das. Ein Modell, das nur den Aufgabentext sieht, muss raten. Die dritte Quelle sind schlicht falsche Referenzlösungen, also Aufgaben, bei denen die offizielle Antwort nachweislich nicht stimmt. Dass solche Fälle über Jahre in viel zitierten Benchmarks überleben, sagt viel darüber, wie selten Evaluierungen fachlich nachgeprüft werden.
Was die Korrektur aus den Zahlen macht
Die Autoren haben die fehlerhaften Aufgaben nicht nur markiert, sondern instand gesetzt: falsche Referenzlösungen wurden korrigiert, unklare Fragen repariert oder ausgeschlossen. Danach wurde erneut gemessen. Für GPT-5.6-Sol steigt der Mittelwert über vier Läufe auf HLE-Physics von 47,3 auf 78,7 Prozent. Beim CMT-Benchmark geht es von 61,0 auf 87,2 Prozent nach oben. Bei den 54 CritPt-Aufgaben, die nach der Expertenprüfung übrig blieben, erreicht dasselbe Modell korrigiert 94,4 Prozent Pass@4.
Auch auf den überprüften Teilmengen von UGPhysics, PRISM-Physics und PHYBench steigen die Werte deutlich. Wichtig ist dabei die Formulierung „auf den verbliebenen Teilmengen“: Die korrigierten Scores gelten nur für die Aufgaben, die die Expertenprüfung überstanden haben. Das ist keine nachträgliche Schönung der Gesamtbilanz, sondern eine Messung an einem saubereren Instrument. Der Unterschied zwischen beiden Lesarten ist erheblich, und die Autoren benennen ihn selbst offen.
Die veröffentlichten Zahlen aus dem Artificial Analysis Intelligence Index 2026 und ähnlichen Zusammenstellungen unterschätzen die Fähigkeit aktueller Frontier-Modelle bei wohldefinierten Physikproblemen systematisch. Das heißt nicht, dass die Modelle die Physik beherrschen. Es heißt, dass die bisherige Messlatte zu tief hing, um das noch zu zeigen.
Nahezu Sättigung: Wenn 94 Prozent normal werden, misst der Test kaum noch etwas
Damit kommt ein zweites Problem dazu, das die Autoren Near-Saturation nennen. Wenn ein Modell auf einer geprüften Aufgabenmenge 94 Prozent erreicht, unterscheidet dieser Test kaum noch zwischen guten und sehr guten Systemen. Er ist dann kein Thermometer mehr, sondern ein Lichtschalter: Die Nadel schlägt aus, aber die Feinheiten verschwinden. Für Physik-Benchmarks, die als anspruchsvoll galten, ist das ein bemerkenswerter Zustand.
Die naheliegende Reaktion wäre, einfach schwerere Aufgaben zu schreiben. Genau hier liegt die Falle, die diese Studie sichtbar macht. Schwieriger heißt nicht automatisch besser; es heißt oft nur unklarer. Wer Aufgaben entwirft, die selbst Fachleute nicht eindeutig lösen können, erzeugt wieder jene Mehrdeutigkeit, die schon die alten Benchmarks verzerrt hat. Ein schwieriger Benchmark ohne Expertenvalidierung produziert am Ende dieselbe Art von Rauschen, nur mit niedrigeren Zahlen.
Die Autoren fordern deshalb aufwändigere, von Fachleuten geprüfte Evaluierungen. Das ist teuer und langsam, und es lässt sich nicht nebenbei automatisieren. Aber es ist der einzige Weg, auf dem ein Benchmark noch etwas bedeutet. Die Alternative wäre eine Landschaft, in der alle Modelle auf allen Listen irgendwann bei fast 100 Prozent stehen und niemand daraus noch etwas ableiten kann.
Was das für den Umgang mit KI-Modellen in der Forschung heißt
Für dich heißt das zunächst: Sei misstrauisch gegenüber einzelnen Benchmark-Zahlen, besonders wenn sie als Beleg für grundsätzliche Unfähigkeit dienen. Die Aussage „Modell X scheitert an Fortgeschrittener Physik“ ist nur so belastbar wie die Aufgaben, auf denen sie beruht. Das gilt in beide Richtungen, denn auch ein auffällig hoher Score sagt wenig, wenn die Aufgaben schlecht gestellt waren.
Zweitens zeigt die Arbeit, warum Expertenbewertung in der Evaluierung von KI-Modellen kein Luxus ist. Automatische Auswertung skaliert hervorragend, aber sie kann nicht erkennen, ob eine Antwort physikalisch richtig ist und nur anders aussieht als die Musterlösung. Dafür braucht es Menschen mit Fachwissen, die bereit sind, hunderte Einzelfälle durchzusehen. Diese Arbeit hat genau das getan, und allein der Aufwand erklärt, warum es so lange niemand flächendeckend gemacht hat.
Drittens verschiebt sich die relevante Frage. Nicht mehr „Wie viele Physikaufgaben löst ein Modell?“ steht im Zentrum, sondern „Wie gut sind die Aufgaben, an denen wir es messen?“. Solange die zweite Frage offen ist, bleibt die erste eine Zahl ohne Aussage. Das betrifft jede Disziplin, in der KI-Modelle gemessen werden, nicht nur die Physik.
Quelle: arxiv.org
