Warum beschleunigt KI nur die halbe Wissenschaft? Wer die Debatte der letzten Monate verfolgt, stößt auf ein Muster. Ideen, Literaturrecherche und Simulationen werden von Quartal zu Quartal günstiger. Herstellen, Messen und die Bestätigung durch ein zweites Labor stehen ungefähr dort, wo sie vor zehn Jahren standen. Meg McNulty kommt in einem ausführlichen Essay in ihrem Newsletter CipherTalk zu dem Schluss: Wie stark KI die Forschung beschleunigt, hängt weniger an der Qualität der Modelle als am Tempo der Überprüfung.
Man kann sich das als Trichter vorstellen: oben ein immer breiterer Zulauf, unten ein Auslass, der kaum mitwächst. Der Zulauf steht für das Erzeugen von Hypothesen, der Auslass für das Prüfen. McNulty hält diese Lücke für die eigentliche Engstelle und ihre Schließung für eines der am meisten unterschätzten Infrastrukturprobleme des kommenden Jahrzehnts. Im Folgenden geht es darum, woran das liegt, was heute schon funktioniert und was fehlt.
Verifikationselastizität und Amdahls Gesetz: zwei Maße für dasselbe Problem
McNulty schlägt vor, Forschungsfelder nach ihrer Verifikationselastizität zu sortieren. Die Frage lautet: Wie viel zusätzliche Prüfung lässt sich einkaufen, wenn Rechenleistung billiger wird? Software und formale Mathematik stehen ganz oben, weil sich ein Test dort millionenfach parallel ausführen lässt und in Sekunden antwortet. Simulationslastige Felder wie Strömungsmechanik, Teile der Chemie und der Chipentwurf liegen ebenfalls hoch, solange der Simulator gegen reale Messungen validiert ist. Bei Nasschemie, Biologie und Materialforschung fällt der Wert steil ab. Jede Prüfung verlangt dort ein physisches Ereignis.
Am unteren Ende stehen klinische Studien und langlaufende Forschung. Alle Rechenleistung der Welt hilft dort nicht weiter, weil die Zielgröße selbst Zeit braucht: Kein GPU-Cluster lässt einen Fünf-Jahres-Endpunkt früher eintreten. McNulty weist darauf hin, dass KI sich keine Daten herbeidenken kann, die niemand erhoben hat. Der Satz ist unspektakulär, aber er trifft den Kern.
Zur Einordnung zieht der Text Amdahls Gesetz heran, das aus der Parallelisierung von Rechnern stammt. Besteht ein Anteil f der Gesamtzeit eines Projekts aus Benchwork, ist die maximale Beschleunigung auf 1/f begrenzt — selbst wenn alles andere unendlich schnell würde. Bei achtzig Prozent Laborzeit liegt die Obergrenze bei 1,25. Man kann die Hypothesenproduktion verhundertfachen und gewinnt trotzdem nur ein Viertel. Billige Intelligenz lässt den Wert belastbarer Evidenz deshalb eher steigen als sinken.
Mathematik und Code als Ausnahme: Wenn Prüfen fast nichts kostet
In formaler Mathematik und im Programmieren existiert seit einiger Zeit genau die Rückkopplung, die anderswo fehlt. AlphaEvolve, ein Agent von DeepMind zur Algorithmenfindung, übergibt jedes geschriebene Programm an einen automatischen Bewerter. Der führt es aus, bewertet es, und die Suche konzentriert sich auf die Überlebenden. Dieser Kreislauf brachte eine Scheduling-Heuristik hervor, die rund 0,7 Prozent der weltweiten Rechenkapazität von Google einspart. Der Prüfschritt ist hier kein Kostenfaktor, sondern der Motor.
Der Dienst AXLE von Axiom macht dasselbe für die Mathematik. Er nimmt einen in Lean geschriebenen Beweis entgegen — Lean ist Software, die einen Beweis Zeile für Zeile prüft — und liefert ein Ja oder Nein zurück. Nach McNultys Angaben hat der Dienst mehr als 500 Millionen Anfragen bearbeitet, darunter die Läufe, mit denen AxiomProver alle zwölf Aufgaben des Putnam-Wettbewerbs 2025 löste, des härtesten Mathematikwettbewerbs für Studierende in Nordamerika. Lean für maschinell prüfbare Beweise ist damit kein Forschungsprojekt mehr, sondern laufender Betrieb.
Die von OpenAI behauptete Lösung des Navier-Stokes-Problems der Millennium-Preise arbeitete laut dem Essay mit rund 10.000 koordinierten Agenten, etwa 130 Milliarden Ausgabe-Tokens und 88 Stunden bis zum Ergebnis, plus 17 Stunden Modellzeit, um den Beweis in Lean prüfbar zu schreiben. Die Urheberschaft ist umstritten: Buckmaster und Alpöge veröffentlichten rund zehn Tage früher ein Ergebnis, und Buckmaster wirft OpenAI vor, auf seine privaten Codex-Sitzungen zurückgegriffen zu haben. Das Unternehmen bestreitet das.
Selbst im freundlichsten Fall hat die Prüfung Ränder. Lean bestätigt, dass der Beweis aus der formalen Aussage folgt. Ob die formale Aussage das Problem trifft, das jemand gestellt hat, bleibt ein menschliches Urteil. Das Clay-Institut verlangt zusätzlich eine Publikation und zwei Jahre Prüfung, bevor überhaupt ein Preis in Frage kommt. Jede Evaluation, jeder Benchmark und jeder Simulator teilt diese Schwäche: Jeder kann nur bestätigen, was jemand zuvor zu spezifizieren gedacht hat. Je weiter ein Feld von der formalen Mathematik entfernt liegt, desto größer der blinde Fleck.
Anthropic, GNoME und A-Lab: Die Suche schrumpft, das Messen nicht
Im vergangenen Monat richtete Anthropic nach McNultys Angaben rund 950 Claude-Agenten auf öffentliche DNA-Daten und ließ sie 21 Stunden lang nach ungewöhnlichen Reverse-Transkriptasen suchen, also nach Enzymen, die RNA in DNA umschreiben. Die Agenten sichteten mehr als 200.000 Kandidaten, markierten rund 3.500 Systeme und lieferten 20 ausformulierte Berichte ab. Einer beschreibt ein bislang unbekanntes System in Bakteriophagen-DNA, aufgebaut um ein bereits bekanntes Enzym, das neben einem Partnergen und einer Wiederholungssequenz sitzt, die niemand damit in Verbindung gebracht hatte. Die Anordnung erinnert entfernt an CRISPR.
Was das System tatsächlich tut, ist damit nicht geklärt. Das herauszufinden bedeutet Monate menschlicher Laborarbeit, und die Wissenschaftler bei Anthropic sitzen laut McNulty noch daran. Der Suchlauf war in Stunden erledigt, die Bedeutung des Fundes nicht.
Die Materialforschung zeigt dasselbe Muster in größerem Maßstab. GNoME von DeepMind sagte 2,2 Millionen Kristallstrukturen voraus, und Berkeleys autonomes A-Lab meldete in Nature Dutzende Synthesen. Unabhängige Kristallographen griffen anschließend einige Strukturzuordnungen und Neuheitsansprüche an. Eine Korrektur aus dem Jahr 2026 bestätigte 36 von 40 gemeldeten Erfolgen, stufte vier als nicht schlüssig ein und engte die Neuheitsaussagen ein. Die Roboter konnten Materialien schnell herstellen. Die Messungen mit ausreichender Sicherheit zu interpretieren, erwies sich als schwieriger.
Beide Geschichten haben dieselbe Form. Die Suche kollabiert auf Stunden oder Tage, alles danach bleibt in physischem und menschlichem Tempo. Bessere Modelle reißen diese Lücke nicht zu, sie weiten sie: Ein klügeres Modell heizt keinen Ofen schneller auf und lässt eine Zelle nicht früher teilen.
AlphaFold, Surrogate und drei Infrastrukturen, die zusammen wachsen müssen
Ein erster Ausweg besteht darin, einen Teil der Prüfung in Software zu verlegen. AlphaFold ist der bekannteste Fall. Trainiert auf den rund 100.000 einzigartigen Proteinstrukturen, die Menschen experimentell bestimmt hatten, sagt es Strukturen für Sequenzen voraus, die niemand kristallisiert hat — oft genau genug, um Fragen zu beantworten, für die früher Kristallographie nötig war. In unter einer Stunde statt in den Jahren, die eine Promotion für eine einzige Struktur braucht. Gelernte interatomare Potenziale, digitale Zwillinge von Fabriken und Reaktoren sowie Surrogat-Endpunkte in der Medizin versuchen denselben Zug.
Solche Surrogate hängen an drei Infrastrukturen, die gemeinsam wachsen müssen. Erstens Rechenleistung für Forschung, um das Surrogat zu trainieren und über riesige Kandidatenräume laufen zu lassen. Zweitens hochwertige experimentelle Daten als Trainingsgrundlage. AlphaFold existiert, weil jahrzehntelang Strukturen in die Protein Data Bank eingetragen wurden; die meisten Felder haben nichts Vergleichbares. Drittens Validierungsmessungen, die zeigen, wo dem Surrogat zu trauen ist und wo nicht.
Die Rückkopplung darin wird häufig übersehen. Bessere Surrogate senken die Zahl der nötigen physischen Experimente, sind aber selbst aus physischen Experimenten gebaut. Labore mit sauberen, gut dokumentierten Daten werden damit zu Zulieferern der Modelle, die später einen Teil ihrer Arbeit übernehmen. Wer massiv Rechenleistung aufbaut, ohne passende Daten- und Validierungskapazität, bekommt sehr schnelle Modelle, die sich über die physische Welt sehr sicher irren.
Verwaiste Hypothesen und die Geografie der Testkapazität
Für alles, was Software nicht klären kann, gilt eine grobe Buchführung, die McNulty als V mal p formuliert. V steht für die Zahl der Tests, die man tatsächlich fahren kann, p für die Wahrscheinlichkeit, dass eine getestete Idee richtig ist. KI flutet den oberen Teil des Trichters, was V nicht verändert. Sie hilft nur, wenn bessere Auswahl p hebt — und die meisten KI-generierten Kandidaten sind falsch oder abgeleitet. Die wertvollsten wissenschaftlichen Agenten werden jene sein, die das Experiment auswählen, das am ehesten verändert, was wir glauben. Darauf sind heutige Modelle kaum trainiert.
Der zweite Ausweg ist die Erhöhung von V. Eine Materialdoktorandin kann heute mit offenen Modellen und einer bescheidenen Clusterzuteilung in einer Woche Hunderttausende Kandidaten für Batterieverbindungen durchmustern und mit drei vielversprechenden herauskommen. Ein Zwei-Personen-Startup kann Proteine auf gemieteten GPUs entwerfen. Was beide kaum können, ist herausfinden, ob sie recht haben. McNulty nennt diese Fälle verwaiste Hypothesen: Manche verdienen ihre Verwaistheit, weil billige Ideen nicht automatisch gute sind, aber die brauchbaren stecken dazwischen, und es gibt derzeit keinen bezahlbaren Weg, sie herauszusortieren.
Die experimentelle Kapazität ist auf wenige Länder und Institutionen konzentriert. Die drei Batteriekandidaten derselben Doktorandin sterben also weit wahrscheinlicher ungetestet, wenn sie in Lagos arbeitet statt in Boston. Günstigere physische Werkzeuge könnten das verschieben: Tischgeräte für Tausende statt Millionen, 3D-gedruckte Reaktoren, Mikrofluidik, quelloffene Laborroboter und nach Experiment abgerechnete Cloud-Labore. McNulty vergleicht das mit dem Personal Computer, der Datenverarbeitung von einer Institution in ein Werkzeug verwandelte.
Heute entscheiden Laborbudgets darüber, welche Fragen überhaupt zu Experimenten werden, und dieser Filter wird teurer. Moore’s Law am Leben zu halten, kostet inzwischen mehr als das Achtzehnfache des Forschungseinsatzes der frühen siebziger Jahre, und Ökonomen sehen denselben Rückgang der Forschungsproduktivität quer durch die Disziplinen. Zugleich kommen disruptive Arbeiten überdurchschnittlich oft von kleinen Teams, und genau die können sich Tests am wenigsten leisten. Sinkende Testkosten greifen beide Probleme gleichzeitig an. Ob das gelingt, berührt allerdings auch biologische Sicherheitsfragen; Zugangskontrollen gehören deshalb von Anfang an dazu, nicht nachträglich.
Cloud-Labore, IGoR und die fehlende Vertrauensschicht
Einige Bausteine existieren bereits. OpenAI verband GPT-5 mit dem Cloud-Labor von Ginkgo Bioworks für zellfreie Proteinsynthese; über sechs Runden und 36.000 Reaktionsbedingungen senkte das System die Kosten für ein Referenzprotein um rund 40 Prozent. Jeder Entwurf passierte strenge programmatische Prüfungen, bevor er einen Roboter erreichte, weil ein plausibel lesbares Protokoll physisch unmöglich sein kann. Die Kampagne dauerte sechs Monate, und die Reaktionen gaben das Tempo vor.
IGoR, ein Programm der US-Behörde ARPA-H, finanziert eine Version davon für die Medizin: KI erkennt eine Lücke im Wissen, schreibt das Experiment und schickt es an ein qualifiziertes Labor, das es ausführen kann. McNulty malt sich das für jedes Feld aus. Ein Agent stößt auf eine Frage, die nur eine Messung klären kann, findet ein Labor, das sie erledigen kann, und bekommt die Daten zurück — mit Wiederholung durch ein zweites Labor, wenn das Ergebnis wichtig ist.
Die schwierige Ingenieursarbeit liegt in der Vertrauensschicht. Eine Pipette kann das richtige Volumen protokollieren und das falsche abgeben, Reagenzienchargen unterscheiden sich auf undokumentierte Weise, und ein Ergebnis ohne lückenlose Nachverfolgung ist womöglich wertlos, selbst wenn jedes Instrument korrekt gearbeitet hat. Cloud-Labore wie Emerald und geschlossene Kreisläufe wie der von Ginkgo lösen Teile davon innerhalb der eigenen Wände. McNulty hat aber nach eigener Aussage nichts gefunden, was über viele Einrichtungen und Experimenttypen hinweg funktioniert.
Wie ein solches Netz aussehen müsste, skizziert McNulty in vier Punkten: eine einheitliche Art, ein Experiment aufzuschreiben, damit dieselbe Anfrage in jedem qualifizierten Labor laufen kann wie derselbe Code in jeder Cloud; maschinenlesbare Kalibrier- und Herkunftsdaten, damit jedes Ergebnis mit dem Zustand des Instruments, der Geschichte der Probe und einer Unsicherheitsangabe ankommt; veröffentlichte Preise und Wartezeiten, damit sich ein Test budgetieren lässt wie Rechenzeit; und für wichtige Ergebnisse standardmäßig eine Wiederholung an einem unabhängigen Standort. Als erste Kunden sieht sie öffentliche Geldgeber, so wie NASA-Aufträge die kommerzielle Raumfahrt getragen haben, bevor private Nachfrage aufkam. Und weil auch ein autonomer Agent Experimente einreichen kann, müssen Zugangskontrollen für gefährliche Biologie und Chemie in der physischen Infrastruktur selbst verankert sein; das Urteilsvermögen eines Modells reicht als Barriere nicht.
Die Grenzen benennt sie ebenfalls. Manche Experimente brauchen schlicht Zeit: Korrosion lässt sich beschleunigen, manche Nebenwirkungen lassen sich früher sichtbar machen, aber solche Abkürzungen erfassen nicht immer, was über Monate oder Jahre tatsächlich passiert. Experimente an der Forschungsfront brauchen oft Instrumente, die es noch nicht gibt – LIGO und die National Ignition Facility waren wichtig, weil sie messen konnten, was nichts anderes messen konnte. Und ein standardisiertes Netz kann einen systematischen Fehler über Tausende Ergebnisse verbreiten. Als Ziel für das nächste Jahrzehnt nennt McNulty, eine belastbare Antwort auf einen breiten Teil experimenteller Fragen in etwa einer Woche zu bekommen, für rund tausend Dollar, für jeden qualifizierten Forschenden an jedem Ort.
McNulty plädiert nicht dafür, weniger Rechenleistung zu bauen. Jeder Abschnitt ihres Arguments setzt mehr davon voraus. Was sie fordert, ist ein zweiter Ausbau neben den Rechenzentren: ein Netz von Laboren, günstigeres Testgerät und eine gemeinsame Schicht für Nachvollziehbarkeit, damit eine Hypothese nicht daran scheitert, dass niemand sie messen kann. Das Labornetzwerk kommt zu den Rechenzentren hinzu, ersetzt sie nicht.
Wenn Intelligenz billig wird, steigt der Wert von Evidenz. Der Engpass verschiebt sich von der Idee zum Beweis. Ob KI die Wissenschaft beschleunigt, hängt deshalb nicht an der nächsten Modellgeneration, sondern daran, wie schnell sich das Prüfen skalieren lässt. Ohne Labore, Testgeräte und eine gemeinsame Schicht für Nachvollziehbarkeit bleibt die zweite Hälfte der Forschung stehen, wo sie ist.
Quelle: ciphertalk.substack.com
