Tim Dettmers und die Open Source Week: Frontier AI auf eigener Hardware

Ein Entwickler von hinten an einem Arbeitsplatz mit mehreren Monitoren in einem dunklen Raum
Deine Reaktion:

Rund 120 von 150 Studierenden hoben die Hand, als Tim Dettmers in einer Vorlesung fragte, wer Angst habe, nach dem Abschluss keinen Job zu finden. Achtzig Prozent eines Hörsaals, in einer einzigen Bewegung. Dettmers leitet ein kleines universitäres Lab. Diese Angst hält er für einen Irrtum, und zwar für einen, der auf einer Annahme beruht: dass die Zukunft der Forschung dem gehört, wer die meisten GPUs hat.

Er erzählt die Szene am Anfang eines langen Blogposts zur Open Source Week seines Labs und baut darin die Gegenposition auf. Sein Argument: Die akademische Forschung steht nicht vor dem Ende, sondern vor einer Renaissance. Nicht trotz begrenzter Mittel, sondern wegen ihnen. Belege liefert das Lab nicht in Prosa, sondern in Code. Wer heute über Open-Source-KI auf eigener Hardware spricht, kommt an dieser Argumentation kaum vorbei — sie dreht die übliche Rangordnung zwischen Rechenzentrum und Universitätsflur um.

Um zu verstehen, warum das mehr ist als eine freundliche Geste, hilft eine Unterscheidung, die der Text selbst nahelegt: die zwischen einem Werkzeug und einer Werkbank. Ein einzelnes Paper ist ein Werkzeug. Nützlich, aber isoliert. Ein Ökosystem ist eine Werkbank, an der jedes neue Stück das vorherige brauchbarer macht. Der ganze Beitrag lässt sich entlang dieser Linie lesen. Dort liegt der Unterschied zwischen Forschung, die sich addiert, und Forschung, die nur nebeneinandersteht.

Warum ein Lab heute ein Ökosystem veröffentlicht statt einzelner Paper

Dettmers beschreibt eine Verschiebung, die im vergangenen Jahr stattgefunden hat und die viele Forschende in ihren Gewohnheiten noch nicht nachvollzogen haben. Mit Agenten werden einzelne Projekte schnell. Arbeit, die früher ein Jahr aus Engineering und Experimenten bestand, dauert Wochen oder Tage. Daraus folgt etwas Unbequemes. Wenn jedes einzelne Projekt leicht wird, hört stückweise Arbeit auf, gute Forschung zu sein. Ein Paper hier, ein Paper dort, jedes in sich geschlossen und jedes mit der stillen Bitte an die Leserschaft, die Teile selbst zusammenzusetzen. Ein Format aus einer Welt, in der jedes Stück noch teuer war.

Die Schwierigkeit ist damit nicht verschwunden, sie hat nur den Ort gewechselt. Ein Paper zu veröffentlichen ist nicht mehr die Hürde. Ein zusammenhängendes Ökosystem zu veröffentlichen ist es. Genau darin sieht Dettmers die Aufgabe, und die Open Source Week ist sein Versuch, sie zu bearbeiten. Sein Lab nutzt dafür die Freiheit, die es an einer Universität gibt und ein kommerzielles Labor nicht hat: die besten Werkzeuge kostenlos für alle bereitzustellen.

Konkret bedeutet das offene Systeme, günstiger laufende lokale Modelle, stärkere lokale KI-Modelle, lokale Systeme, die Frontier-Leistung in tiefer und autonomer Forschung nachbilden, sowie neue Verfahren für domainspezifische Reinforcement-Learning-Umgebungen. Alles davon sitzt an der Schnittstelle von drei Dingen: Inferenz-Frameworks, Agenten-Harnesses und der Verbindung beider zu autonomen Forschungssystemen. Entscheidend ist für den Autor, dass all das einfach zu benutzen ist. Open Source, die nur erfahrene Forschende zum Laufen bringen, sei keine Open Source.

Barrierefreiheit hat nach seiner Darstellung zwei Hälften: die Ressourcen, die man braucht, und das Wissen, das man braucht. Nur eine davon ist durch Hardware festgelegt. Ein paar GPUs oder ein MacBook können reichen. Die Wissensanforderung dagegen ist ein Designproblem. Man löst es, indem man jedes technische Detail wegabstrahiert, über das die Nutzerin nicht nachdenken muss. In diese Abstraktion ist nach eigener Aussage der größte Teil der Arbeit geflossen. Am sichtbarsten wird sie im Agenten-Harness.

450 Token pro Sekunde bei 1,5 Bit pro Gewicht

Das Harness ist der Einstiegspunkt, weil es alles andere benutzbar macht. Man richtet es auf ein Repository (etwa ein Inferenz-Framework mit CUDA-Kernels) und gibt ihm die Anweisung, diese Kernel zu optimieren. Dann geht man weg. Das System arbeitet weiter durch die Phasen, in denen Fortschritt langsam und die Arbeit zäh ist. Es hört nicht auf, bis man zurückkommt. Rückmeldung bekommt es unterwegs keine, also muss es selbst herausfinden, was zu tun ist, wenn etwas unklar ist.

Genau so entstanden die Mac- und Metal-Implementierungen des Frameworks. Ein Kommandosatz ließ den Agenten auf die Kernel los. Zurück kam quantisierte Inferenz eines Qwen-3.6-35B-A3B-Modells mit 450 Token pro Sekunde und brauchbarer Ausgabequalität bei 1,5 Bit pro Gewicht. Zum Vergleich: Ein Modell in halber Genauigkeit braucht sechzehn Bit für jedes Gewicht. Bei 1,5 Bit läuft dasselbe Modell in ungefähr einem Zehntel des Speichers, und schnell genug, dass es sich wie ein lokaler Prozess anfühlt und nicht wie ein entfernter Dienst.

Dann kommt der Punkt, der im Titel des Beitrags steckt. Was passiert, wenn Modelle, die eben noch außer Reichweite waren, auf die Hardware passen, die ohnehin herumsteht? Qwen 3.8 mit 27 Milliarden Parametern galt bisher als das populäre lokale Modell. Das Framework des Labs bringt den größeren Bruder Qwen 3.8 Flash Next mit 125 Milliarden Parametern auf eine einzelne 24-GB-GPU, die Karte in einem gewöhnlichen Desktop-Rechner. Mit AMD Strix, einer NVIDIA DGX Spark oder einem MacBook mit 128 GB Arbeitsspeicher läuft DeepSeek V4.1 mit 550 Milliarden Parametern. Um die Kontextlänge muss man sich nicht kümmern, weil Kompression und Kontextverwaltung automatisch greifen.

Autonome Forschung mit lokalen KI-Agenten: zwei Stunden, vier Ergebnisse

Der Teil, auf den Dettmers selbst am meisten verweist, ist die Kombination dieser Bausteine zu autonomer Forschung. Dabei entstand nach seiner Darstellung eine neue Technik zur Informationsgewinnung mit einer Präzision, die er so noch nicht gesehen hat. Das System schlägt die Deep-Research-Systeme von Frontier-Labs und liefert bessere Ergebnisse als das System von Sakana AI oder Googles ScientistOne. Es läuft vollständig lokal, ohne Internetzugang.

Der Autor beschreibt ein Experiment aus seinem Labor. Er bat den Agenten, im Bereich Bioinformatik ein Problem zu finden, an dem sich arbeiten lohnt, gerade weil er von diesem Feld wenig versteht. Die Kriterien waren eng gefasst: Der Fortschritt musste schnell sein, die Bewertung günstig genug für die vorhandene Hardware, und das Problem musste frisch sein, mit aktiver Forschung aus den letzten vier Wochen. Der Agent kam mit drei Vorschlägen zurück. Das Labor nahm den ersten. Innerhalb von ungefähr zwei Stunden entstand eine neue untere Schranke für heuristische Verfahren, die beste Heuristik der Literatur wurde entwickelt und getestet, man rückte näher an teure, mit KI-Modellen trainierte Verfahren heran, und der Agent fand Probleme in den Datenquellen, auf die sich die gesamte Bewertung dieses Problems stützt. Der Stand der Technik war damit nicht erreicht. Trotzdem: vier Resultate in zwei Stunden, und eines davon stellt die Evaluationsdaten infrage, von denen ein ganzes Feld abhängt.

Das System ist kein Demo-Objekt für Blogposts. Die Studierenden nutzen es täglich. Bevor es im Harness lebte, lief es als Slack-Bot, und der war instabil genug, dass er zeitweise ausfiel. Ein Überwachungssystem für den Ausfall gab es nicht, dafür ein wirksames Ersatzsignal: Mails von Studierenden, dass mit dem Bot etwas nicht stimme und ob man helfen könne.

In der Zusammenarbeit setzte Dettmers es nach Besprechungen ein. Aus der Aufnahme entstanden Forschungsfragen, die diskutierten Ideen wurden gegen die Literatur geprüft und in aussichtsreiche und weniger aussichtsreiche Richtungen sortiert. Anschließend erzeugte das System ein Dokument und schickte es an die Studierenden. Das lief zwei Sitzungen lang. Es war den Beteiligten zu umständlich, weil ein manueller Schritt nötig blieb. Also ließ der Autor es zwei weitere Male weg. Danach fragten die Studierenden von sich aus, ob man das System wieder benutzen könne, weil es ihnen geholfen hatte, ihre eigene Forschung zu ordnen. Das, so schreibt Dettmers, sei die einzige Bewertung eines Forschungswerkzeugs, der er traut: dass Leute danach fragen, nachdem man aufgehört hat, es ihnen zu geben.

CliffCompaction: längere Sitzungen, kleinere Rechnung

Der letzte Baustein ist der am meisten genutzte und am wenigsten besprochene. Die Frage: Wie hält man einen Agenten am Arbeiten, wenn das Gespräch längst zu Ende wäre? Die Antwort des Labs heißt CliffCompaction und ist eine Technik zur automatischen Kompression des laufenden Kontexts. Sie ist seit Monaten im Einsatz, und Dettmers möchte nach eigener Aussage keinen Agenten mehr ohne sie laufen lassen. Man kann sich das wie ein Laborprotokoll vorstellen, das sich selbst auf den aktuellen Stand bringt. Statt jede Beobachtung mitzuschleppen, bleibt festgehalten, was für den nächsten Schritt zählt. Der Agent verliert dabei nicht den Faden.

Laut dem Beitrag ist die Technik deutlich leistungsfähiger als die automatische Kompression in Claude Code oder Codex. Sitzungen laufen damit über Millionen Token, einige im Labor über hundert Millionen. Zugleich sinken die Gesamtkosten um ungefähr fünfzig Prozent. Ein Partner hat sie nach Darstellung des Autors im eigenen Unternehmen eingesetzt und eine Senkung des gesamten KI-Budgets um 45 Prozent gemessen, fast die Hälfte der Ausgaben weg, ohne dass etwas dafür wegfällt. Auf KernelBench erreicht das Verfahren den Stand der Technik und schlägt deutlich komplexere Ansätze wie AlphaEvolve-artige Methoden oder hierarchische Gedächtnissysteme.

Interessant ist, dass beide Seiten des Trade-offs gleichzeitig wandern. Die Sitzung läuft länger, und die Rechnung wird kleiner. Anders formuliert: Der Agent hört auf zu vergessen, was er gerade tut, und man hört auf, für das Vergessen zu bezahlen. Ein Teil der nächsten Kompressionsstufe ist laut Text bereits vorhanden und noch besser.

Daraus fällt auch das effiziente Test-Time-Scaling heraus. Wer die Hälfte der Kosten spart, kann das Gesparte reinvestieren. Statt eines einzelnen Durchlaufs kauft man mehrere zum gleichen Budget. Nach Angaben des Labs ist dies die erste praktische Methode, die mehrere Durchläufe in einen deutlichen Leistungsgewinn bei gleichbleibenden Kosten verwandelt. Für alltägliche Engineering-Arbeit sei sie noch nicht praktikabel, der Sprung dorthin aber nicht schwer. Zusammen mit lokalen Deployments, die häufig unausgelastet sind, ergibt sich daraus die Aussicht, dass jeder viele parallele Agenten auf ein einziges Problem ansetzen kann.

Warum die Angst vor dem Arbeitsmarkt auf einer falschen Annahme beruht

Zurück zu den 120 Händen. Dettmers zählt drei Dinge, die gleichzeitig wirken, und nur eines davon handelt von KI. Erstens der Glaube, KI nehme allen die Arbeit weg. Zweitens ein ungenaues Bild davon, was KI mit Arbeit tatsächlich macht. Drittens Ansteckung: Selbstblockierende Ideen wandern von Person zu Person, und ein Raum voller Menschen, die denselben pessimistischen Satz zehnmal gehört haben, produziert beim elften Mal eine Hand mehr.

Am prüfbarsten ist der zweite Punkt, und dort widerspricht der Autor der naheliegenden Prognose. Vom Beruf, der zuerst verschwinden sollte, ist Softwareentwicklung das beste Beispiel. Die Erwartung war, dass diese Jobs zuerst wegfallen. Die jüngste Entwicklung lief in die andere Richtung. Die Nachfrage nach Softwareentwicklern ist heute höher als je zuvor. Ein guter Entwickler mit guten Agenten baut neue Produkte, hält bestehende Systeme instand und erweitert sie sehr viel effizienter, sodass ein Unternehmen pro ausgegebenem Euro mehr Gegenwert bekommt. Was der Beruf verlangt, hat sich verändert: solide Agentenkenntnisse und häufig eine tiefere Spezialisierung als früher. Den Beruf des Softwareentwicklers in seiner alten Form gibt es kaum noch, doch beides ist erreichbar. Agentenkenntnisse kommen mit der Zeit, und tiefe Spezialisierung, die früher Jahre brauchte, lässt sich mit Agenten schnell aufbauen.

Dazu kommt eine Beobachtung über die Ökonomie des Alltags. Wir leben in einer Wirtschaft inkrementeller Verbesserungen. Das nächste Telefon ist nicht viel besser als das letzte, die Verbesserungen sind real, aber klein und werden jedes Jahr schwerer zu erkennen. Viele Dienste sind auf dieselbe Weise konvergiert. Eine Fahrt mit Lyft oder Uber ist keine grundsätzlich andere Erfahrung als früher und wird es vermutlich nie sein, weil nicht mehr viel zu verändern ist. Man kann dieselbe Sache nur eine begrenzte Zahl von Malen ein wenig besser machen, bevor jemand aufhört, für die nächste Version zu zahlen. An dieser Stelle bricht der vorliegende Text mitten in der Ankündigung ab, dass Fortschritt in zwei Formen kommt. Dieser Gedanke bleibt offen und wird hier nicht ergänzt.

Was das für universitäre KI-Forschung bedeutet

Die These, auf die alles zuläuft, ist einfach: Die akademische Forschung steht vor einer Renaissance, und die spannendste Arbeit des nächsten Jahrzehnts entsteht in Universitätslabors, nicht trotz ihrer begrenzten Mittel, sondern wegen ihnen. Begründet wird das mit der neuen Einheit der Forschung. Wenn einzelne Projekte billig werden, entscheidet nicht mehr die schiere Rechenmenge über Relevanz, sondern die Fähigkeit, zusammenhängende Systeme zu bauen, sie verständlich zu machen und offen zugänglich zu halten. Genau das ist an einer Hochschule strukturell leichter als in einem Unternehmen, dessen Werkzeuge hinter Zugangsbeschränkungen liegen.

Der Beitrag kündigt sechs Teile an: warum ein Lab wie dieses heute Ökosysteme statt Papers veröffentlicht, was in der Open Source Week tatsächlich enthalten ist, warum der Pessimismus falsch ist, was man loslassen und was man festhalten sollte, wie Forschung aussieht, nachdem man losgelassen hat, und warum die Renaissance in der Akademie stattfindet. Ein hoher Anspruch, gemessen an einem Maßstab, den der Autor selbst gesetzt hat: dass die Werkzeuge auch von Menschen benutzt werden können, die keine Spezialisten sind.

Für den Leser heißt das, auf zwei Dinge zu achten statt auf Versionsnummern. Erstens: Läuft das Zeug tatsächlich auf Hardware, die man besitzen kann, und bleibt die Qualität dabei brauchbar? Zweitens: Entsteht daraus ein Werkzeugkasten, in dem ein Teil das nächste trägt, oder wieder nur eine Sammlung eindrucksvoller Einzelstücke? Wenn der Agent über Stunden allein an Kernel-Code arbeitet, der Speicherbedarf auf ein Zehntel fällt und die Rechnung für lange Sitzungen halbiert wird, dann ist das keine Zukunftsmusik, sondern der Zustand eines Labors, das seine Ergebnisse offenlegt. Ob daraus tatsächlich etwas für ganze Fakultäten wird, entscheidet sich nicht in einem Blogpost, sondern daran, ob Studierende die Systeme nach der Open Source Week freiwillig weiterbenutzen, auch wenn niemand sie mehr dazu auffordert.

Quelle: timdettmers.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 48
Relevanz 58
Hype 45
Einschätzung 55
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.