Reflection AI hat Beam vorgestellt, ein offenes Sprachmodell mit 501 Milliarden Parametern, das sich an der Spitze der offenen Modelle messen will. Interessanter als die Zahl ist, wie das Modell entstanden ist: in drei getrennten Phasen, auf gemieteter Hardware, mit eigener Software, die Ausfälle während des Trainings abfängt. Zuerst entstand ein kleiner Prototyp, dann wuchsen die Modelle schrittweise. Was Reflection AI veröffentlicht hat, welche Zahlen genannt werden und wo die Grenzen liegen, steht im Folgenden.
Was Reflection AI mit Beam tatsächlich veröffentlicht
Reflection AI Inc. hat ein offenes Sprachmodell namens Beam vorgestellt, mit 501 Milliarden Parametern. Parameter sind die internen Werte, die ein Modell während des Trainings justiert. Sie bestimmen, wie viel Wissen es aufnehmen kann. Zunächst ist Beam nur über ein Early-Access-Programm zugänglich. Die Gewichte, die Dokumentation und die Werkzeuge zum Feintuning will das Unternehmen noch im selben Monat nachreichen. Erst damit wird aus einer Ankündigung ein Produkt, das man selbst betreiben kann.
Der Rahmen ist groß. Reflection AI wurde vor einigen Monaten mit 25 Milliarden Dollar bewertet. Berichten zufolge schloss das Unternehmen zur selben Zeit einen Vertrag über 6,3 Milliarden Dollar mit SpaceX ab, um Nvidia-GB300-NVL72-Systeme zu mieten. Jede Einheit enthält 72 Grafikkarten. Auf dieser gemieteten Infrastruktur wurde Beam trainiert.
Die stärksten offenen Modelle kamen zuletzt vor allem von chinesischen Anbietern. Nach Angaben des Unternehmens ist Beam das erste offene Modell eines US-Startups, das vergleichbare oder bessere Leistungen zeigt. Darum geht es in der Ankündigung, nicht um die Parameterzahl. Eine Zahl sagt nichts darüber, wie effizient ein Modell arbeitet.
Drei Trainingsphasen vom Prototyp zum 501B-Modell
Der Weg zu Beam begann mit einem kleinen Prototyp. Daraus entwickelte das Team eine Reihe schrittweise größerer und leistungsfähigerer Modelle. Am Ende dieser Kette stand Beam Base, das Fundament des späteren Modells. Wer zuerst klein testet, findet Fehler, bevor sie teuer werden.
Beam Base entstand auf einem Cluster aus 6.144 Grafikkarten. Trainiert wurde mit 23,8 Billionen Tokens – jenen Textbausteinen, aus denen ein Modell seine Muster ableitet. Die Daten stammten aus öffentlichen Webquellen und von kommerziellen Anbietern. Ein großer Teil davon war Quellcode. Für jede Programmiersprache entwickelte das Team eigene Filter, um minderwertige Dateien auszusortieren. Der gesamte Schritt dauerte weniger als vier Wochen.
Danach folgte das Midtraining. In dieser Phase erweiterte das Unternehmen das Kontextfenster des Modells und schärfte seine Fähigkeit zum Schlussfolgern. Ein größeres Kontextfenster heißt: Das Modell erfasst längere Zusammenhänge, ohne den Faden zu verlieren. Ob es ein ganzes Dokument oder nur einen Absatz sinnvoll verarbeitet, hängt daran.
Für die dritte und rechenintensivste Phase spannte Reflection AI 10.000 GB300-Grafikkarten auf und startete 1,3 Milliarden Sandboxes für Reinforcement Learning. Das sind virtuelle Umgebungen, in denen ein Modell neue Fähigkeiten durch Ausprobieren und Belohnung erwirbt. Die Umgebungen von Beam waren auf Codeerzeugung, Websuche und den Betrieb von KI-Agenten zugeschnitten. Diese Phase dauerte nach Angaben des Unternehmens nur vier Wochen.
Warum weniger Hardware nicht automatisch weniger Leistung heißt
Reflection AI verglich Beam mit GLM-5.2, einem offenen Modell mit rund 250 Milliarden Parametern mehr. Das Ergebnis: Beam löst nach Angaben des Unternehmens einige Aufgaben besser und braucht dafür nur ein Drittel bis ein Viertel der Hardware. Zudem nähert sich das Modell der Leistung von Qwen 3.8-Max an, einem System mit über 2 Billionen Parametern. Der Größenunterschied ist erheblich, der Unterschied im Ergebnis deutlich kleiner.
Die Parameterzahl allein ist deshalb kein Maß für Qualität. Entscheidend ist, wie effizient ein Modell seine Kapazität nutzt: welche Daten es sieht, wie sauber sie gefiltert sind, wie präzise die Trainingsphase läuft. Wer Rechenleistung mietet, statt sie zu besitzen, merkt jeden eingesparten Faktor auf der Rechnung.
Während des Trainings traten nach Angaben des Unternehmens 71 Fehler auf. Eine eigens entwickelte Software sorgte dafür, dass diese Ausfälle den Ablauf nicht aufhielten; die mediane Wiederherstellungszeit lag bei acht Minuten. Große Cluster fallen oft minutenlang aus, und jeder Stillstand kostet Geld.
Offene Modelle aus den USA: was sich damit verschiebt
Die leistungsstärksten offenen Sprachmodelle stammten zuletzt überwiegend von chinesischen Anbietern. Qwen 3.8-Max und GLM-5.2 gehören zu dieser Gruppe. Dass nun ein US-Startup mit vergleichbaren Werten auftritt, verändert die Lage an einem konkreten Punkt: Wer ein offenes Modell einsetzen will, hat künftig eine breitere Auswahl. Mehr Auswahl bedeutet mehr Spielraum bei Kosten, Lizenzen und Betriebsmodell.
Für Unternehmen ist das relevant, weil sich offene Modelle selbst hosten lassen. Wer sensible Daten nicht an einen externen Anbieter geben darf, kann ein Modell wie Beam auf eigener Infrastruktur betreiben. Das setzt voraus, dass die Gewichte veröffentlicht werden – bislang stehen sie aus. Erst dann lässt sich beurteilen, was Beam im Alltag leistet.
Auch der Rahmen spielt eine Rolle. Reflection AI, gegründet von Misha Laskin und Ioannis Antonoglou, arbeitet mit einer großen Finanzierung und gemieteter Rechenleistung. Trainingskapazität zu mieten statt zu kaufen senkt die Einstiegshürde. Ob sich das durchsetzt, hängt davon ab, wie schnell andere Anbieter nachziehen.
Wo Beam noch hinterherfährt
Trotz der guten Werte bleiben offene Modelle hinter den sogenannten Frontier-Modellen zurück. Zu dieser Gruppe gehört etwa Claude Fable 5.1 von Anthropic. Wie groß der Abstand ist, beziffert die Ankündigung nicht. Wer heute die beste Antwortqualität braucht, greift weiterhin zu geschlossenen Systemen. Offene Modelle gewinnen an Boden, überholen aber nicht.
Hinzu kommt der Early-Access-Status. Beam ist zunächst nur eingeschränkt nutzbar. Benchmarks zeigen außerdem nur einen Ausschnitt: Sie messen, was die Entwickler gemessen haben. Ob ein Modell im eigenen Projekt trägt, hängt von Datenlage, Aufgabe und Feintuning ab, nicht von einem Punktestand in einer Tabelle.
Ein weiterer Punkt ist die Herkunft der Trainingsdaten. Ein großer Teil stammte aus öffentlichen Webquellen und kommerziellen Anbietern. Über Rechte und Lizenzfragen sagt das zunächst wenig aus. Wer Beam produktiv einsetzt, sollte diese Fragen klären, sobald die Gewichte verfügbar sind. Das gilt für jedes offene Modell, nicht nur für dieses.
Was das für Entwickler und Unternehmen konkret bedeutet
Nach Angaben von Reflection AI löst Beam einige Aufgaben besser als das größere GLM-5.2 und braucht dafür nur ein Drittel bis ein Viertel der Hardware. Unabhängig nachgemessen ist das noch nicht. Das verschiebt die Rechnung. Rechenleistung ist einer der größten Posten beim Betrieb von KI. Wer hier spart, spart dauerhaft, nicht einmalig.
Für dich als Entwickler heißt das: Beobachte die Veröffentlichung der Gewichte. Sobald sie da sind, lohnt ein eigener Test mit realistischen Aufgaben statt mit öffentlichen Benchmarks. Prüfe, wie sich Beam bei deinen Daten schlägt, wie viel Speicher es braucht und ob das Feintuning mit den mitgelieferten Werkzeugen praktikabel ist. Diese drei Fragen beantwortet nur ein eigener Lauf, keine Ankündigung.
Für Unternehmen geht es um die Frage, ob offene Systeme eine Alternative zur gemieteten API sind. Beam ist ein Argument dafür, kein Beweis. Dafür ist das Modell zu jung und zu wenig erprobt. Ob daraus ein brauchbares Werkzeug wird und ob der Effizienzvorsprung hält, wenn andere nachziehen, zeigt sich in den nächsten Wochen.
Quelle: siliconangle.com
