Wie viel Modellintelligenz passt in 5,9 Gigabyte? Das Unternehmen Prism ML hat mit Ternary Bonsai 2 27B eine ziemlich konkrete Antwort gegeben. Das Team entstand aus einer Gruppe von Caltech-Forschern und wird von Khosla Ventures, Cerberus, Google und Samsung unterstützt. Es beschreibt ein 27B-Modell mit ternären Gewichten, das auf Qwen3.8 27B aufbaut. Wer sich mit lokalen KI-Modellen beschäftigt, kennt das Grundproblem: Qualität wächst mit der Parameterzahl, der Speicherbedarf wächst genauso. Hier setzt die Veröffentlichung an. Die Zahlen, die das Team nennt, lohnen einen genauen Blick.
Was Ternary Bonsai 2 27B technisch ausmacht
Entscheidend ist, wie ein einzelnes Gewicht im Speicher steht. In einem konventionellen Modell ist jedes Gewicht eine 16-Bit-Zahl mit vielen Nachkommastellen. Ternary Bonsai 2 27B kennt dagegen nur noch drei Zustände: minus eins, null und plus eins. Rechnet man die Skalierungsfaktoren mit, kommt das Team auf 1,76 effektive Bits pro Gewicht. Drei Zustände allein wären zu grob, deshalb speichert das Modell zusätzlich pro Gruppe von Gewichten einen gemeinsamen Maßstab im FP16-Format. Man kann sich das vorstellen wie eine Landkarte, auf der jede Region ihren eigenen Maßstab mitbringt: Die Zeichnung bleibt grob, die Position stimmt trotzdem. Diese niedrige Bitzahl wird nach Angaben der Entwickler durchgängig über das gesamte Sprachmodell angewendet, nicht nur auf ausgewählte Schichten. Insgesamt ergibt das 5,9 GB für 27 Milliarden Parameter, also mehr als neunmal weniger als die Vollpräzisionsvariante, dazu ein Kontextfenster von 262.000 Token, multimodale Eingaben aus Text und Bild und eine Veröffentlichung unter der Apache-2.0-Lizenz.
Was sich gegenüber dem ersten Bonsai 27B geändert hat
Der Vorgänger erschien nach Angaben des Unternehmens rund zwei Monate vorher und zeigte, dass ein multimodales Modell der 27B-Klasse klein genug komprimiert werden kann, um auf einem lokalen Gerät effizient zu laufen. Bonsai 2 27B verfolgt nun einen anderen Schwerpunkt: nicht mehr der Machbarkeitsnachweis, sondern die Modellqualität und Laufzeitperformance, die für echte lokale Anwendungen gebraucht werden. Konkret nennt das Team drei Änderungen. Erstens ein stärkeres Basismodell, nämlich Qwen3.8 27B. Zweitens eine höhere Beibehaltung der Fähigkeiten gegenüber dem Vollpräzisionsmodell, gestiegen von etwa 95 auf 98,2 Prozent. Drittens bessere Leistungen bei Reasoning, Coding, Vision und langen agentischen Aufgabenketten. Das Deployment-Profil bleibt gleich: kleiner Speicherbedarf, hoher lokaler Durchsatz, bessere Energieeffizienz. Die Verbesserung kommt nicht durch ein größeres Modell zustande, sondern innerhalb desselben Speicherrahmens.
Benchmarkzahlen: wo Fähigkeiten erhalten bleiben
Über Reasoning-, Mathematik-, Coding-, Instruktionsfolge-, Vision- und Tool-Benchmarks hinweg erreicht Ternary Bonsai 2 27B einen Gesamtwert von 83,9 Punkten. Der Vergleichswert für Qwen3.8 27B in voller Präzision liegt bei 85,4, der ältere Qwen3.6 27B kommt auf 83,6 Punkte. Daraus ergibt sich die vom Team genannte Beibehaltung von 98,2 Prozent. In einzelnen Disziplinen sieht das anders aus: Mathematik kommt auf 96,57 gegenüber 97,06, Coding auf 81,58 gegenüber 82,17, agentische Tool-Nutzung auf 77,57 gegenüber 79,74, Vision auf 78,59 gegenüber 81,64 und Wissen plus Reasoning auf 83,95 gegenüber 86,66. Bei der Instruktionsfolge liegt das komprimierte Modell mit 82,66 sogar über dem Vollpräzisionsmodell, das 81,25 erreicht. Aussagekräftiger als der Durchschnitt ist die Verteilung. Coding-Agenten, Tool-Systeme und multimodale Abläufe gelten als besonders empfindlich gegenüber Modellverschlechterung, weil sich kleine Fehler über viele Schritte aufsummieren. Dort bleibt der Verlust nach den vorliegenden Zahlen klein, während er bei Vision und breitem Faktenwissen deutlicher ausfällt.
Durchsatz, Energiebedarf und der Alltag von Coding-Agenten
Auf einer NVIDIA GeForce RTX 5090 erreicht das Modell laut Whitepaper bis zu 143 Token pro Sekunde, auf einem M5 Max sind es 46,8 Token pro Sekunde. Auf einer RTX 4090 verbraucht Ternary Bonsai 2 27B nach diesen Angaben 0,714 Milliwattstunden pro Token und arbeitet damit rund 40 Prozent energieeffizienter als ein 8B-Modell in voller Präzision. Für Coding-Assistenten bedeutet höherer Durchsatz kürzere Schleifen aus Ändern und Testen, also weniger Wartezeit zwischen zwei Gedanken. Für multimodale Agenten zählt, wie schnell Screenshots, Dokumente und Tool-Aufrufe durchlaufen. Und für private, lokale Abläufe entscheidet die Energie pro Token darüber, ob ein Assistent dauerhaft im Hintergrund verfügbar sein kann, ohne ständig die Cloud zu rufen. Der Vergleich mit einem 8B-Modell in voller Präzision ist bemerkenswert: Ein 27B-Modell, das weniger Strom pro Anfrage braucht als ein kleineres, verschiebt die übliche Abwägung zwischen Fähigkeit und Kosten.
Intelligenzdichte und warum Kompression die Architekturdebatte verschiebt
Das Team fasst sein Ergebnis in einer Kennzahl zusammen, die es Intelligenzdichte nennt: nutzbare Fähigkeit pro Gigabyte Speicher. Viele Alternativen mit niedriger Bitzahl werden erst nutzbar, weil sie bei Coding, Vision oder Tool-Nutzung spürbar Fähigkeit aufgeben. Bonsai 2 27B setzt sich nach oben ab: weniger Speicher und trotzdem konkurrenzfähige Werte. Daraus folgt eine Argumentation, die über den lokalen Rechner hinausgeht. Wenn sich ein größeres Modell in dasselbe Speicherbudget quetschen lässt, passen mehr Nutzer auf dieselbe Hardware, sinkt die Energie pro Inferenz und werden hybride Systeme realistischer, in denen lokal läuft, was sensibel oder häufig ist, während seltenere oder schwerere Anfragen gezielt an die Cloud gehen. Die Frage lautet dann nicht mehr nur, wie fähig ein Modell ist, sondern wie viel nützliche Intelligenz sich innerhalb eines vorgegebenen Speicher-, Rechen- und Energiebudgets ausliefern lässt. Das gilt für Rechenzentren wie für den Laptop auf dem Schreibtisch.
Plattformen, Lizenz und die offenen Punkte
Ausgeliefert wird das Modell auf NVIDIA-GPUs über CUDA und auf Apple-Geräten – Mac, iPhone und iPad – über MLX, jeweils mit eigenen Kernen für niedrige Bitzahlen. Die Gewichte stehen ab sofort unter der Apache-2.0-Lizenz bereit, die technischen Details zu Kompression, Evaluation und Benchmarking finden sich im Whitepaper. Das Unternehmen bietet zusätzlich an, Modelle für konkrete Anwendungen anzupassen, vom Nachtraining auf Domänendaten bis zur Optimierung der Inferenz für bestimmte Hardware, und sucht Mitarbeitende für die nächste Modellgeneration. Zwei Einschränkungen gehören dazu. Die Zahlen stammen aus der eigenen Evaluation des Herstellers und ersetzen keinen unabhängigen Nachbau auf der eigenen Hardware. Außerdem bleibt offen, wie sich das Modell über lange Sitzungen verhält, wenn Kontext wächst, Speicher fragmentiert und reale Tool-Ketten mehr Fehler produzieren als ein Benchmark-Skript. Wer heute ein lokales Modell für Coding-Agenten oder dokumentenbasierte Arbeit sucht, hat mit Ternary Bonsai 2 27B einen ernstzunehmenden Kandidaten mit sehr niedriger Einstiegshürde beim Speicher. Der nächste Schritt ist ohnehin einfach: herunterladen, auf dem vorhandenen Gerät laufen lassen und die eigenen Aufgaben damit messen, nicht die Benchmark-Tabelle.
Quelle: prismml.com
