Aleph Alpha Kolibri: Offenes Modell mit 1M-Kontext für souveräne KI

Luftaufnahme eines Rechenzentrums-Campus bei Nacht mit Kuehlanlagen und Lichtspuren
Deine Reaktion:

Aleph Alpha hat ein neues Sprachmodell veröffentlicht: Kolibri. Die Heidelberger Firma gibt die vollständigen Gewichte zum freien Download heraus. Kolibri ist auf Englisch und Deutsch ausgelegt und für souveräne, geschäftskritische Aufgaben in Behörden und regulierten Branchen gedacht. Wer das Modell braucht, lädt es von Hugging Face herunter, lizenziert unter Apache 2.0, und betreibt es in der eigenen Umgebung.

Damit besetzt ein Anbieter die Nische der Modelle, die nicht zwingend in eine fremde Cloud wandern müssen – ein Thema, das auch Moonshot AI mit Kimi K3 besetzen will. Kolibri baut auf dem früheren Kolibri Origin auf und entstand in der automatisierten Model Factory des Unternehmens. Die spannendere Frage ist deshalb nicht, ob das Modell in Benchmarks mithält, sondern ob es die Bedingungen erfüllt, unter denen Behörden und Industriekunden ein Modell überhaupt produktiv einsetzen dürfen.

384 Experten, sechs pro Anfrage: Kolibris Mixture-of-Experts-Architektur

Ein brauchbares Bild für dieses Open-Weight-Modell ist eine große Fachkanzlei. Hunderte Spezialisten sitzen im Haus, für einen einzelnen Fall werden nur wenige hinzugezogen. Genau das beschreibt Mixture-of-Experts. Kolibri hält 78,1 Milliarden Parameter im Reservoir, aktiviert pro Token aber nur 3,46 Milliarden davon. Von insgesamt 384 Experten werden jeweils sechs aktiv.

Der Vorteil: Die Wissensbreite eines sehr großen Modells trifft auf die Rechenkosten eines deutlich kleineren. Daran entscheidet sich in der Praxis, ob ein Modell wirtschaftlich betreibbar ist. Wer eine Maschine mit 78 Milliarden aktiven Parametern durchgehend rechnen lässt, bezahlt das mit Strom, Kühlung und Hardware. Rechnerisch aktiviert Kolibri pro Token gut ein Zwanzigstel seiner Parameter.

Auch die Aufmerksamkeitsmechanik folgt diesem Sparsamkeitsgedanken. In zehn von fünfzig Schichten rechnet das Modell mit voller Aufmerksamkeit über den gesamten Kontext, in den übrigen vierzig arbeitet es mit einem gleitenden Fenster von 512 Token. Dieses Sliding Window begrenzt, wie viele Beziehungen zwischen weit auseinanderliegenden Textstellen gleichzeitig verfolgt werden. Ein bewusster Kompromiss: volle Sicht dort, wo sie am meisten bringt, günstige Nähe überall sonst.

Eine Million Token Kontext: ganze Aktenberge in einem Durchgang

Im Training wurde Kolibri bis auf 256.000 Token Kontext adaptiert. Ausgeliefert wird das Modell jedoch mit Einstellungen, die den Betrieb bei 1.048.576 Token erlauben. Die Modellkarte auf Hugging Face empfiehlt allerdings selbst, für effizienten Betrieb und komplexe Aufgaben höchstens 262.144 Token zu nutzen. Ein Token ist grob ein Wortteil, ein deutsches Kompositum zerfällt oft in mehrere. Eine Million Token entspricht damit in etwa einer mittelgroßen Aktenlandschaft, mehreren Gesetzbüchern oder einer umfangreichen Codebasis.

Für die Praxis ist das der Unterschied zwischen Stückwerk und Zusammenhang. Statt Dokumente häppchenweise in ein Modell zu werfen und die Ergebnisse anschließend mühsam zusammenzusetzen, lässt sich ein Vorgang in einem Durchgang bearbeiten. Kolibri kann damit Querverweise sehen, die bei kleinen Kontextfenstern verloren gehen.

Zwei Dinge sollte man trotzdem auseinanderhalten. Ein großes Kontextfenster ist kein perfektes Gedächtnis. Die Qualität der Verarbeitung nimmt über die Länge typischerweise ab, und die Rechenkosten steigen überproportional. Die maximale Länge ist eine Obergrenze, kein Versprechen – das sieht auch der Hersteller so, wenn er ein Viertel davon als sinnvolle Betriebsgröße nennt. Wer Kolibri einsetzt, sollte für den eigenen Anwendungsfall prüfen, bis zu welcher Textlänge die Antworten noch belastbar bleiben.

Deutsch als gleichwertige Sprache: 21,3 Prozent der Vortrainingsdaten

Deutsch macht 21,3 Prozent der Vortrainingsdaten aus. Das klingt nach wenig, ist für ein Modell dieser Klasse aber ein Statement. Viele offene Modelle sind vorwiegend auf Englisch trainiert und zerlegen deutsche Wörter in mehr und kleinere Stücke.

Aleph Alpha verwendet ein zweisprachiges Vokabular mit 128.000 Einträgen und einen Tokenizer, der deutsche Komposita erhält. Wörter wie Verwaltungsverfahrensrecht oder Betriebsrentenstärkungsgesetz sollen so nicht in bedeutungslose Silben zerfallen. Das spart Token, und gesparte Token bedeuten geringere Kosten und weniger Informationsverlust pro Satz.

Das Modell bietet außerdem vier Denkstufen: none, low, medium und high. Wer eine simple Klassifikation braucht, wählt keine Reasoning-Kette und spart Rechenzeit. Wer ein Gutachten strukturieren will, schaltet hoch. Dazu kommt Tool Calling, also die Fähigkeit, externe Funktionen aufzurufen. Aleph Alpha nennt als Schwerpunkte Deutsch, Mathematik, Programmierung, Langkontext und agentische Aufgaben.

Training in Deutschland und Finnland: warum Kolibri On-Premises läuft

Trainiert wurde Kolibri auf 768 B200 GPUs. Den Anfang machten 20 Billionen Token über 21 Tage, danach folgten Mid-Training und eine Phase zur Anpassung an lange Kontexte. In Summe kommen fast 24 Billionen Token zusammen. Entscheidend ist weniger die Zahl als der Ort: Entwicklung und Training fanden in Deutschland und Finnland statt.

Daraus ergibt sich das eigentliche Verkaufsargument für souveräne KI in regulierten Branchen. Aleph Alpha kontrolliert nach eigener Aussage Datenkuratierung, Training, Evaluation, Gewichte und Bereitstellung. Die On-Premises-Bereitstellung erfolgt über das eigene Inference-Paket und ein modellspezifisches vLLM-Plugin, das auch die Parser für Reasoning und Tool-Aufrufe mitbringt.

Für eine Behörde heißt das: Interne Vorgänge müssen nicht an einen fremden Inferenzdienst geschickt werden. Datenhoheit ist hier keine Marketingfloskel, sondern eine technische Eigenschaft der Installation. Wer reguliert ist, weiß, dass diese Frage in jedem Beschaffungsverfahren zuerst gestellt wird.

Verweigern statt Raten: Merlin-Arthur und die 44 Prozent

Ein Sprachmodell, das selbstbewusst falsch antwortet, ist in der Verwaltung schlimmer als eines, das gar nichts sagt. Aleph Alpha hat Kolibri deshalb auf Verweigerungsbeispiele trainiert und mit dem eigenen Merlin-Arthur-Verfahren konfrontiert. Dieses Verfahren lehrt das Modell, eine Antwort zurückzuhalten, wenn die Belege fehlen.

In den firmeneigenen Tests vermied Kolibri bei 44 Prozent der AA-Omniscience-Aufgaben eine falsche Antwort, der Vorgänger Kolibri Origin lag laut Modellkarte bei 15 Prozent. Richtig beantwortet hat Kolibri dabei allerdings nur 14,8 Prozent der Fragen – der Rest der vermiedenen Fehler sind Enthaltungen. Andere Modelle derselben Vergleichstabelle liegen bei der Fehlervermeidung zum Teil deutlich höher, etwa Qwen3.8 27B mit 67,3 Prozent. Im M/A-Grounding-Score auf SQuAD erreicht Kolibri 23,4 Punkte. Solche Werte sind keine Eleganznote, sondern eine Risikokennzahl.

Die Kehrseite ist ebenso real. Ein Modell, das zu oft schweigt, wird unbrauchbar, weil Menschen dann wieder selbst suchen. Die Kunst liegt im richtigen Maß. Deshalb lohnt es sich, Verweigerungsraten nicht nur zu bewundern, sondern am eigenen Datenbestand nachzumessen.

Benchmarks aus dem eigenen Haus und ihre Grenzen

Aleph Alpha meldet für Kolibri 75,5 Punkte im englischen Gesamtdurchschnitt und 70,8 im deutschen. Bei AIME 2025, einem Mathematikwettbewerb, sind es 96,9. LiveCodeBench v6 liegt bei 85,9, BFCL v4 für Funktionsaufrufe bei 61,4. Dazu kommen branchenspezifische Testreihen für öffentliche Verwaltung, Automobil, Halbleiter, Industrietechnik und Luftfahrt, die ohne Kundendaten auskommen.

Diese Zahlen stammen vom Anbieter selbst, erhoben mit eigenen Testumgebungen und, wo möglich, mit der höchsten Denkstufe. Das ist kein Grund, sie zu verwerfen, aber ein Grund, sie als das zu lesen, was sie sind: eine Selbstauskunft. Aleph Alpha behauptet, Kolibri liege auf der Pareto-Grenze zwischen Qualität und Betriebskosten und halte bei Mathematik, Code, Grounding, Agentik und Langkontext mit Modellen mit, die bis zu viermal so viele aktive Parameter haben.

Was heißt das konkret? Kolibri richtet sich nicht an alle. Wer ein schnelles Consumer-Modell für Alltagsfragen sucht, wird mit einem 78-Milliarden-Parameter-Modell auf eigener Hardware wenig Freude haben. Wer dagegen in einer regulierten Umgebung arbeitet, in der Daten das Haus nicht verlassen dürfen und lange Dokumente zusammenhängend bewertet werden müssen, bekommt hier eine weitere Option aus Europa. Die Gewichte sind offen, die Lizenz erlaubt den kommerziellen Betrieb, und die Entscheidung über Datenfluss liegt beim Betreiber. Wer Kolibri prüft, sollte mit dem eigenen Korpus testen, die Verweigerungsquote messen und die tatsächlich nutzbare Kontextlänge bestimmen. Alles andere sind Zahlen aus dem Prospekt.

Quelle: testingcatalog.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 72
Relevanz 75
Hype 28
Einschätzung 72
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.