Xiaomi MiMo-V2.6 Pro und Flash: offene omnimodale Modelle und die Rechnung dahinter

Ein Entwickler von hinten an einem Arbeitsplatz mit mehreren Monitoren in einem dunklen Raum
Deine Reaktion:

Offene KI-Modelle gelten als Bastelware: brauchbar für Experimente, selten für echte Produktionsarbeit. Xiaomis MiMo-V2.6 soll laut Herstellerangaben mit Claude Opus 5 und GPT-5.6 Sol mithalten – bei einem Trainingsbudget im niedrigen einstelligen Millionenbereich. Wichtiger als die Benchmark-Zahlen ist die Rechnung dahinter.

Xiaomi hat die Serie MiMo-V2.6 in zwei Varianten veröffentlicht und den Quellcode offengelegt: Pro als leistungsfähigstes Modell, Flash als günstigere Balance aus Intelligenz und Effizienz. Beide sind nativ omnimodal, arbeiten also von Haus aus mit Text, Bild und Video und können zusätzlich einen Computer bedienen. Was das konkret heisst, wie teuer das Training war und ob der Vergleich mit den geschlossenen Modellen hält, steht in den folgenden Abschnitten.

Zwei Modelle, ein Bauplan: Pro, Flash und die omnimodale Basis

Wer ein omnimodales Modell baut, hat zwei Wege: mehrere spezialisierte Systeme nachträglich zusammenkleben oder von Anfang an mit allen Eingabeformen trainieren. Xiaomi geht den zweiten Weg und nennt das Ergebnis nativ omnimodal, also aus einem Guss. Praktisch heisst das: Dasselbe Modell schreibt Code, liest einen Screenshot, versteht ein kurzes Video und klickt sich durch eine Oberfläche. Der Bauplan erinnert an eine Werkstatt mit einer gemeinsamen Werkbank, auf der die Werkzeuge unterschiedlich schwer ausfallen – statt mehrerer getrennter Räume mit eigener Ausstattung.

MiMo-V2.6 Pro ist das schwere Werkzeug für anspruchsvolle Aufgaben: komplexe Coding-Agenten, visuelle Auswertungen, Computer-Use-Szenarien, in denen ein Modell eine grafische Oberfläche bedienen muss. MiMo-V2.6 Flash zielt auf Fälle, in denen Kosten und Laufzeit stärker wiegen als das letzte Prozent Qualität. Xiaomi unterzieht beide Modelle demselben Trainingsrezept und dimensioniert sie nur unterschiedlich. Die Arbeit steckt im Verfahren, nicht in der Grösse.

Was 46,32 Punkte im Intelligence Index v4.3 aussagen – und was nicht

Der MiMo-V2.6 Pro erreicht 46,32 Punkte im Artificial Analysis Intelligence Index v4.3. Nach Xiaomis Darstellung liegt er damit vor Kimi K3 und Qwen3.8 Max und ist das höchstbewertete Open-Source-Modell im Vergleichsfeld. Solche Zahlen sind nützlich, haben aber einen Haken: Den Test wählt der Anbieter selbst aus. Ein Index mittelt über viele Aufgaben und verdeckt, wo ein Modell stark ist und wo es einbricht.

Mehr sagt der Verlauf innerhalb einer Messreihe. Auf DeepSWE v1.1 stiegen die Werte bei einer Variante von 48,8 auf 65,68, bei der anderen von 58,4 auf 72,57. Solche Sprünge kommen nicht von mehr Parametern, sondern von besseren Trainingssignalen. Für MiMo-V2.6 Pro gilt also: Die Richtung stimmt, das Niveau liegt in der Spitzengruppe. Die Formulierung „auf Augenhöhe“ bleibt bis zu unabhängigen Nachmessungen eine Herstelleraussage.

30 Trainingsschritte, 750.000 Versuche: die Rechnung hinter dem Training

Der Kern der Veröffentlichung ist das skalierte Reinforcement Learning auf verifizierbaren, komplexen Aufgaben. In weniger als sechs Tagen absolvierten Flash und Pro jeweils 30 RL-Schritte über rund 750.000 Trajektorien. Die Kosten beliefen sich auf etwa 850.000 Dollar für Flash und 2,62 Millionen Dollar für Pro. Das ist die Grössenordnung eines mittleren Unternehmensbudgets, nicht die eines Nationalstaats.

Trainiert wurde über Coding-, allgemeine Agenten-, visuelle und Cybersicherheitsaufgaben, mit 1.568 Beispielen pro Update und Kontextlängen bis zu einer Million Token. Gegen ein bekanntes Problem hat Xiaomi Vorsichtsmassnahmen eingebaut: Der Router wurde eingefroren, um Drift zu begrenzen, dazu kamen gegnerische Evaluierung, Anomalieerkennung und Querprüfungen durch Verifier, um Reward Hacking zu erkennen. Das entspricht einem Prüfer, der nicht nur das Ergebnis ansieht, sondern auch kontrolliert, ob der Prüfling die Lösung selbst erarbeitet hat.

Reinforcement Learning belohnt Verhalten, das zum Ziel führt – und leider auch Abkürzungen, wenn niemand hinsieht. Wer diese Abkürzungen nicht systematisch ausschliesst, trainiert ein Modell heran, das gut aussieht und schlecht arbeitet. Der Verifier ist damit das eigentliche Qualitätsmerkmal des Verfahrens, nicht das Modellgewicht.

Von der Werkbank in die Werkstatt: Vibe World, Roboterarm und Musik

MiMo-V2.6 bleibt nicht beim Schreiben von Software stehen. Xiaomi nennt einen Anwendungsbereich „Vibe World“: Aus einem Bild, einem Video oder einer Textvorgabe koordiniert das Modell Agenten, die interaktive 3D-Szenen bauen und diese visuell überprüfen. Es erstellt Blender-Assets, steuert einen Franka-Panda-Roboterarm anhand von Kamerabildern, erzeugt Frontends und Präsentationen, montiert Videos und komponiert Musik als Notensatz und MIDI.

Auch Forschungsanwendungen werden genannt: das Screenen von Materialien, die PFAS-Chemikalien binden können, und die Formalisierung eines Lean-4-Theorems in mehr als 6.000 Zeilen kernel-verifizierten Codes. Solche Beispiele sind Demonstrationen, keine Produktversprechen. Ein Modell, das einen Roboterarm im kontrollierten Labor bewegt, ist noch kein System, das in einer Fertigungshalle zuverlässig arbeitet. Der Sprung von der Vorführung in den Alltag bleibt die Hürde.

Preise, Varianten und die Frage der Geschwindigkeit

Die API-Preise von MiMo-V2.6 liegen auf dem Niveau der Vorgängerversion V2.5. Flash kostet 0,14 Dollar pro Million uncached Input-Token und 0,28 Dollar für Output. Pro liegt bei 0,435 Dollar für Input und 0,87 Dollar für Output. Flash ist damit rund ein Drittel des grossen Bruders – ein Unterschied, der in volumenstarken Agenten-Pipelines mehr bewirkt als jeder Benchmarkpunkt.

Für latenzkritische Arbeit gibt es Pro-UltraSpeed, das bei gleicher Qualität bis zu 20-mal schneller ausgeben soll und dafür den zehnfachen Preis verlangt. UltraSpeed zielt auf Echtzeit-Workflows, in denen Wartezeit teurer ist als der Tokenpreis. Beide Modelle laufen bereits in AI Studio, MiMo Code, der MiMo API Platform und bei OpenRouter; MiMo Desktop verlässt die Early-Access-Phase und bringt beide Varianten mit. Zusammen mit den Modellen veröffentlicht Xiaomi den technischen Report, die Trainingsumgebungen und den RL-Code.

Was das konkret bedeutet

Nicht, dass ein offenes Modell einen Benchmark gewinnt, ist die Neuigkeit. Die Neuigkeit sind die Kosten: Ein konkurrenzfähiges Modell ist in einen Bereich gerutscht, den mehrere Unternehmen gleichzeitig bezahlen können. Wenn 30 RL-Schritte weniger als drei Millionen Dollar kosten, verschiebt sich der Wettbewerb weg von der grössten Rechenanlage, hin zu den saubersten Verifizierern. Das verändert, wer mitspielen kann, und wie schnell Modelle besser werden.

Als Entwickler oder Produktverantwortlicher heisst das: Die Preisleistung bei Coding-Agenten, Robotik-Simulation und Medienproduktion wird besser, und die Abhängigkeit von einem einzigen Anbieter sinkt – solange die Gewichte offen bleiben. Vorsicht bleibt trotzdem angebracht. Eigene Tests mit dem eigenen Datenbestand schlagen jeden Index. Und bei einem chinesischen Anbieter sollten Fragen zu Datenhaltung und Betrieb geklärt sein, bevor etwas in Produktion geht.

MiMo-V2.6 ist kein Beweis, dass offene Modelle geschlossene überholt haben. Belastbarer ist der Hinweis, dass der Abstand klein genug geworden ist, um in vielen Fällen keine Rolle mehr zu spielen. Wer die Modelle ausprobiert, sollte weniger auf die Zahl 46,32 schauen und mehr darauf, ob die eigene Aufgabe damit zuverlässig gelingt.

Quelle: testingcatalog.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 52
Relevanz 74
Hype 38
Einschätzung 70
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.