Mistral nennt für sein neuestes Modell eine Billion Parameter, von denen bei jeder Anfrage 49 Milliarden aktiv sind. Mistral Large 4 macht der französische Anbieter seit dem 6. Oktober als öffentliche Vorschau zugänglich. Alle folgenden Angaben stammen aus Mistrals eigener Ankündigung im Firmenblog; Benchmarks und Vergleiche sind also überwiegend Herstellerangaben. Technisch handelt es sich laut Produktbeschreibung um ein Mixture-of-Experts-Modell: Es besteht aus vielen spezialisierten Teilnetzen, von denen pro Anfrage nur ein Bruchteil anspringt. Solche Architekturen sollen Rechenkosten und Antwortzeiten senken, weil nie das ganze Modell rechnen muss.
Wichtiger noch als die Architektur sind die offenen Gewichte. Mistral will sie bis Ende des Monats veröffentlichen, zusammen mit Details zur Architektur, weiteren Benchmarks und der Methodik des Nachtrainings. Bis dahin läuft laut Unternehmen ein Red-Teaming in realen Umgebungen, mit Sicherheitsfirmen, geprüften Partnern und staatlichen Stellen, die dieselbe Modellversion mit reduzierter Moderation und erweiterten Cyber-Fähigkeiten bekommen. Wer selbst bestimmen will, was seine Systeme tun, kann mit offenen Gewichten selbst hosten und muss nicht auf einen Anbieter warten.
Eine Billion Parameter, von denen 49 Milliarden pro Anfrage arbeiten
Nativ multimodal heißt: Text und Bild kommen nicht über nachträglich angeflanschte Zusatzmodule zusammen, sondern stecken von Beginn des Trainings an gemeinsam im Modell. Laut Mistral wurde es von Grund auf auf 3.800 NVIDIA-Grace-Blackwell-Beschleunigern in eigenen Rechenzentren in Europa trainiert, und die öffentliche Vorschau läuft auf derselben Infrastruktur. Ein großer Teil der Trainingsdaten war mehrsprachig, über 160 Sprachen, darunter jede Amtssprache der Europäischen Union. Inoffiziell heißt das Modell ML4, ganz offiziell, so die Ankündigung mit Augenzwinkern, le Chonk.
Mistral nennt Mistral Large 4 das größte und leistungsfähigste eigene Modell und einen Meilenstein der offenen Gewichte. Nach eigenen Angaben hält es mit den stärksten Open-Source-Modellen weltweit mit und übertrifft alle Open-Weight-Modelle aus den USA oder Europa deutlich. Bei Unternehmensaufgaben in Cybersecurity, Finanzwesen und Recht soll es unter den offenen Modellen vorn liegen. Solche Sätze kommen vom Hersteller selbst. Was sie wert sind, zeigt sich erst an konkreten Zahlen.
Öffentliche Vorschau, offene Gewichte und die Frage der Souveränität
Die Preview-API steht ab sofort in Mistral Studio bereit, die Gewichte folgen Ende des Monats. Das Modell wird in mehreren Regionen weltweit verfügbar sein, darunter eine europäische Bereitstellung, die Mistral nach eigener Darstellung durchgängig selbst betreibt, unabhängig von anderen digitalen Dienstleistern und unter europäischem Recht. Wer ein Modell selbst hostet, entscheidet über Protokolle, Aufbewahrungsfristen und Zugriffsrechte und muss nicht damit rechnen, dass eine Funktion mitten im Betrieb abgeschaltet oder umgestellt wird.
Offene Gewichte sind allerdings nicht dasselbe wie Open Source im klassischen Sinn. Veröffentlicht werden die trainierten Parameter, also das Ergebnis des Lernprozesses, nicht die Trainingsdaten und in der Regel auch nicht der vollständige Trainingscode. Du kannst ein Modell damit inspizieren, lokal betreiben und weiterentwickeln, aber seine Herkunft nicht vollständig nachvollziehen. Wer das für die Compliance prüft, sollte den Unterschied kennen. Wie Mistral das bei Large 4 handhabt, ist noch offen; die Ankündigung äußert sich weder zur Lizenz noch zu den Trainingsdaten. Sie nennt nur, dass das Modell in enger Zusammenarbeit mit Unternehmen aus Finanzwesen, Fertigung, Logistik, Pharma und öffentlichem Sektor trainiert wurde und dieselbe Trainings-, Anpassungs- und Reinforcement-Learning-Umgebung nutzt, die Kunden über Mistral Forge buchen können.
Cybersecurity: Der Test, bei dem geschlossene Modelle verweigern
Nach Mistrals Darstellung liegt das Modell im Artificial Analysis Cyber Index, einer unabhängigen Bewertung, wie gut KI-Modelle Sicherheitslücken in realer Software finden und beheben, unter den fünf besten Modellen weltweit und führt die Open-Weight-Modelle außerhalb Chinas deutlich an. In einem Test des Index, bei dem ein Modell eine echte Schwachstelle in Open-Source-Software reproduzieren und anschließend patchen muss, erreicht es 82 Prozent, laut Mistral den höchsten Wert aller Modelle. In Cybench, einer Sammlung von 40 Aufgaben aus Sicherheitswettbewerben, löst es 93 Prozent. Mistral spricht von einem der höchsten Werte, die für ein Open-Weight-Modell gemeldet wurden.
Die zweite Hälfte des Arguments ist die Ablehnung. Mehrere führende geschlossene Modelle, darunter Claude Opus 5.5 und GPT-6 Astra, erzielen im selben Test Werte nahe null, weil sie die Aufgabe verweigern. Mistral führt das auf die Sicherheitsfilter der geschlossenen Modelle zurück. Software zu verteidigen beginne oft damit, zu beweisen, dass ein Fehler real ist, und genau diese Arbeit könnten solche Filter blockieren. Daraus formuliert Mistral eine unbequeme These: Wenn Angreifer dieselben Modelle mit Jailbreaks für offensive Zwecke nutzen, brauchen Verteidiger Systeme mit vergleichbaren Fähigkeiten, die nicht an denselben Verweigerungen hängen. Ob diese Abwägung aufgeht, lässt sich mit Benchmarks allein nicht beantworten. Die Version mit reduzierter Moderation gibt Mistral vorerst nur geprüften Partnern.
Das Modell soll auch jenseits dessen nützlich sein, worauf es explizit trainiert wurde. In internen Tests habe es bei der Analyse von Schadsoftware, der Priorisierung von Schwachstellen und dem Schreiben von Erkennungsregeln geholfen. Für Sicherheitsteams, die nachvollziehbare Abläufe brauchen, soll es auf privater Cloud oder im eigenen Rechenzentrum laufen. Gleichzeitig meldet Mistral, dass Mistral Large 4 im Lakera B3 AI Security Benchmark 93,3 Prozent der Angriffe abwehrt und beim KORA-Benchmark 1,691 erreicht, bei einem Maximum von 2. Auf Cyber-Prompts aus JailbreakBench, StrongREJECT und AgentHarm liegt die durchschnittliche Verweigerungsrate sogar höher als bei allen offenen Vergleichsmodellen.
Code, Agenten und der Blick auf Bilder
Im Software-Engineering erreicht Mistral Large 4 nach Herstellerangaben 61,7 Prozent auf DeepSWE v1.1, 59,4 Prozent auf SWE-Atlas-QnA und 28,3 Prozent auf Terminal-Bench 4. Der kombinierte Coding-Agent-Index liegt bei 49,8 Prozent und damit vor DeepSeek V4 Pro 0813 und Qwen3.8 Max. In einer verblindeten Bewertung mit Surge AI, bei der professionelle Annotatoren die Ausgaben auf einer Skala von 1 bis 5 beurteilten, landete die Vorschauversion mit 3,74 auf Platz zwei von fünf Modellen, hinter Claude Opus 5 mit 4,22 und vor Kimi K3, GLM-5.3 und GLM-5.2. Die Bewertung hat Mistral selbst durchführen lassen; sie misst Codequalität bei verdeckten Modellnamen, bleibt aber eine Momentaufnahme mit fünf Modellen.
Bei Agenten, also Systemen, die selbstständig Informationen sammeln, Werkzeuge bedienen und Ergebnisse abliefern, nennt Mistral 59,9 Prozent auf AutomationBench, einer Sammlung von 657 Geschäftsabläufen rund um Gmail, Google Sheets, Slack und Salesforce. Auf AA-Briefcase, das lange Wissensarbeit bewertet, kommt das Modell auf 1.393 Elo und liegt damit vor DeepSeek V4 Pro. Bei AutomationBench sieht Mistral sein Modell außerdem vor Kimi K3 und MiMo-V2.6-Pro. Ob ein Modell über lange Abläufe verlässlich bleibt, zeigt sich allerdings erst im eigenen Einsatz; Benchmarks liefern dafür nur einen Anhaltspunkt.
Am deutlichsten hebt Mistral den Sprung bei Bildern hervor. Das Modell liest komplexe Dokumente, Diagramme und natürliche Aufnahmen und verbindet visuelles Verankern mit agentischen Fähigkeiten: von der Auswertung gigapixelgroßer Satellitenbilder für Katastropheneinsätze bis zur Analyse technischer Zeichnungen, bei der so lange hineingezoomt wird, bis die Antwort sitzt. Beim visuellen Verankern, also dem präzisen Zuordnen von Bildbereichen zu Aussagen, übertrifft Mistral Large 4 nach eigenen Messungen sogar GPT-6-Astra im Dense-200-Test mit 42 zu 41 Prozent. Ein Prozentpunkt in einem einzelnen, von Mistral ausgewählten Test reicht allerdings nicht, um daraus einen generellen Gleichstand mit geschlossenen Spitzenmodellen abzuleiten.
Wissen, Recht, Finanzen und das Training am laufenden Modell
Bei wissenschaftlichen Aufgaben bezeichnet Mistral sein Modell als führend unter den offenen Gewichten, gemessen am SciCode-Verified-Test. In der Praxis soll es eine vollständige Hartree-Fock-Simulation in einem Durchgang erzeugen, also eine mehrstufige quantenchemische Rechnung, die aus einer ganzen Kette fortgeschrittener Einzelroutinen besteht. In eigenen Vergleichen argumentiere es präziser und strukturierter als GLM-5.3 und halte lange, anwendungsnahe Mathematikaufgaben durch. Für Wissensarbeit nennt der Anbieter außerdem FinWorkBench für Tabellenarbeit in Finanz und Buchhaltung sowie Harveys Legal-Agent-Benchmark, wo das Modell alle offenen Konkurrenten übertreffen soll. Externe Prüfungen durch vals.ai auf repräsentativen Rechts- und Finanzaufgaben sehen es nach Angaben von Mistral in beiden Fällen vor GPT-6-Astra.
Ein Abschnitt der Ankündigung handelt vom Training selbst. Mistral schreibt, dass Basismodelle sich schnell verbessern und die Nachbearbeitung Schritt halten muss: Ein Rezept, das für das gestrige Modell passte, lässt beim heutigen Leistung liegen, weil Aufgaben, die früher an die Grenze gingen, inzwischen trivial sind. Deshalb setzt das Unternehmen auf Reinforcement Learning, also auf Training anhand der Ergebnisse eigener Lösungsversuche, bei dem Schwierigkeit und Breite der Aufgaben mitwachsen. Eine gemeinsame, kombinierbare Schnittstelle erlaubt es, in einem Trainingslauf Aufgaben von kurzen Dialogen über wissenschaftliches Problemlösen bis zu Sicherheitsausrichtung und langfristiger Werkzeugnutzung zu mischen. Diese Umgebungen teilen sich Code-Sandboxes, Websuche und externe Schnittstellen. Bei der derzeitigen Größe von rund dreitausend GPUs erzeuge ein einzelner Trainingslauf etwa 33 Milliarden Tokens pro Tag, davon rund 16 Milliarden trainierbare.
Was das praktisch heißt
Für Teams, die heute über den Einsatz entscheiden, sind drei Punkte wichtig. Erstens lässt sich die Preview-API sofort testen, und wer eigene Aufgaben mitbringt, erfährt mehr über das Modell als aus jeder Benchmark-Tabelle. Zweitens lohnt es sich, auf die Gewichte und die zugehörige Lizenz zu warten, denn erst dann zeigt sich, ob Self-Hosting unter eigenen Regeln praktisch und wirtschaftlich trägt. Drittens sind viele der genannten Zahlen Herstellerangaben, teils aus internen Tests, und sollten auch so behandelt werden.
Für die Vorschau-API nennt Mistral 1,36 US-Dollar pro Million Eingabe-Tokens und 4,18 US-Dollar pro Million Ausgabe-Tokens. Das Modell soll zudem die Basis für eine neue Generation spezialisierter Mistral-Modelle werden. Finanziert wird der Ausbau laut Ankündigung aus einer Series-D-Runde über 3 Milliarden Euro, nach Mistrals Angaben die größte Eigenkapitalrunde, die ein europäisches Technologieunternehmen je eingesammelt hat. Der Reinforcement-Learning-Lauf hinter der Vorschau sei noch nicht abgeschlossen und zeige keine Sättigung; Mistral erwartet in den kommenden Wochen und Monaten deutliche Verbesserungen. Das ist eine Ankündigung, kein Messwert.
Unsere Einordnung: Ein offenes Modell mit einer Billion Parametern, trainiert auf europäischer Infrastruktur und unter europäischem Recht betreibbar, macht aus dem Schlagwort KI-Souveränität eine Frage der Infrastruktur. Ob ein Unternehmen im Ernstfall eigene Regeln anwenden darf, dürfte künftig weniger von Grundsatzpapieren abhängen als davon, wo die Gewichte liegen und wer den Strom dafür liefert.
Quelle: mistral.ai
