Ling-3.0-flash-Fin: Ant Group veröffentlicht ein Finanz-KI-Modell mit 5,1 Milliarden aktiven Parametern

Makroaufnahme einer Platine mit Mikrochip und leuchtenden Kupferleiterbahnen
Deine Reaktion:

23 Punkte im Artificial Analysis Intelligence Index, erreicht mit 5,1 Milliarden aktiven Parametern pro Token. Diese Zahl beschreibt das Verhältnis von Leistung zu Rechenaufwand, und darum geht es bei Ling-3.0-flash-Fin von der Ant Group. Das Modell liegt damit auf der Pareto-Grenze zwischen Intelligenz und aktiver Parameterzahl: Es liefert für seinen Rechenbedarf überdurchschnittlich viel. Wer offene Modelle für den produktiven Einsatz auswählt, achtet heute auf solche Verhältnisse, nicht nur auf die absolute Bestenliste.

Ant Group hat Ling-3.0-flash-Fin als Open-Weights-Modell veröffentlicht, das auf Ling-3.0-flash aufbaut und sich an Finanzarbeit richtet. Nach Angaben des Unternehmens entstand es gemeinsam mit Finanzinstituten und Branchenfachleuten, um Aufgaben wie das Prüfen von Quellen, den Aufbau von Bewertungstabellen und das Schreiben von Berichten zu unterstützen. Es ist ein reines Textmodell, während der zuvor veröffentlichte Vorgänger Ling-3.0-flash-VL auch Bilder und Videos als Eingabe verarbeitet und 25 Punkte im Intelligence Index erreicht. Der Vergleich der beiden zieht sich durch diese Auswertung und sagt mehr über Fins Ausrichtung als jede Marketingformulierung.

Wofür Ant Group das finanzorientierte KI-Modell positioniert

Die genannten Anwendungsfälle klingen bewusst nüchtern: Quellen prüfen, Bewertungsmodelle in Tabellen aufbauen, Berichte formulieren. Das sind Tätigkeiten, die in Analystenhäusern, Investmentabteilungen und Prüfungsgesellschaften einen großen Teil der Arbeitszeit binden. Und sie haben eine Gemeinsamkeit: Sie sind fehlerempfindlich. Ein falsch zitierter Geschäftsbericht oder eine Formel, die stillschweigend auf die falsche Zeile verweist, richtet mehr Schaden an als eine fehlende Antwort. Genau dort setzt Ant Group an. Ling-3.0-flash-Fin soll nicht den breitesten Werkzeugkasten mitbringen, sondern den passenden.

Die Abgrenzung zum Schwestermodell ist aufschlussreich. Während Ling-3.0-flash-VL Bilder und Videos als Eingabe akzeptiert, beschränkt sich Fin auf Text. Wer viel mit gescannten Dokumenten, Kurscharts oder Präsentationen arbeitet, verliert damit eine Fähigkeit, die im Finanzalltag zählt. Die Frage ist also nicht, ob Fin das bessere Modell ist, sondern für welche Arbeit sich der Verzicht auf Bildeingabe lohnt. Ein Modell ohne Augen kann trotzdem sehr gut rechnen — es sieht nur nicht, worüber es rechnet.

124 Milliarden Parameter, 5,1 Milliarden aktiv: wie das MoE-Modell arbeitet

Hinter den Zahlen steht ein MoE-Modell, also eine Mixture of Experts. Man kann sich das wie eine große Fachberatung vorstellen: Die 124 Milliarden Parameter sind die gesamte Belegschaft, doch pro Token werden nur 5,1 Milliarden davon aktiviert. Für jeden kleinen Arbeitsschritt ruft das System nur die Spezialisten herein, die gerade gebraucht werden, statt das ganze Haus zu beschäftigen. Deshalb lässt sich ein Modell dieser Gesamtgröße überhaupt wirtschaftlich betreiben. Und deshalb ist die aktive Parameterzahl inzwischen die wichtigere Größe als die Gesamtzahl.

Das Kontextfenster liegt bei 256.000 Token, was für Jahresabschlüsse, Vertragswerke oder längere Rechercheketten ausreicht. Die Lizenz ist MIT, eine der freizügigsten überhaupt, und der Zugang läuft unter anderem über OpenRouter, inklusive eines ratenbegrenzten kostenlosen Endpunkts. Offene Gewichte, großzügige Lizenz und geringer Aktivierungsaufwand — das zusammen macht dieses Modell für Finanzanwendungen interessant. Du kannst es selbst hosten, ohne dass die Rechnung außer Kontrolle gerät, und das ist in regulierten Umgebungen oft die Voraussetzung dafür, dass ein Modell überhaupt in Frage kommt.

Die Benchmarks: Intelligence Index, Pareto-Grenze und der Vergleich mit MiniMax-M2.7

Auf dem Intelligence Index erreicht Ling-3.0-flash-Fin 23 Punkte und zieht damit mit MiniMax-M2.7 gleich. Der Unterschied liegt im Aufwand. Fin aktiviert 5,1 Milliarden Parameter pro Token, MiniMax-M2.7 rund 10 Milliarden. Etwa halbe Rechenlast für dasselbe Ergebnis. Im Dauerbetrieb ist das relevanter als jeder Spitzenwert, weil sich Kosten über Millionen Anfragen summieren. Wer ein Modell in eine Pipeline einbaut, merkt den Unterschied zwischen 5 und 10 Milliarden aktiven Parametern jeden Tag.

Anders sieht es aus, wenn man die gesamte Modellgröße betrachtet. Ling-3.0-flash-VL kommt auf 25 Punkte bei 5,5 Milliarden aktiven Parametern, beide Ling-Modelle haben 124 Milliarden Parameter insgesamt. Qwen3.8 27B in der xhigh-Konfiguration erreicht mit 27 Milliarden Gesamtparametern einen Wert von 34 und liegt damit auf der Frontier bezogen auf die Gesamtgröße, während die Ling-Modelle dort darunter bleiben. Es gibt also nicht die eine Rangliste, sondern mindestens zwei Grenzlinien: eine für aktive Parameter, eine für das Gesamtmodell. Je nachdem, ob bei dir Speicherplatz oder Rechenzeit der Engpass ist, fällt die Bewertung unterschiedlich aus.

24 Punkte im Finance & Accounting Index und die Frage der Halluzinationen

Im Artificial Analysis Finance & Accounting Index kommt Ling-3.0-flash-Fin auf 24 Punkte und damit auf denselben Wert wie Ling-3.0-flash-VL. Dieser Index bündelt mehrere Fähigkeiten: betriebswirtschaftliches Wissen, logisches Schlussfolgern, agentische Arbeit, die Analyse langer Kontexte und die Zuverlässigkeit, nichts zu erfinden. Dass ein Textmodell hier gleichauf mit einem multimodalen liegt, zeigt: Für dieses Ergebnis spielt die Bildeingabe keine entscheidende Rolle. Die Ausrichtung auf Finanzsprache und Finanzdokumente scheint den fehlenden Eingabekanal zumindest teilweise auszugleichen.

Genauer betrachtet zeigt sich ein Zielkonflikt. Fin erzielt eine höhere Genauigkeit beim betriebswirtschaftlichen Wissen, nämlich 17 Prozent gegenüber 11 Prozent beim VL-Modell. Gleichzeitig halluziniert es häufiger: Die Nicht-Halluzinationsrate liegt bei 67 Prozent gegenüber 81 Prozent. Umgerechnet erfindet Fin also in 33 Prozent der geprüften Fälle etwas, während VL bei 19 Prozent liegt. Mehr richtige Fakten, aber auch mehr erfundene.

In der Finanzarbeit ist das ein unangenehmes Muster, weil ein falsches Ergebnis nicht immer als falsch erkennbar ist. Eine erfundene Kennzahl sieht genauso aus wie eine recherchierte. Wer das Modell einsetzt, sollte deshalb jede Zahl gegen die Originalquelle prüfen. Das Modell soll beim Prüfen von Quellen helfen, braucht aber selbst diese Prüfung. Der Nutzen liegt damit weniger im fertigen Ergebnis als in der Vorarbeit — Material sichten, Struktur vorschlagen, Entwürfe bauen.

Agentische Aufgaben: GDPval, AA-Briefcase, AutomationBench und Terminal-Bench

Bei professionellen Wissensaufgaben schneidet Fin etwas schwächer ab als sein Schwestermodell. Auf GDPval-AA v2, einem Benchmark für die Erstellung von Dokumenten und Tabellen, erreicht es 1171 Elo gegenüber 1225 für VL, liegt damit aber noch deutlich über MiniMax-M2.7 mit 1087. Bei AA-Briefcase, wo Agenten aus großen Dateisammlungen Tabellen, Präsentationen und Memoranden erzeugen, kommt Fin auf 967 Elo gegenüber 986 für VL. Die Abstände sind klein, aber sie zeigen in eine klare Richtung: Das Finanzmodell ist beim agentischen Arbeiten nicht die stärkere Variante.

Im Detail ist das Ergebnis gespalten. Fin besteht weniger Rubrik-Prüfungen, nämlich 23,5 gegenüber 24,9 Prozent, und erreicht beim Kriterium Analytical Quality 866 statt 907 Elo. Bei der Präsentationsqualität liegt es mit 1095 zu 1076 jedoch leicht vorn, und das, obwohl ihm die Bildeingabe fehlt, über die das VL-Modell verfügt. Offenbar zahlt sich die Ausrichtung auf Textausgabe an dieser Stelle direkt aus. Ein Modell, das ausschließlich Text verarbeitet, schreibt am Ende vielleicht die gefälligeren Dokumente.

Klarer wird der Abstand bei Aufgaben, die echte Abläufe über mehrere Anwendungen hinweg verlangen. AutomationBench-AA prüft, ob ein Agent Arbeitsabläufe in Geschäftsanwendungen erledigt und dabei vorgegebene Leitplanken einhält. Fin erreicht dort 7 Prozent, VL kommt auf 16 Prozent. Bei Terminal-Bench v4.0, das schwierige Kommandozeilenaufgaben testet, stehen beide Modelle bei 0 Prozent. Anspruchsvolle agentische Arbeit bleibt eine Baustelle, und zwar nicht nur für Fin, sondern für dieses gesamte Modellsegment. Wenn du vorhast, dem Modell selbstständig Workflows zu überlassen, solltest du diese Zahlen genau lesen.

67.000 Output-Tokens pro Aufgabe, Rate-Limit-Zugang und der Blick auf die Kosten

Ein Punkt, der in Benchmark-Tabellen leicht untergeht, ist der Ausgabeverbrauch. Für eine Aufgabe im Intelligence Index produziert Ling-3.0-flash-Fin im Schnitt rund 67.000 Output-Tokens. Das sind etwa 34 Prozent mehr als beim VL-Modell mit ungefähr 50.000 und rund das 3,2-fache von MiniMax-M2.7 mit etwa 21.000 Tokens pro Aufgabe. Ein Modell, das mehr schreibt, ist in der Praxis teurer, langsamer und schwieriger in feste Abläufe zu integrieren. Dazu kommt, dass Fin als Reasoning-Modell ausführlich nachdenkt, bevor es antwortet; diese Ausführlichkeit erklärt einen Teil der Tokenmenge und ist bei komplexen Bewertungsfragen oft erwünscht.

In der Massenverarbeitung, etwa beim Screening tausender Dokumente, wird dieselbe Eigenschaft zum Kostenfaktor. Wer das Modell produktiv betreiben will, sollte deshalb nicht nur die Genauigkeit messen, sondern auch die Token pro erledigter Aufgabe — und die Frage, ob ein knapperes Modell mit etwas geringerer Qualität unterm Strich billiger ans Ziel kommt. Der Zugang über OpenRouter mit einem ratenbegrenzten kostenlosen Endpunkt macht das Ausprobieren leicht, ersetzt aber keine eigene Messung am konkreten Anwendungsfall.

Ling-3.0-flash-Fin ist ein spezialisierter Arbeiter, kein Universalist. 23 Punkte im Intelligence Index bei 5,1 Milliarden aktiven Parametern, 24 Punkte im Finance & Accounting Index, 256.000 Token Kontext und eine MIT-Lizenz ergeben ein Paket, das sich gut selbst hosten und in bestehende Pipelines einfügen lässt. Die Kehrseiten sind ebenso klar: eine Halluzinationsrate von 33 Prozent im Wissensbereich, 7 Prozent bei Automationsabläufen und 0 Prozent bei schwierigen Terminal-Aufgaben. Der realistische Einsatz liegt damit in der Zuarbeit — Quellen finden, Tabellen vorbereiten, Entwürfe schreiben — während die abschließende Prüfung bei Menschen bleibt. Dort, bei der Entlastung von Routinearbeit, liegt sein Nutzen; als eigenständiger Entscheider in Finanzfragen taugt es nach dieser Datenlage nicht.

Quelle: artificialanalysis.ai

Deine Reaktion:
Artikel teilen:
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.