Welches KI-Modell trifft Entscheidungen, statt nur Text zu schreiben? Seit ein paar Wochen gibt es dafür eine eigene Produktkategorie. Wer so ein Modell in die eigene Software einbauen will, steht vor einer unübersichtlichen Auswahl. Es hilft, von den Modellnamen wegzukommen und auf die Kriterien zu schauen. Denn sie entscheiden, ob ein Entscheidungsmodell in der Produktion trägt oder nach zwei Wochen wieder ausgetauscht wird.
Ein Vergleich hilft: Ein allgemeines Sprachmodell ist wie ein Kommentator, der ein Spiel Stunde um Stunde beschreibt. Ein Entscheidungsmodell ist der Schiedsrichter, der in Sekundenbruchteilen pfeift. Er erzählt nichts. Er liefert ein Urteil, oft mit einer Zahl, die angibt, wie sicher er sich ist. Genau darin liegt der Unterschied.
Warum in wenigen Wochen ein ganzer Markt entstand
Am 15. September ging Jev live, das Modell des Startups TypeSafe. Statt einer Antwort liefert es eine Auswahl, einen Score oder ein Ja beziehungsweise Nein mit angehängter Konfidenzzahl. TypeSafe sammelte in derselben Woche 40 Millionen Dollar Seed-Kapital bei einer Bewertung von 200 Millionen ein und arbeitete eine Warteliste von 140.000 Personen in 36 Stunden ab. Innerhalb eines Tages hatten 13 Prozent der zahlenden Kunden von Vercels AI Gateway Jev bereits in einen Workflow eingebaut, und binnen drei Tagen lieferten Cloudflare, LangChain und Langfuse eigene Integrationen. Swapnil Talekar, auf dessen Substack-Beitrag dieser Text zurückgeht, schreibt dazu, um eine solche Adoptionskurve planten die meisten Firmen ein ganzes Launch-Quartal. Talekar hatte erst eine Woche zuvor über Jev geschrieben und schob den Folgebeitrag nach, weil sich die Kategorie schneller entwickelte, als er darüber bloggen konnte.
Zwei Wochen später gab es bereits Konkurrenz. Amazon brachte bis zum 1. Oktober mit Strands Decider 2B ein offenes Modell auf Basis von Qwen3.5-2B heraus, OpenAI kündigte in derselben Woche eine eigene Decisions API auf Grundlage von GPT-6 Luna an, die anders als Jev auch Bilder verarbeiten kann. Cloudflares Clef wurde als Modell mit offenen Gewichten gebaut, das sich als direkter Ersatz für Jevs API einsetzen lässt. Es landete am ersten Tag bei 465 Punkten auf Hacker News und schlug Jev in mehreren der Benchmarks, die Jev selbst veröffentlicht. Fastino legte mit GLiDE und GLiNER2.5-Decide zwei weitere Modelle nach. Auf GitHub sammelt der Tag jev-alternative bereits ein halbes Dutzend Open-Source-Klone mit Namen wie OpenJev, JevK5, von und Laya. TypeSafes eigener CEO zeigte sich unbeeindruckt und nannte den Ansturm der Konkurrenz „ML people wanting to implement a cool architecture“. Jev hat inzwischen sogar einen Wikipedia-Eintrag. Talekar folgert daraus, dass jede Empfehlung für ein bestimmtes Modell beim Erscheinen schon veraltet ist, und konzentriert sich deshalb auf Kriterien statt auf Modellnamen.
Was DecideBench über die Qualität verrät
Herstellerangaben sind in diesem Markt mit Vorsicht zu lesen. Fastino wählte für seinen Vergleich von GLiDE und GLiNER2.5-Decide mit Jev sowohl die Tests als auch die Modelle, gegen die getestet wurde, und TypeSafe räumte ein, dass die eigenen veröffentlichten Verbesserungen eher Best-Case-Szenarien abbilden. Umso wichtiger ist ein unabhängiger Maßstab, und den gibt es: DecideBench, ein Benchmark des Entwicklers Cho Yin Yong. Er umfasst 400 Entscheidungen mit Mehrfachauswahl aus acht Aufgabenfamilien, darunter Support-Triage, Inhaltsmoderation, Prüfung von Behauptungen und Agent-Routing.
Auf diesem Benchmark schlägt sich Jev gut: 98 Prozent Genauigkeit bei 32 Dollar pro einer Million Aufgaben, damit ist es das günstigste Modell im Test, das die 95-Prozent-Marke überschreitet. Die allgemeinen LLMs, die bei der reinen Trefferquote besser abschneiden, kosten im Betrieb sechs- bis vierzehnmal so viel. Interessanter findet Talekar, was weiter unten in der Tabelle steht: Die kleinen, encoder-basierten Modelle, Laya eingeschlossen, kommen auf lediglich 35 bis 59 Prozent, obwohl sie die schnellsten und billigsten Optionen sind. Der Test brachte außerdem Imajev-4B hervor, ein offenes, selbst hostbares Modell, das anders als Jev Bilder annimmt und 95 Prozent erreichte. Damit gilt es im Test als bestes offenes Entscheidungsmodell. Etwa zur gleichen Zeit tauchte mit JevBench ein zweiter unabhängiger Benchmark auf.
Sechs Fragen, die vor der Auswahl stehen
Klär zuerst, wo das Modell laufen soll. Jev und die Decisions API von OpenAI sind gehostet, während Clef, Decider 2B, GLiNER2.5-Decide, Imajev-4B und die übrigen Klone selbst oder am Rand des Netzwerks betrieben werden können. Sind die Daten zu sensibel, um sie an Frontier-Labore zu schicken, ist Selbst-Hosten laut Talekar eine gute Option. Genauso wichtig sind die Eingabedaten. Jev verarbeitet Text, Strings, JSON und Listen von Strings, während die Decisions API und Imajev-4B zusätzlich Bilder annehmen. Sobald irgendwo in der Pipeline ein Screenshot, ein gescanntes Formular oder das Foto eines beschädigten Produkts bewertet werden muss, entscheidet diese eine Frage die Modellwahl.
Dann die Geschwindigkeit. Jev wirbt mit 70 bis 500 Millisekunden, GLiNER2.5-Decide nennt 38 Millisekunden auf einer GPU, Laya rund 33 Millisekunden pro Frage. Für die Zuordnung eines Support-Tickets in die richtige Warteschlange ist der Unterschied zwischen 70 und 500 Millisekunden kaum spürbar. In einer Echtzeit-Spielschleife oder einem Handelssystem dagegen zählt jede Millisekunde. Dort ist die Latenz der Entscheidung alles, und der Kompromiss zwischen Tempo und Genauigkeit gewinnt an Gewicht.
Dann ist da die Kalibrierung. Ein Modell nützt nur, wenn es auf den eigenen Daten ähnlich zuverlässig arbeitet wie in der Werbung. Die Prüfung ist einfach: Du ziehst eine Stichprobe vergangener Entscheidungen, die das Modell getroffen hätte, mindestens einige hundert, sortierst sie nach der angegebenen Konfidenz in Bänder von zehn Prozentpunkten und vergleichst je Band die angegebene Konfidenz mit der tatsächlichen Trefferquote. Sagt das Modell 90 Prozent und das Band liefert in Wahrheit 65, solltest du dich nach einer Alternative umsehen. Zuletzt die Kosten: Jev kostet 0,042 Dollar pro einer Million Eingabe-Tokens bei kostenloser Ausgabe. Das klingt harmlos, bis du es mit dem täglichen Entscheidungsvolumen multiplizierst. Bei großen Mengen kann Selbst-Hosten günstiger sein, aber du tauschst den Tokenpreis nur gegen eigene Rechenleistung und Wartung ein. Automatisch billiger ist keins von beidem.
Bleiben die Wechselkosten. Cloudflare hat Clef bewusst als direkten Ersatz für Jevs API gebaut, damit Kunden beide vergleichen und tauschen können. Für die meisten anderen Modelle gilt das nicht, ihre Schnittstellen sind zueinander inkompatibel, und ein Wechsel bedeutet echte Arbeit. Wer heute auf ein Entscheidungsmodell setzt, bindet sich also nicht nur an ein Modell, sondern auch an die Mühe, es später wieder loszuwerden.
Zwei Beispiele aus der Praxis
Zuerst die Support-Triage, bei der täglich ein paar tausend Tickets in Abrechnung, Technik und Abwanderungsrisiko einsortiert werden. Die Einsätze sind hier niedrig, eine falsch zugeordnete Anfrage kostet einen Menschen ein bis zwei Minuten Weiterleitung. Deshalb zählen Kosten pro Aufgabe und Latenz mehr als die letzten Genauigkeitspunkte. Jev liegt mit 32 Dollar pro einer Million Aufgaben bei 98 Prozent Genauigkeit auf DecideBench damit als Standard nahe, während Strands Decider 2B interessant wird, wenn man ohnehin tief in AWS steckt und dieselbe Arbeit selbst hosten möchte. Die Kalibrierung fällt hier aus demselben Grund weniger ins Gewicht. Das ist der Fall, für den Entscheidungsmodelle gebaut wurden.
Anders, wenn ein Agent entscheiden soll, welchen Werkzeugaufruf er als Nächstes macht, und das mitten in einer laufenden Spielschleife oder einem Handelssystem, in dem ein paar hundert Millisekunden Tausende Dollar kosten können. Hier zählen Genauigkeitsunterschiede im einstelligen Bereich kaum, die Latenz dafür umso mehr. GLiNER2.5-Decide mit 38 Millisekunden auf der GPU oder Laya mit rund 33 Millisekunden wirken allein wegen des Tempos attraktiv. Genau an dieser Stelle musst du jedoch die 35 bis 59 Prozent Genauigkeit der Encoder-Modelle gegenrechnen. Eine Routing-Entscheidung, die in einem Drittel der Fälle falsch liegt, ist wenig wert, auch wenn sie schnell ist; sie liegt dann eben schnell falsch. Bei einem sehr engen Latenzbudget empfiehlt es sich, Jevs 70-Millisekunden-Angabe am eigenen System zu prüfen und nur bei Bedarf auf ein weniger genaues Modell auszuweichen.
Konsolidierung oder dauerhafte Aufspaltung
Talekar wagt eine Prognose: Entweder konsolidiert sich die Kategorie stark um jenes Modell, auf dem das meiste Werkzeug aufbaut, worauf Jevs Drei-Tage-Vorsprung bei Cloudflare, LangChain und Langfuse hindeutet. Oder sie teilt sich dauerhaft nach Anwendungsfall auf, mit billigen offenen Modellen für Massen-Triage und gehosteten APIs für alles, was eine Erklärung braucht. Er selbst setzt auf eine Mischung aus beidem. Die Kriterien bleiben nach seiner Einschätzung so oder so gültig, auch wenn ständig neue Modelle erscheinen.
Unsere Einordnung für die Kostenplanung: Ein Entscheidungsmodell gegen ein allgemeines LLM durchzurechnen, lohnt sich, denn auf DecideBench kosten die allgemeinen Modelle sechs- bis vierzehnmal so viel wie Jev, liegen bei der reinen Trefferquote aber nur knapp darüber. Die Wahl des Anbieters ist dagegen eher eine Wette auf ein Ökosystem als auf ein einzelnes Modell. Wer sich an offene Gewichte bindet, gewinnt Unabhängigkeit und verliert Bequemlichkeit. Wer auf eine gehostete API setzt, gewinnt Tempo beim Einstieg und verliert Kontrolle über Daten und Wechselkosten. Beide Wege sind vertretbar, solange man sie bewusst geht.
Quelle: swapniltalekar.substack.com
