OpenRouter bündelt den Modellzugriff: Response Caching, Harness-Anbindung und Fusion API im Überblick

Abstrakter Strom aus Lichtpartikeln und Datenströmen im tiefdunklen Raum
Deine Reaktion:

Ein einziger HTTP-Header entscheidet, ob eine identische Anfrage erneut abgerechnet wird oder in Millisekunden aus dem Zwischenspeicher zurückkommt. Vier weitere Agent-Harnesses laufen nicht mehr über eigene Anbieter-Konten, sondern über eine gemeinsame Schnittstelle mit mehr als 500 Modellen. OpenRouter hat diese und einige weitere Änderungen zwischen April und September 2026 veröffentlicht. Die Teile hängen stärker zusammen, als die einzelnen Ankündigungen zeigen.

Wer KI-Modelle per API nutzt, kennt das Problem: Jeder Anbieter hat eigene Endpunkte, eigene Schlüssel, eigene Preise und eigene Eigenheiten bei den Parametern. OpenRouter will daraus einen einzigen Knotenpunkt machen. Du wählst ein Modell, ohne für jeden Anbieter einen eigenen Zugang zu brauchen. Die jüngsten Ankündigungen betreffen genau diesen Punkt aus verschiedenen Richtungen.

Response Caching: Ein Header, der Wiederholungen kostenlos macht

Response Caching ist der praktischste Baustein, und OpenRouter stellt es kostenlos bereit. Du setzt einen Header, X-OpenRouter-Cache mit dem Wert true, und jede identische Anfrage danach kommt aus dem Cache. Der erste Aufruf geht an den Modellanbieter und wird normal abgerechnet. Jeder weitere kostet keine Tokens mehr.

Die Zahlen sind deutlicher als das Konzept. Eine ungecachte Anfrage an Gemini 2.5 Flash dauert etwa 1,3 Sekunden, an Kimi K2.6 rund 4,6 Sekunden und an GPT-5.5 etwa 9,1 Sekunden. Treffer im Cache kommen in 80 bis 300 Millisekunden zurück. Das Nachschlagen selbst dauert im Schnitt 4 Millisekunden.

Bei Tests und Agent-Wiederholungen zählt das. Wenn ein Agent eine Aufgabe mehrfach mit demselben Kontext startet, weil ein Werkzeug fehlgeschlagen ist, zahlst du sonst jedes Mal für denselben Prompt. Mit Cache kostet nur der erste Durchlauf. Offen bleibt, wie eng „identisch“ definiert ist: Ein wechselnder Zeitstempel im Prompt reicht, um den Treffer zu verhindern.

Vier weitere Harnesses am Modell-Router

Vier weitere Ori-Harnesses laufen jetzt über die Plattform: Cline, Kilocode, ohmypi und Muse Code. Ein Harness steuert ein Modell, organisiert Werkzeugaufrufe, Dateizugriffe und Schleifen. Statt für jeden Harness einen eigenen Anbieter-Zugang zu pflegen, greifst du auf denselben Pool aus mehr als 500 Modellen zu. Das Modell wechselst du pro Durchlauf, nicht pro Werkzeug.

Die Aufrufe sind einheitlich. Beispiele aus der Ankündigung: „ori kilo –model openai/gpt-6-astra“ oder „ori muse –model anthropic/claude-fable-5.1“. Der Parameter reasoning-effort wird auf das native Flag des Harness abgebildet, alles andere läuft unverändert durch. Du lernst eine Schreibweise und findest sie in vier Werkzeugen wieder.

Wichtiger als die Zahl der Harnesses ist, dass die Modellwahl aus dem Werkzeug herausgezogen wird. Funktioniert dieselbe Zeile in Cline, Kilocode, ohmypi und Muse Code, wird der Harness austauschbar und das Modell zur Stellschraube. Das ist die Aufgabe eines Modell-Routers: Er sitzt zwischen Werkzeug und Anbietern und nimmt dir die Kopplung ab.

Classifiers: KI-Inferenz nach Aufgabe und Abteilung sortieren

In der Beta steckt ein Werkzeug namens Classifiers. Damit taggst du KI-Inferenz in deinem Workspace nach Aufgabentyp, Abteilung, Agent-Komplexität oder einem anderen Merkmal und filterst anschließend Logs oder visualisierst die eigene Aktivität. Ein Classifier besteht aus vier Teilen: einer Taxonomie mit bis zu acht Dimensionen, einem Klassifizierungs-Prompt, einem Modell für die Einordnung und einer Sampling-Rate. Sechs Vorlagen sind mitgeliefert, damit du nicht bei null anfängst.

Für den Betrieb zählt der Zeitpunkt: Die Klassifizierung läuft asynchron nach jeder Anfrage und fügt dem Inferenzpfad keine Latenz hinzu. Ein Beispiel aus der Ankündigung zeigt die interne Nutzung gruppiert nach Aufgabenfamilie und Modell, dominiert von Analyse und Coding. Die Etiketten werden also erst nach dem Versand aufgeklebt.

Nützlich wird es, wenn du die Gruppierung umdrehst. Statt zu fragen, welche Aufgaben anfallen, fragst du, welches Modell welche Aufgabe am stärksten abbekommt. So siehst du, ob ein teures Frontier-Modell Arbeit erledigt, die ein günstigeres ebenso gut könnte. Automatisch passiert nichts, aber für die nächste Entscheidung über Preise und Modelle hast du Daten.

Fusion API für KI-Modelle: Mehrere Antworten werden zusammengeführt

Die Fusion API geht anders vor. Statt ein einzelnes Modell zu befragen, schickt sie eine Anfrage an ein Panel aus mehreren Modellen und führt die Antworten zusammen. OpenRouter nennt Fusion das intelligenteste zusammengesetzte Modell am Markt, mit Fable-Niveau zum halben Preis. Getestet wurde an 100 schwierigen Rechercheaufgaben, drei Beobachtungen fallen auf.

Erstens schneiden Panels durchweg besser ab als einzelne Modelle. Zweitens lässt sich Leistung jenseits der Frontier-Modelle erreichen, wenn das Panel aus Frontier-Modellen besteht. Drittens können Panels aus günstigen Modellen teurere Einzelmodelle überholen, ohne deren Kosten zu erzeugen. Interessant ist die Zerlegung: Etwa drei Viertel des Gewinns stammen aus der Zusammenführung, nur ein Viertel aus der Vielfalt der Modelle.

Das verändert die Frage beim Modellvergleich. Nicht mehr nur: Welches einzelne Modell liefert die beste Antwort? Sondern: Welche Kombination aus Modellen und Zusammenführung ergibt das beste Verhältnis? Ein Panel ist kein Zaubermittel, es kostet mehr Aufrufe pro Anfrage. Die werden über die Plattform gebündelt abgerechnet, nicht über mehrere Anbieterkonten.

Discover-Seite und Aliase: OpenRouter KI-Modelle vergleichen ohne Handbuch

Die neue Discover-Seite bündelt den Blick auf den Markt. Opus 5 führt die Gesamtwertung an, GPT 5.6 Sol liegt beim Coding vorne. Dazu kommt eine wachsende Liste von Routern, die weitere Modelle auffinden helfen. Angezeigt werden unter anderem das beste Verhältnis von Wert zu Preis und die schnellsten Modelle über den ganzen Markt.

Für den Alltag sind zwei Funktionen wichtiger als die Ranglisten. Aliase verhindern, dass du eine neue Version verpasst, weil du noch auf einem festen Modellnamen sitzt. Und die Filter für kostenlose Modelle zeigen, was gerade nichts kostet. Damit vergleichst du KI-Modelle per API, ohne für jede Aktualisierung die eigene Konfiguration anzufassen.

OpenRouter beschränkt sich nicht mehr auf Sprachmodelle. Die Discover-Seite führt auch Bild-, Video- und Audiomodelle an einem Ort zusammen und erlaubt einfache visuelle Vergleiche. Ein separater Beitrag beschreibt einen Skill namens create-agent-tui, mit dem sich ein eigener Agent-Harness samt Terminal-Oberfläche bauen lässt. Die Plattform will nicht nur Anfragen weiterleiten, sondern auch das Drumherum mitliefern.

Was die Bündelung für den Alltag bedeutet

Vier Harnesses teilen sich einen Modellpool, ein Header macht Wiederholungen kostenlos, Classifiers ordnen die Nutzung nachträglich ein, Fusion bündelt mehrere Modelle zu einer Antwort. Jede Funktion löst ein Problem, das erst durch die Bündelung entsteht: Wie behältst du bei 500 Modellen und wechselnden Anbietern den Überblick?

Du musst nicht sofort alles umstellen. Der Response Cache ist der günstigste Einstieg, weil er bei wiederholten Anfragen greift. Der Wechsel zwischen Harnesses lohnt sich, sobald du mehr als ein Werkzeug parallel betreibst. Classifiers und Fusion sind eher etwas für Teams, die Kosten und Qualität messen wollen.

Die Modellwahl findet jetzt zur Laufzeit statt, nicht in der Konfiguration. Du bindest dich nicht an einen Anbieter, sondern an eine Schnittstelle, und tauschst dahinter nach Bedarf. Das ist unbequem für Anbieter, die auf Wechselkosten gesetzt haben, und bequem für alle, die Modelle nach Preis und Aufgabe auswählen. Ob das im Dauerbetrieb stabil bleibt, zeigt sich an Ausfallzeiten und Preisen, nicht an Ankündigungen.

Quelle: threadreaderapp.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 66
Relevanz 72
Hype 24
Einschätzung 58
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.