DeepSeek V4.1 Flash überholt Anthropic beim agentischen Coding

Ein Entwickler von hinten an einem Arbeitsplatz mit mehreren Monitoren in einem dunklen Raum
Deine Reaktion:

Chinas KI-Modelle holen auf, hieß es bisher, bleiben aber bei den Aufgaben hinten, für die Unternehmen wirklich Geld ausgeben. Für das agentische Coding muss diese Einschätzung inzwischen korrigiert werden, schreibt Devin Culbertson bei TechTimes. Auf dem LiveBench-Leaderboard vom 4. Oktober führt das chinesische Modell DeepSeek V4.1 Flash die Teilkategorie agentisches Coding mit 77,3 Punkten an, vor Anthropics Claude Fable 5.1 (Max Effort) mit 66,1 Punkten. Den Abstand zwischen den besten Modellen beider Länder beziffert Bloomberg Intelligence auf rund drei Prozent, den niedrigsten bisher gemessenen Wert.

Wer daraus schließt, die Sache sei entschieden, übersieht den zweiten Teil. DeepSeek sitzt in Hangzhou, und jede Anfrage an die Schnittstelle landet bei einem Unternehmen, das chinesischem Recht unterliegt. Dieses Recht kennt eine Pflicht zur Zusammenarbeit mit den Nachrichtendiensten, die sich nach Darstellung von TechTimes durch keine Datenschutzerklärung aushebeln lässt. Es geht also nicht nur um Leistung, sondern um eine Entscheidung an der Schnittstelle von Technik, Recht und Beschaffung. Wer heute ein Modell für Softwareautomatisierung auswählt, muss beide Seiten kennen.

Was der LiveBench-Wert von 77,3 Punkten tatsächlich misst

Agentisches Coding ist kein Nischenthema. Es beschreibt genau die Fähigkeit, für die Softwareteams inzwischen einen erheblichen Teil ihrer KI-Budgets ausgeben: ein komplexes Problem zerlegen, den nötigen Code schreiben, ihn in einer echten Umgebung ausführen, die Fehlermeldung lesen und den Fehler beheben – und das über mehrere Runden hinweg, ohne dass nach jedem Schritt ein Mensch eingreift. In dieser Teildisziplin erreicht DeepSeek V4.1 Flash 77,3 Punkte, das Spitzenmodell von Anthropic liegt bei 66,1. Im Gesamtindex steht DeepSeek mit 81,1 gegen 83,4 knapp dahinter; diese 2,3 Punkte entsprechen gerundet etwa drei Prozent des Anthropic-Werts.

Die Messplattform spielt dabei eine Rolle. LiveBench ist ausdrücklich so gebaut, dass Testfragen nicht ins Trainingsmaterial der Modelle sickern und die Ergebnisse künstlich nach oben ziehen. Der Fragenkatalog wird monatlich erneuert, gespeist aus aktuellen Mathematikwettbewerben, arXiv-Vorabdrucken und Nachrichten, und bewertet wird objektiv statt durch einen KI-Richter. Eine unabhängige Übersicht vom September 2026 zählt LiveBench zu den sechs vertrauenswürdigsten Benchmarks überhaupt, merkt aber an, dass die Aufgabenmischung nur mittelmäßig gut abbildet, was in echten Produktionsumgebungen passiert. Ein Benchmark ist eine Prüfung. Er ist nicht der Arbeitsalltag.

Warum eine 748-Milliarden-Parameter-Architektur günstig bleiben kann

Hinter den Preisen steht eine Mixture-of-Experts-Architektur, also ein Modell, das aus vielen spezialisierten Teilnetzen besteht und pro Token nur einen kleinen Ausschnitt davon aktiviert. V4.1 Flash kommt auf insgesamt 748 Milliarden Parameter, darunter ein Kernrückgrat von 552 Milliarden und 196 Milliarden sogenannte Engram-Parameter – ein in dieser Generation neu eingeführter Baustein für dauerhaftes Gedächtnis. Entscheidend ist nicht die Gesamtzahl, sondern die sparsame Aktivierung: Der Rechenaufwand bei der Inferenz entspricht eher einem deutlich kleineren Modell, weshalb der Betrieb billiger zu haben ist als der Parameterstand vermuten lässt.

Das schlägt sich in den Konditionen nieder. Die Preise liegen inzwischen unter denen zum Start: 0,30 US-Dollar pro Million Eingabe-Token und 1,20 US-Dollar pro Million Ausgabe-Token zur Hauptzeit, außerhalb der Spitzenlast die Hälfte davon. Hinzu kommt ein geringerer Speicherbedarf: Der Bedarf für den KV-Cache schrumpft auf etwa ein Viertel des HBM-Bedarfs der Vorgängergeneration und auf ein Achtel beim SSD-Speicher. Das senkt die Hardwarekosten beim Betrieb und verstärkt den Preisvorteil. Dazu passen ein Kontextfenster von bis zu einer Million Token, Ausgabelängen bis 384.000 Token und eine multimodale Bildverarbeitung, die dem Vorgänger fehlte.

Wo die Messungen auseinandergehen: drei Prozent gegen acht Monate

Die Drei-Prozent-Zahl stammt aus einer Analyse von Robert Lea, Senior Analyst bei Bloomberg Intelligence, der sich auf den LiveBench-Stand vom 4. Oktober stützt. Ausgelöst hat den Sprung laut TechTimes DeepSeeks Veröffentlichung von V4.1 Flash im September. Zum Vergleich: Im Mai 2026 lag die Lücke bei etwa neun Prozent, zu Beginn des Jahres bei rund fünfzehn. Andere Messungen kommen zu anderen Ergebnissen. Das Center for AI Standards and Innovation (CAISI) der US-Standardisierungsbehörde NIST untersuchte im Mai 2026 den Vorgänger V4 Pro mit neun vorab festgelegten Benchmarks über fünf Bereiche und schätzte den Rückstand auf etwa acht Monate Entwicklungszeit, nicht auf einen niedrigen einstelligen Prozentwert. Die vorab festgelegte Methodik soll gezielte Optimierung auf die Tests erschweren.

Falsch ist laut TechTimes keine der beiden Zahlen. Die Analysen betrachten unterschiedliche Modelle zu unterschiedlichen Zeitpunkten mit unterschiedlichen Verfahren und messen damit Verschiedenes. Hinzu kommen die Angaben des Herstellers: In seinem technischen Bericht meldet DeepSeek für V4.1 Flash 74,2 Prozent auf dem anspruchsvollen Benchmark DeepSWE v1.1, knapp vor Anthropics Opus 5 mit 74,0 und OpenAIs GPT-5.6 Sol mit 73,0 Prozent. Hier gilt ein Vorbehalt: Bei selbst berichteten Ergebnissen besteht ein bekanntes Risiko, dass ein Modell eher auf die Tests als auf echte Fähigkeiten optimiert wurde. Eine unabhängige Prüfung speziell dieser Werte lag laut TechTimes bei Erscheinen des Artikels nicht vor.

Artikel 7 des National Intelligence Law: die Bedingung in jeder API-Anfrage

DeepSeek ist ein chinesisches Unternehmen. Das ist keine Randnotiz. Artikel 7 des National Intelligence Law von 2017 verlangt, dass alle Organisationen und Bürger die nachrichtendienstliche Arbeit des Staates nach Maßgabe des Gesetzes unterstützen und mit ihr zusammenarbeiten. Nach Darstellung von TechTimes verschafft das Gesetz dem Staat Zugriff auf Daten chinesischer Unternehmen, ohne dass die Anfrage öffentlich gemacht werden muss. Cybersecurity Law (2017) und Data Security Law (2021) ergänzen weitere Zugriffswege und Vorgaben zur Datenlokalisierung. Die Datenschutzerklärung eines chinesischen Unternehmens kann diese Pflichten laut dem Artikel rechtlich nicht überstimmen.

Wer Code, Geschäftslogik oder interne Prompts an die Schnittstelle schickt, überträgt sie damit in eine Infrastruktur, die diesen Regeln unterliegt. Erschwerend kommt ein dokumentiertes Sicherheitsdefizit hinzu: Anfang 2025 fanden Forscher von Wiz eine DeepSeek-Datenbank ohne Authentifizierung, in der Chatverläufe und API-Schlüssel offenlagen. Das Unternehmen ist also einerseits rechtlich zur Weitergabe verpflichtet und hat andererseits bereits gezeigt, dass der Schutz nicht immer sitzt. Mehrere US-Behörden – darunter Navy, NASA und das Handelsministerium – haben DeepSeek Anfang 2025 auf Dienstgeräten gesperrt, auch Taiwan untersagte die Nutzung in Regierungsstellen. Eine unabhängige Prüfung, wie V4.1 Flash mit Daten umgeht, ist laut TechTimes nicht veröffentlicht. Einen Ausweg gibt es: V4.1 Flash ist ein Open-Weight-Modell, Unternehmen können die Gewichte herunterladen und auf eigener Infrastruktur betreiben. Das beseitigt das Risiko der API-Übertragung, nicht aber Fragen zur Herkunft der Trainingsdaten und zu möglichen Ansprüchen aus destillationsbasiertem Training. Und ein Mixture-of-Experts-Modell mit 748 Milliarden Parametern selbst zu betreiben, setzt erhebliche Infrastruktur voraus.

Was DeepSeek trotzdem fehlt: Ökosystem, Breite und Profitabilität

Ein Spitzenplatz in einer Teilkategorie sagt noch nichts über das gesamte Kräfteverhältnis. Nur drei der fünfzehn Modelle in der LiveBench-Spitzengruppe vom 4. Oktober stammen aus China; die Zugewinne bleiben also an der Front konzentriert statt über das Feld verteilt. Der zweite Abstand betrifft die Integration: API-Ökosystem, Werkzeuge, Dokumentation und Unternehmenssupport sind bei Anthropic, OpenAI und Google deutlich reifer. Teams berichten von Reibung beim Zugang, bei Supportzeiten und bei der Einbindung in bestehende Cloud-Werkzeugketten. Solche versteckten Betriebskosten tauchen in keinem Benchmark auf.

Der dritte Punkt ist die Rentabilität. Lea rechnet damit, dass Chinas KI-Branche einschließlich DeepSeek bis 2030 unprofitabel bleiben könnte, während im Markt mehr als 1.100 konkurrierende große Sprachmodelle um Aufmerksamkeit ringen und führende Chatbots kostenlos bleiben. ByteDance‘ Doubao führt bei der Monetarisierung, DeepSeek positioniert sich eher als Infrastruktur- und Forschungsplattform. Ohne Konsolidierung und rationalere Preisbildung, so Lea, werde sich die Branche schwer auf eine tragfähige Gewinnbasis stellen lassen.

Exportkontrollen, Ascend 950 und der Entscheidungsrahmen für Enterprise-Teams

Die Drei-Prozent-Meldung fällt in einen Moment, in dem die US-Exportkontrollen für KI-Chips zunehmend hinterfragt werden. Die Kontrollen beruhten auf der Annahme, dass der eingeschränkte Zugang zu Nvidias Spitzenchips einen dauerhaften Hardwarevorsprung sichert. DeepSeek V4 Flash wurde für Huaweis Ascend-950-Prozessoren angepasst, einen heimischen Chip, der schwächer ist als Nvidias Spitzenhardware, aber für ein konkurrenzfähiges Frontier-Modell ausreichte. Nach dem Start von V4 im April 2026 sollen ByteDance, Tencent und Alibaba sich um Bestellungen für diesen Chip bemüht haben. Laut dem Halbleiter-Marktforschungsunternehmen Omdia stieg Chinas Selbstversorgung bei KI-Chips von unter zehn Prozent im Jahr 2020 auf 41 Prozent im Jahr 2025; im selben Zeitraum sank Nvidias Anteil am chinesischen Beschleunigermarkt deutlich. Die Investitionslücke bleibt derweil gewaltig: Der Stanford AI Index 2026 nennt für 2025 private KI-Investitionen von 285,9 Milliarden US-Dollar in den USA gegenüber 12,4 Milliarden in China. Der Abstand bei der Modellleistung hat sich aber nicht im selben Verhältnis entwickelt wie der bei den Investitionen.

TechTimes schlägt Entwicklungsteams deshalb eine Abwägung mit vier Teilen statt einer einzigen Zahl vor. Erstens die Leistung: V4.1 Flash ist im agentischen Coding der gemessene Spitzenreiter, und diesen Maßstab hält der Artikel für Softwareteams für den wirtschaftlich relevantesten. Zweitens die Verlässlichkeit: Die Führung stammt aus einer Plattform, die gegen Kontamination ausgelegt ist, ist aber nicht gegen gezielte Optimierung immun, und unabhängige Produktionstests fehlen bislang. Drittens die rechtliche Exposition, die sich nicht wegkonfigurieren lässt, solange die API genutzt wird. Viertens das Ökosystem, das den Alltagsbetrieb trägt oder eben nicht.

Konkret heißt das: Drei Prozent Lücke im Gesamtindex bedeuten keine Gleichwertigkeit bei der Aufgabe, die ein einzelnes Unternehmen tatsächlich fährt. Die Führung im agentischen Coding ist laut TechTimes der belastbarste Einzelbefund. Gerade beim Coding fließt allerdings Quellcode an die Schnittstelle, also genau die Art von Daten, für die die chinesischen Zugriffsregeln relevant sind. Wer heute entscheidet, sollte den Benchmark als Einstieg nehmen und die rechtliche Bedingung als Teil der Architektur behandeln, nicht als Fußnote. Selbst gehostete Gewichte lösen einen Teil des Problems. Die Herkunft der Trainingsdaten lösen sie nicht.

Quelle: techtimes.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 60
Relevanz 85
Hype 35
Einschätzung 75
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.