DeepSeek baut für Huawei Ascend: Warum die Software der eigentliche Engpass ist

Abstrakter Strom aus Lichtpartikeln und Datenstroemen im tiefdunklen Raum
Deine Reaktion:

Wer über KI in China schreibt, redet meist über Hardware: Es fehlen die GPUs, also fehlt die Rechenleistung. DeepSeeks Ankündigung auf dem chinesischen WeChat-Kanal verschiebt diese Diagnose. Der Engpass liegt nicht allein darin, ob ein Chip rechnen kann, sondern darin, ob ihn jemand dazu bringt, das Richtige zu rechnen – ohne monatelange Handarbeit. Diese Schicht baut DeepSeek jetzt, für Huawei Ascend.

Für alle, die beruflich mit KI-Modellen arbeiten, ist das die wichtigere Nachricht. Die Frage lautet längst nicht mehr, ob chinesische Chips grundsätzlich funktionieren. Sie lautet, ob man mit ihnen so arbeiten kann wie mit NVIDIA-Hardware: mit vertrauten Werkzeugen, nachvollziehbarer Performance, ohne dass jedes neue Modell eine eigene Forschungsabteilung braucht. DeepSeek liefert dazu einen ersten konkreten Baustein.

Am besten passt hier eine Analogie. Ein Chip ist wie ein Mensch, der nur eine bestimmte Sprache spricht. Das Problem ist nicht, dass er nicht sprechen könnte. Das Problem ist, dass niemand seine Sprache gelernt hat und es kein brauchbares Wörterbuch gibt.

Was DeepSeek als Open Source veröffentlicht hat

Die Ankündigung ist kurz – im Kern eine Liste. DeepSeek hat grundlegende Infrastruktur-Komponenten für Huaweis Ascend-Plattform als Open Source freigegeben: eine höhere Programmiersprache samt Compiler-Kette, Rechenbibliotheken und Bibliotheken für die verteilte Kommunikation. Zu jedem Baustein gibt es ein Gegenstück aus dem, was das Unternehmen zuvor für NVIDIA-Plattformen veröffentlicht hatte.

Konkret umfasst das Paket TileLang als Sprach- und Compiler-Schicht, DeepGEMM für die Matrixoperationen im Zentrum jeder Berechnung großer Modelle, DeepEP für die Kommunikation zwischen vielen Chips, TileKernels für Vektoroperationen und Speicherzugriffe, FlashMLA für die Aufmerksamkeitsberechnung bei langen Kontexten und DeepSelect für die Datenauswahl. Das ist keine Demo-Sammlung, sondern die Werkzeugkiste, mit der DeepSeek selbst arbeitet.

All das ist offen zugänglich. Wer heute KI-Modelle auf chinesischen Chips trainieren will, muss nicht bei Null anfangen und nicht auf eine Freigabe warten. Die Repositories liegen auf GitHub, die Community kann sie lesen, nutzen und verändern. Genau das macht den Unterschied.

TileLang und der Übersetzer zwischen Modell und Chip

TileLang ist der interessanteste Teil. Es ist eine höhere Programmiersprache mit Compiler-Kette, die die darunterliegenden Ascend-C-Instruktionen kapselt und eine lesbare Schnittstelle anbietet, ohne dabei Leistung zu verschenken. Der Anspruch: schreiben wie in einer Hochsprache, ausgeführt werden wie handoptimierter Code.

Wichtiger ist ein anderer Satz. DeepSeek schreibt, dass der Großteil der Operatoren, die beim Training der V4-Modellfamilie zum Einsatz kommen, inzwischen in TileLang implementiert ist – und dass jeder dieser Operatoren eine leistungsfähige Entsprechung auf Ascend hat. Damit wird aus einem Bekenntnis praktische Portabilität.

Zurück zur Sprache: Wer einen Text in einer einzigen, gut gepflegten Sprache schreibt, hängt von einem einzigen Verlag ab. TileLang wirkt hier wie eine Übersetzungsschicht, die denselben Quelltext für zwei Leser verständlich macht – den einen auf NVIDIA-Hardware, den anderen auf Huawei Ascend. Der Quelltext bleibt derselbe, nur das Ziel ändert sich.

Warum CUDA mehr ist als eine Bibliothek

NVIDIAs Vorsprung beim Training großer Modelle beruhte nie allein auf den GPUs. Er beruht auf dem, was darüber liegt: CUDA und die vielen Bibliotheken, Profiler, Debugger und Erfahrungswerte, die sich über Jahre angesammelt haben. Wer heute ein Modell trainiert, greift auf ein Software-Ökosystem zurück, in dem fast jedes Problem schon einmal gelöst und dokumentiert wurde.

Diese Software ist der schwierige Teil. Eine Alternative zu CUDA zu bauen heißt nicht, eine Bibliothek nachzuprogrammieren. Es heißt, hunderte kleine Werkzeuge, Konventionen und Fehlermeldungen so nachzubauen, dass Entwickler ihre Arbeit wiedererkennen. Deshalb war Ascend lange gute Hardware mit dünner Werkzeuglage: Rechnen konnte der Chip, aber das Drumherum kostete zu viel Zeit.

Diese Lücke adressiert DeepSeek. Nicht mit einem großen Wurf, sondern mit mühsamer Grundlagenarbeit an der untersten Ebene: Operatoren, Kommunikation, Speicherzugriff. Diese Arbeit klingt in keiner Pressemitteilung spektakulär, entscheidet aber darüber, ob eine Plattform im Alltag benutzbar ist.

Was die gemessenen Werte aussagen – und was nicht

DeepSeek formuliert vorsichtig: In einer Reihe wichtiger Testfälle näherten sich Rechen- und Kommunikationsleistung der Komponenten bereits den Grenzen der Hardware selbst. Das ist eine starke Aussage, sie kommt aber aus dem Haus, das die Komponenten gebaut hat. Unabhängige Messungen, offengelegte Testfälle und nachvollziehbare Vergleiche fehlen bislang.

Diese Einschränkung sollte man nennen. Bei Performance-Angaben entscheidet die Auswahl der Testfälle darüber, welches Bild entsteht. Interessant wird es, wenn Dritte dieselben Bibliotheken nehmen und ihre eigenen Modelle darauf laufen lassen. Dann zeigt sich, ob die Nähe zur Hardwaregrenze dauerhaft ist oder das Ergebnis ausgewählter Beispiele.

Trotzdem bleibt ein Signal: Die Richtung stimmt. Es geht nicht mehr um die Frage, ob auf chinesischen Chips überhaupt trainiert werden kann, sondern darum, wie viel Aufwand das im Vergleich zur Alternative kostet.

Huawei und DeepSeek arbeiten am 128-Karten-Superknoten

Ein zweiter Punkt: DeepSeek macht klar, dass diese Arbeit nicht allein entstanden ist. Huaweis Team war eng beteiligt, und beide Seiten arbeiten gemeinsam an einem Superknoten mit 128 Karten auf Basis des Ascend 950, inklusive tiefer Optimierung von Rechenleistung und Kommunikation zwischen den Chips. Huawei selbst hatte erst Mitte September den Start seines nächsten Chips Ascend 960DT vorgezogen.

Das ist wichtiger, als es klingt. Beim Training großer Modelle ist selten der einzelne Chip der Engpass, sondern das Gespräch zwischen den Chips. Hunderte oder tausende Beschleuniger müssen Daten austauschen, und jede Verzögerung summiert sich über Wochen zu einem erheblichen Anteil der Rechenzeit. Ein Superknoten ist der Versuch, diese Gespräche zu beschleunigen, indem man die Wege zwischen den Karten kurz und schnell hält.

Die Nachricht ist damit keine Einbahnstraße. Es ist nicht der Satz, DeepSeek unterstütze jetzt Huawei-Chips. Es sind zwei Firmen, die gemeinsam am schwierigen Teil arbeiten: Rechen- und Kommunikationspfade so aufeinander abzustimmen, dass eine Plattform für Grenzmodelle taugt.

Was das konkret bedeutet

Wer daraus ableitet, Huawei Ascend statt NVIDIA-GPU sei eine reine Frage des Umstellens, wird enttäuscht. Portabilität entsteht nicht an einem Tag, und die Werkzeuge von DeepSeek sind eine Grundlage, kein fertiges Produkt. Sie senken den Aufwand, ein vorhandenes Modell auf eine andere Plattform zu bringen – aufheben können sie ihn nicht.

Der praktische Gewinn liegt tiefer, ist aber erheblich: Der Wechsel zwischen Plattformen wird billiger. Wenn derselbe Entwicklungsansatz über NVIDIA-GPUs und über Ascend-Chips liegen kann, sinken die Kosten des Umzugs, und die Abhängigkeit von einem einzigen Anbieter wird kleiner. Für chinesische Unternehmen ist das kein theoretisches Argument, sondern ein sehr konkretes.

Für die breitere Landschaft heißt das: Ein Software-Ökosystem um KI-Chips entsteht nicht länger nur dort, wo der Marktführer sitzt. Open Source ist hier der entscheidende Hebel. Wenn die Werkzeuge offen liegen, kann eine Community Fehler finden, Erweiterungen schreiben und Anwendungsfälle beisteuern, die ein einzelnes Unternehmen nie abdeckt.

Eine kurze Ankündigung auf WeChat verändert keinen Markt. Sie markiert aber einen Punkt, an dem aus einem Hardware-Argument langsam ein Software-Argument wird – und genau dort wurden in der Vergangenheit die meisten Chip-Offensiven entschieden. Wer sehen will, wie ernst die chinesische KI-Industrie ihren eigenen Weg nimmt, sollte weniger auf Datenblätter schauen und mehr in die Repositories.

Quelle: geopolitechs.org

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 55
Relevanz 72
Hype 32
Einschätzung 70
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.