Warum GPU Preise steigen, während die KI-Kosten fallen

Makroaufnahme einer Platine mit Mikrochip und leuchtenden Kupferleiterbahnen
Deine Reaktion:

Eine gemietete B200-Stunde kostet heute 8,08 Dollar statt 4,40 wie vor sechs Monaten. Der Index für GPU-Mieten pro Stunde hat sich damit in einem halben Jahr fast verdoppelt; die Lücke in der Datenreihe bleibt im Chart gestrichelt. Das passt schlecht zu der Beobachtung, dass KI im selben Zeitraum deutlich billiger geworden ist. Wer heute ein Modell betreibt, zahlt für vergleichbare Leistung oft nur einen Bruchteil dessen, was vor achtzehn Monaten fällig war.

Um den Widerspruch zu verstehen, hilft ein Bild: Die GPU-Stunde ist eine Wohnung. Das Rechenzentrum ist das Haus, in dem sie liegt, das Stromnetz das Bauland, auf dem überhaupt gebaut werden kann. Die Möbel werden jedes Jahr billiger und besser, das ist die KI-Effizienz. Nur nützt dir das wenig, wenn das Bauland knapp wird und der Bauherr für Beton, Kupfer und Kredite mehr zahlen muss. Genau das beschreibt die Lage gerade, und es erklärt, warum GPU-Preise und KI-Kosten auseinanderlaufen können, ohne dass eine der beiden Zahlen falsch wäre.

Warum die GPU-Preise trotz sinkender KI-Kosten steigen

Zwei Kurven laufen derzeit in entgegengesetzte Richtungen. Die eine ist der Mietpreis: Wer heute eine B200-Stunde bucht, zahlt im Schnitt 8,08 Dollar, sechs Monate zuvor waren es 4,40. Die andere ist der Preis für das, was auf dieser Hardware entsteht. Ein Benchmark-Schwellenwert, für den vor achtzehn Monaten noch 0,55 Dollar fällig wurden, kostet heute 0,0015 Dollar. Ein Rückgang um den Faktor 377. Beide Zahlen gelten gleichzeitig, und beide beschreiben dieselbe Branche.

Der naheliegende Reflex ist, eine davon für falsch zu halten. Tatsächlich messen sie zwei verschiedene Dinge. Der GPU-Preis ist ein Inputpreis, er sagt, was der Rohstoff kostet. Die KI-Kosten sind ein Output-Preis, sie sagen, was ein fertiges Ergebnis kostet. Zwischen beiden liegt die Effizienz, und die verändert sich gerade schneller als alles andere. Übertragen auf das Bild von vorhin: Die Miete pro Quadratmeter steigt, während du auf derselben Fläche immer mehr Menschen unterbringst. Beides kann stimmen.

Strom als Engpass beim Rechenzentrum Ausbau

Die Analyse nennt eine Reihe von Kostentreibern, und sie haben eines gemeinsam: Sie betreffen alle denselben Bau. Beton, Kupfer, Silizium, Kredite, jede dieser Zutaten wird teurer, während gleichzeitig mehr davon gebraucht wird. Ein Rechenzentrum ist heute weniger ein Softwareprojekt als ein Schwerindustrieprojekt mit Serverrack. Wer zwanzig Megawatt Anschlussleistung braucht, verhandelt mit Netzbetreibern, Bauunternehmen und Banken gleichzeitig. Jede dieser Parteien hat gerade ihre Preise angepasst.

Der härteste Engpass ist der Strom. Oracle hat für seinen Standort in New Mexico höhere Gewalt geltend gemacht, weil die Erdgasleitung, die ihn versorgen soll, um sechs Monate nach hinten gerutscht ist. Ein Unternehmen erklärt einen Vertrag für nicht erfüllbar, und der Auslöser ist eine Pipeline. Der Stromverbrauch von Rechenzentren ist damit nicht mehr nur eine Kostenfrage, sondern eine Frage der Verfügbarkeit. Wer keinen Strom hat, hat keine GPU-Stunden zu verkaufen, egal wie gut die Nachfrage ist.

Warum der Kapitalmarkt seine alten Regeln umgedreht hat

Normalerweise gilt: Steigen die Zinsen, sinken die Bewertungen von Technologieunternehmen. Über die lange Geschichte gemessen ist die Korrelation zwischen dem Zehnjahreszins und dem NASDAQ klar negativ, sie liegt bei etwa minus 0,50. In den vergangenen zwei Jahren hat sie sich auf plus 0,39 gedreht. Der Zins ist im selben Zeitraum von 3,63 Prozent auf 5,18 Prozent gestiegen, während der NASDAQ um rund 78 Prozent zugelegt hat. Der 10-Year Treasury war historisch der beste einzelne Prädiktor für Tech-Bewertungen, und genau dieser Zusammenhang ist gerade außer Kraft.

Der Markt bepreist Technologie also nicht mehr über die Kosten des Geldes, sondern über die Wachstumsrechnung. Solange Inferenz- und Modellfirmen Rekordwachstum melden, fließt Kapital, und dieses Kapital bietet wiederum auf dieselben knappen GPU-Stunden. Der Autor der Analyse beschreibt das als Schwungrad: mehr Nachfrage, höhere Bewertungen, mehr Kapital, höhere Gebote, mehr Umsatz. Ein Schwungrad hat keine eingebaute Bremse. Es beschleunigt, bis etwas anderes es stoppt, und dieses Etwas ist in der Regel kein Modell, sondern ein physisches Limit.

KI Effizienz: wie KI günstiger wird, während GPUs teurer werden

Auf der anderen Seite steht eine Verbesserung, die man nicht unterschätzen sollte. Ein aktuelles Modell soll laut der Analyse rund 40 Prozent günstiger im Betrieb sein als sein Vorgänger. Ein anderes Modell wurde im Juli um 80 Prozent im Preis gesenkt, im September noch einmal um 50 Prozent. Solche Sprünge kommen nicht allein aus besserer Hardware, sondern aus dem, was der Autor Margin-Innovation nennt: besseres Batching, klügere Zwischenspeicherung, kleinere Modelle für einfachere Aufgaben.

Die Effizienz ist dabei nicht gleichmäßig über alle Modellgrößen verteilt. Microsoft gibt an, pro GPU und Jahr 90 Prozent mehr Token zu erzeugen als zuvor, und konzentriert diesen Zuwachs auf die kleineren Modelle. Das zeigt, wohin die Rechenlast tatsächlich wandert: nicht immer in das größte Modell, sondern in viele kleine, spezialisierte. Für dich als Anwender bedeutet das, dass die Wahl des Modells mittlerweile genauso viel über deine Inferenz-Kosten entscheidet wie die Wahl des Anbieters. Die Effizienzgewinne sind real, sie fallen nur nicht dort an, wo die Rechnung am lautesten ist.

Bruttogewinn pro GPU-Stunde als Kennzahl

Wenn eine Seite teurer und die andere billiger wird, braucht man einen Maßstab, der beides zusammenführt. Die Analyse nennt ihn selbst: Bruttogewinn pro GPU-Stunde. Nicht der Preis der GPU, nicht der Preis des Tokens, sondern die Differenz zwischen beidem, gerechnet auf die Stunde. Diese Kennzahl zwingt dazu, beide Kurven zu berücksichtigen. Steigen die Mieten schneller als die Effizienz, sinkt sie. Steigt die Effizienz schneller, wächst sie, und rechtfertigt damit die hohen Bewertungen.

Nach derzeitigem Stand laufen beide Kurven ungefähr gleich schnell. Die Mietpreise haben sich in sechs Monaten fast verdoppelt, die Effizienz pro GPU hat im Jahresvergleich um 90 Prozent zugelegt. Das ist kein Gleichgewicht, das beruhigt, sondern eines, das gerade so hält. Wenn eine der beiden Seiten für zwei Quartale aussetzt, weil eine Pipeline fehlt, weil ein Netzanschluss nicht kommt oder weil eine Modellgeneration keinen Effizienzsprung bringt, kippt die Rechnung sofort in eine Richtung. Der Bruttogewinn pro GPU-Stunde ist damit weniger eine Kennzahl für Investoren als ein Frühwarnsystem für alle, die diese Stunden mieten.

GPU Mietpreise pro Stunde B200: was das für Käufer bedeutet

Für dich als Käufer von GPU-Stunden ergibt sich daraus eine unbequeme Lage. Du kannst nicht darauf warten, dass die Preise von selbst fallen, nur weil überall von sinkenden KI-Kosten die Rede ist. Die beiden Dinge hängen zusammen, aber nicht direkt. Sinkende KI-Kosten entstehen aus Effizienz, steigende GPU-Preise aus Knappheit. Und Knappheit löst sich nicht durch bessere Software, sondern durch mehr Strom, mehr Kupfer und mehr Baugenehmigungen. Der Rechenzentrum Ausbau ist der langsamste Teil des Systems, und er bestimmt das Tempo.

Praktisch heißt das: Plane Inferenz-Kosten und Hardwarekosten getrennt, statt sie in einer Zahl zu verrechnen. Rechne nicht damit, dass ein günstigeres Modell automatisch günstigeres Rechnen bedeutet, wenn du dafür mehr Kapazität brauchst. Und behalte den Bruttogewinn pro GPU-Stunde im Blick, nicht weil du ihn selbst erwirtschaftest, sondern weil er dir zeigt, wie viel Luft die Anbieter noch haben, bevor sie Preise weitergeben. Solange diese Kennzahl stabil bleibt, bleibt der Markt ruhig. Wird sie dünn, wird es für alle teurer, auch für die, die nur ein paar Stunden im Monat mieten.

Zwei Kräfte ziehen gerade gleich stark in entgegengesetzte Richtungen, und die Mietpreise sind derzeit der sichtbarere Teil. Ob das so bleibt, hängt weniger an der nächsten Modellgeneration als an Leitungen, die verlegt werden müssen, und an Genehmigungen, die jemand unterschreiben muss. Die GPU-Stunde bleibt vorerst eine knappe Wohnung in einem Haus, das noch gebaut wird.

Quelle: tomtunguz.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 70
Relevanz 82
Hype 28
Einschätzung 76
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.