In einer Fertigungshalle entscheidet eine Kamera in zehn Millisekunden, ob ein Bauteil Ausschuss ist oder weiterläuft. Die Rechenleistung für diese Entscheidung steht in einem Rechenzentrum, mehrere hundert Kilometer entfernt. Bis das Werkstück die nächste Station erreicht, ist die Antwort längst veraltet. Zwischen Anforderung und Reaktion liegen dann keine Millisekunden, sondern Netzwerkstrecken, Warteschlangen und Jitter. Um dieses Problem geht es in einer Analyse, die Pankil Sheth am 14. September 2026 in Computer Weekly veröffentlicht hat, gestützt auf Einschätzungen von Gartner.
Seine These ist unbequem: Die Cloud-Architektur, die das vergangene Jahrzehnt der digitalen Transformation getragen hat, wird für agentische und echtzeitnahe KI-Anwendungen zum Bremsklotz. Cloudzentrische Rechenzentren wurden für Stapelverarbeitung gebaut, für Abläufe, in denen am Ende ein Mensch entscheidet. Kontinuierliche Inferenz in hoher Frequenz liefern sie nicht. Wer agentische Systeme skalieren will, muss sich mit Latenz, Bandbreitenkosten und Ausfallrisiken zentralisierter Netze auseinandersetzen.
Ein Bild aus der Biologie hilft weiter: Das Nervensystem eines Menschen arbeitet in zwei Ebenen. Der Reflex läuft im Rückenmark ab, ohne dass das Gehirn gefragt wird, weil Sekundenbruchteile darüber entscheiden, ob die Hand auf der heißen Herdplatte bleibt. Das bewusste Nachdenken passiert später und langsamer, im Gehirn, wo Zusammenhänge, Erinnerungen und Regeln zusammenkommen. Diese Arbeitsteilung beschreibt, was der Autor als Hybrid Edge-Cloud bezeichnet.
Was agentische Systeme von Chatbots unterscheidet
Der Unterschied liegt nicht in der Größe des Modells, sondern in der Rolle, die es im Betrieb spielt. Klassische generative KI erzeugt Inhalte: Text, Bilder, Zusammenfassungen. Ein agentisches System greift über Programmierschnittstellen auf Werkzeuge zu, holt Informationen aus Unternehmenssystemen und führt dort Änderungen aus. Sheth beschreibt das als Rollenwechsel der KI im Unternehmen: von passiver Inhaltserzeugung zu aktiver Teilnahme am Arbeitsablauf.
Für die Infrastruktur bedeutet das einen anderen Problemtyp. Ein Chatbot darf zwei Sekunden nachdenken, niemand stirbt daran. Ein Agent, der eine Maschine steuert, eine Zahlung prüft oder eine Lieferkette umleitet, arbeitet in einem Regelkreis. Regelkreise verzeihen keine Streuung. Es reicht nicht, dass die Antwort im Mittel schnell genug kommt. Sie muss jedes Mal schnell genug kommen, sonst ist das System nicht einsetzbar.
Damit verschieben sich die Anforderungen an Rechenleistung, Datenwege und Ausfallsicherheit. Die Fragen, die Infrastrukturverantwortliche nun beantworten müssen, lauten nicht mehr, wie viele Instanzen sich horizontal skalieren lassen, sondern wo eine Entscheidung physisch getroffen wird. Und wie weit die Daten dafür reisen müssen.
Latenz ist keine Optimierungsfrage, sondern Physik
Für agentische und echtzeitnahe KI-Anwendungen braucht es laut Sheth Antwortzeiten im Submillisekundenbereich, und eine rein cloudbasierte Architektur kann das nicht verlässlich liefern. Der Weg von einem Gerät zu einem weit entfernten Rechenzentrum und zurück ist zu lang, wenn Millisekunden darüber entscheiden, ob ein Ergebnis sauber ausfällt oder knapp danebengeht. Man kann Software clever bauen, aber man kann Licht nicht überreden.
Der Autor nennt konkrete Fälle, in denen Entscheidungsschleifen unter zehn Millisekunden bleiben müssen: Robotersteuerung in der Fabrikhalle, vorausschauende Wartung an Industrieanlagen, die kurz vor dem Ausfall stehen, Betrugserkennung, die eine Transaktion abfangen muss, bevor sie freigegeben wird. Das ist kein Benchmark für ein Datenblatt, sondern die Physik des Problems. Je weiter Daten reisen, desto länger dauert es und desto mehr kostet es.
Deshalb ist Edge Computing aus der Nische der Netzwerkspezialisten herausgetreten und in den Infrastrukturdebatten auf Vorstandsebene angekommen. Nicht weil ein Trend das verlangt, sondern weil reale Deployments an eine harte Grenze stoßen. In sicherheitskritischen Anwendungen in Fertigung, Gesundheitswesen und Industrieautomatisierung ist Latenz kein Ärgernis, sondern ein Risiko, das niemand verantworten möchte.
Organisationen, die weiterhin alles auf eine zentralisierte Cloud setzen, haben zwei Probleme gleichzeitig: Sie sind Ausfällen stärker ausgesetzt und ihre Kosten steigen. Ungünstig, wenn der Vorstand fragt, warum das KI-Programm nicht schneller skaliert.
Egress und Bandbreite: die Rechnung, die oft fehlt
Neben der Latenz steht ein ökonomisches Problem, das in vielen Budgetplanungen unterschätzt wird. Echtzeit-KI-Anwendungen mit Video- und Sprachanalyse oder hochfrequenten Sensorsignalen erzeugen einen Datenstrom, der nicht versiegt. Diese kontinuierlichen Massenströme zur Verarbeitung in eine zentrale Cloud zu schicken, ist bei Skalierung wirtschaftlich nicht tragfähig. Die Egress-Gebühren der Hyperscaler liegen im Durchschnitt zwischen 0,05 und 0,09 US-Dollar pro Gigabyte, und sie summieren sich schnell.
Gartner-Schätzungen zufolge können allein diese Gebühren bei datenintensiven Workloads zehn bis fünfzehn Prozent der gesamten Cloud-Ausgaben ausmachen. Der Autor rechnet ein Beispiel durch: Tausend hochauflösende Kameras mit jeweils fünf Megabit pro Sekunde erzeugen jährlich rund 54 Petabyte an Daten. Allein die Übertragungskosten dafür liegen bei geschätzten 4,6 Millionen US-Dollar pro Jahr.
Hier wird Edge Computing wirtschaftlich interessant. Wer Daten lokal verarbeitet, kann Rohströme filtern und nur relevante Metadaten oder kritische Ereignisse in die Cloud weitergeben. Das reduziert die nach oben übertragene Datenmenge um 60 bis 90 Prozent. Im Kamera-Beispiel sinken die jährlichen Egress-Kosten auf rund 1,38 Millionen US-Dollar, eine Ersparnis von mehr als 3,2 Millionen. Insgesamt, so die Einschätzung, sind durch die Verlagerung von KI-Workloads an den Rand bis zu 85 Prozent weniger Bandbreiten- und Betriebskosten möglich als bei einem reinen Cloud-Ansatz.
Hybrid Edge-Cloud: Die Cloud verliert nicht, sie bekommt eine neue Rolle
Die naheliegende Fehlinterpretation wäre, Edge Computing als Abschied von der Cloud zu lesen. Der Autor betont das Gegenteil: Das hybride Modell ersetzt die Cloud nicht, es definiert ihre Rolle neu. Edge und Cloud übernehmen jeweils die Aufgaben, für die sie am besten geeignet sind. Die Arbeit wird geteilt, nicht verlagert.
Am Rand laufen die unmittelbaren Echtzeit-Workloads: Wahrnehmung, Datenfilterung und die erste Entscheidung. Hier passiert die Inferenz unter zehn Millisekunden, hier kann das System sofort handeln. Die Cloud verarbeitet nicht mehr jeden einzelnen Rohdatenpunkt und ist für die weniger zeitkritischen, rechenintensiven Aufgaben reserviert: langfristiges Schlussfolgern, Koordination über viele Standorte hinweg, globale Richtlinienverwaltung und das Nachtrainieren der Modelle.
Dazu kommt ein Aspekt, der über Kosten und Tempo hinausgeht. Ein dezentrales Modell stärkt die digitale Souveränität und den Datenschutz, weil sensible Informationen in einer lokalen Umgebung bleiben. Das senkt regulatorische und geopolitische Risiken, was in Europa selten ein Nebensatz ist.
Ein Fahrplan für Infrastruktur- und Betriebsteams
Für Verantwortliche in IT-Infrastruktur und Betrieb skizziert der Autor einen strukturierten Weg. Der erste Schritt ist eine Bestandsaufnahme der bestehenden Infrastruktur, um latenzempfindliche Workloads zu identifizieren: Echtzeitanalytik, Entscheidungsmaschinen, Sprach- und Video-KI. Alles, was die Verzögerungen einer reinen Cloud-Verarbeitung nicht mehr tolerieren kann, wird zum priorisierten Kandidaten für eine Migration auf Edge-fähige Plattformen mit KI-Beschleunigern.
Der zweite Schritt ist ein Edge-First-Mandat für diese kritischen Anwendungen. Das bedeutet, Kosten- und Betriebsmodelle um eine dezentrale Vorverarbeitung herum neu zu entwerfen. Bevor das unternehmensweit ausgerollt wird, helfen Pilotprojekte, die tatsächlichen Einsparungen bei Übertragungskosten und Latenz zu messen. Erst wenn die Zahlen belastbar sind, sollte skaliert werden.
Der dritte Schritt ist der unspektakulärste und der am häufigsten unterschätzte: eine integrierte Governance über eine verteilte Umgebung hinweg. IT- und Betriebstechnik brauchen abgestimmte Betriebsmodelle, einheitliche Sicherheitsstandards und eine durchgängige Beobachtbarkeit. Ohne das wird aus einer verteilten Architektur schnell eine Sammlung von Inseln. Gartner schätzt, dass bis 2029 fünfzig Prozent der Unternehmen Edge Computing nutzen werden, nach zwanzig Prozent im Jahr 2024. Den Aufbau dieser Fähigkeiten aufzuschieben ist damit keine Option mehr.
Was das konkret bedeutet
Die Cloud verschwindet nicht, sie wandert nur aus dem Zentrum des Denkens an eine andere Stelle im System. Was bleibt, ist eine Verteilungsfrage, und die entscheidet sich nicht daran, welches Modell das beste ist, sondern daran, wo der Regelkreis geschlossen wird. Wer heute agentische KI plant, sollte deshalb früh klären, welche Entscheidungen in Millisekunden fallen müssen und welche Zeit haben, durchdacht zu werden.
Das Bild vom Nervensystem trägt hier weiter als jede Architekturzeichnung. Ein Organismus wird nicht dadurch schneller, dass man das Gehirn vergrößert. Er wird schneller, weil Reflexe dorthin wandern, wo die Reize ankommen, während das Gehirn sich um das kümmert, was Zusammenhang braucht. Diese Arbeitsteilung ist der praktische Kern der Hybrid-Edge-Cloud-Debatte.
Zum Schluss warnt Sheth: Organisationen, die ihre Infrastruktur nicht für KI modernisieren, riskieren nicht nur einen Wettbewerbsnachteil, sondern werden für KI-Anwendungen schlicht irrelevant. Das ist zugespitzt, aber die Richtung stimmt. Die Bandbreitenkosten, die Latenzgrenzen und die Ausfallrisiken zentralisierter Netze sind keine vorübergehenden Kinderkrankheiten. Es sind Eigenschaften der Architektur, und die lassen sich ändern, bevor sie zum Problem werden.
Quelle: computerweekly.com
