Kollaborative Planung mit Agenten: getrennte Welten, Grenzobjekte und dickere Schnittstellen

Satellitenschuessel und Antennenanlage als Silhouette vor tiefblauem Abendhimmel
Deine Reaktion:

Der Anthropologe Thomas Gladwin verbrachte zwischen den 1940er und den 1960er Jahren viel Zeit bei den Chuukesen auf den Atollen Mikronesiens und untersuchte, wie sie das offene Meer befahren – im Vergleich zur europäischen Navigation. Die Navigatoren, die er beobachtete, berechneten keinen Kurs und führten keine Karte mit. Sie lasen Dünung, Wind, Vögel und Strömung und korrigierten ihre Fahrt fortlaufend.

Der europäische Navigator beginnt jede Reise mit einem Plan. Er zeichnet eine Route aus Karten und allgemeinen Prinzipien, verlegt so viel Denken wie möglich nach vorn und vergleicht auf See jede Bewegung mit diesem Plan. Weicht er ab, korrigiert er zurück oder überarbeitet den Plan. Die Chuukesen halten nur ein Ziel fest und improvisieren den Weg dorthin, Schritt für Schritt, je nach Bedingung.

Die Anthropologin Lucy Suchman griff dieses Beispiel 1987 in ihrem Buch über Planung und Kommunikation mit Maschinen auf. Ihr ging es nicht darum, wer besser navigiert, sondern darum, was ein Plan leisten kann und was nicht. Ihre These: Der Plan ist eine schwache Ressource für das, was tatsächlich getan wird.

Das klingt nach Wissenschaftsgeschichte. Es beschreibt aber ein Problem, das gerade wieder aktuell ist. Wer Planung an KI-Agenten übergibt, plant wie ein europäischer Navigator für eine Reise, die jemand anderes antritt. Wir schreiben die Route auf, der Agent fährt los, und wir sind nicht an Bord.

Situiertes Handeln: Was Suchmans Kopierer-Studie zeigt

Suchman arbeitete in den 1980er und 1990er Jahren bei Xerox PARC und untersuchte, wie Menschen und Maschinen miteinander umgehen. In einer berühmten Studie filmte sie zwei promovierte Forscher an einem Kopierer mit eingebautem „intelligenten Expertenhilfesystem“ – primitive KI nach heutigem Maßstab. Die beiden befolgten die Anweisungen und scheiterten trotzdem.

Das Interessante war nicht das Scheitern der Schnittstelle, sondern was beide Seiten voneinander mitbekamen. Der Kopierer bekam nur mit, welche Tasten gedrückt wurden und wann jemand das Papierfach öffnete. Er sah nicht, dass die Forscher zögerten, debattierten, in der Anleitung blätterten, gestikulierten und ihre Erwartungen laut aussprachen. Umgekehrt sahen die Menschen nur die Meldungen auf dem Display, nicht den inneren Zustand des Programms. Suchman beschrieb das als zwei Seiten, die durch ein Schlüsselloch aufeinander blicken.

Mit heutigen Agenten ist es ähnlich, auch wenn moderne Oberflächen mit Tasten und kleinen Displays nichts mehr zu tun haben. Menschen leben in einer Welt des Körpers, des Raums, der Farben, Gesten, Stimmen und sozialen Regeln. Agenten leben in einer Welt aus Vektoren, Gewichten, Belohnungen und Wahrscheinlichkeiten. Beide Welten sind reich, aber keine ist der anderen vollständig lesbar, und die Interpretierbarkeit von Modellen ist bis heute ungelöst.

Wie Planung mit KI-Agenten heute abläuft

Ein Referent, der als Designer und Entwickler in der Forschungsabteilung von GitHub arbeitet, beschreibt den heutigen Ablauf als zäh. Man startet allein im Terminal oder in einer Desktop-Anwendung, oft in einem Plan-Modus oder mit einer Fähigkeit, die einen gezielt ausfragt. Dann beantwortet man vierzig Multiple-Choice-Fragen und wird irgendwo bei Frage acht müde. Ab da wählt man die empfohlene Option.

Das passiert nicht aus Faulheit. Häufig verlangt die Frage etwas, wofür die Oberfläche keine Denkwerkzeuge bereitstellt, oder sie liegt außerhalb des eigenen Wissens. In einem Textfeld mit Ja-Nein-Auswahl lässt sich Komplexität nicht sauber durchdenken. Also klickt man weiter.

Am Ende steht eine Wand aus Markdown und die Frage: Plan genehmigen, ja oder nein? Direkt bearbeiten lässt sich der Plan nicht. Offene Fragen bleiben offen, obwohl sie durch den Fragenkatalog gegangen sind, und es gibt keine Möglichkeit, an einer Stelle anzuhalten, tiefer zu graben, recherchieren zu lassen oder einen Prototyp zu bauen. Es fehlt jedes Tempo, jede Pause, jede Schleife.

Das Ergebnis hat etwas Endgültiges: Was einmal entschieden ist, behandelt der Agent, als wäre es in Stein gemeißelt. Und der ganze Vorgang ist merkwürdig privat. Kolleginnen und Kollegen planen parallel, jede für sich, ohne die Arbeit der anderen zu sehen, ohne Kommentar, ohne Widerspruch, ohne Debatte. Das ist kein ausgereifter Prozess.

Der Planer reist nicht mit

Das erste Problem ist der europäische Blick: Wir schreiben einen Plan für eine imaginäre Reise durch eine Codebasis und eine Laufzeitumgebung. Wir versuchen, die beste Route zu bestimmen, bevor wir der Realität begegnen. In der Softwareentwicklung besteht diese Realität meistens aus Komplexität, und die lässt sich nicht vorab wegplanen.

Der Haken: Planer und Reisender sind nicht dasselbe Wesen. Alle wichtigen Entscheidungen müssen vorab fallen, weil der Agent allein loszieht. Unterwegs muss er situiert handeln und Ad-hoc-Entscheidungen treffen, ohne dass ein Mensch danebensteht und bei Ermessensfragen eingreift. Damit das Ergebnis brauchbar wird, müssen Absicht und Wunsch des Menschen sehr genau zu dem passen, was der Agent unterwegs tatsächlich tut.

Genau deshalb ist es so teuer, diese Passung erst am Ende zu prüfen. Wer einen Plan freigibt, gibt implizit auch all jene Entscheidungen frei, die später unterwegs fallen, ohne sie je gesehen zu haben. Zwischen Plan und Handlung klafft eine Lücke, die heute niemand überbrückt.

240 Wörter gegen 4500: Text als Engstelle

Das zweite Problem ist das Medium. Planung mit KI-Agenten besteht heute fast ausschließlich aus Textwänden in beide Richtungen. Menschen lesen im Schnitt etwa 240 Wörter pro Minute; ein Agent produziert in derselben Zeit grob 4500. Das ist das Neunzehnfache dessen, was wir aufnehmen können.

Die Folge: Wir werden müde, wir überfliegen, wir übersehen Details. Viele Berichte über Erschöpfung bei der Arbeit mit Agenten haben hier ihre Ursache. Man trifft den ganzen Tag schwierige Entscheidungen in einer Umgebung, die für konzentriertes Denken schlecht gebaut ist.

Dabei können Agenten längst mehr als Text verarbeiten: Bilder, Audio, Video. Trotzdem bleibt die Sprache der dominante Kanal, und Sprache bildet menschliches Wissen nur teilweise ab. Deshalb arbeiten viele daran, Agenten Weltmodelle beizubringen. Bis das gelöst ist, bleibt die Aufgabe, Absicht, Entscheidungen und Fachwissen in ein System zu übersetzen, das die Welt durch eine sehr fremde, sprachzentrierte Brille sieht.

Grenzobjekte und dickere Schnittstellen

Wenn zwei Welten sich nicht vollständig verstehen, braucht man Artefakte, die in beiden funktionieren. In der Soziologie heißen sie Boundary Objects, Grenzobjekte: Dinge, die von verschiedenen Seiten unterschiedlich gelesen werden können und trotzdem eine gemeinsame Arbeit tragen. Ein guter Plan wäre so ein Grenzobjekt. Der heutige ist es nicht, weil er nur in eine Richtung lesbar ist und danach erstarrt.

Es fehlen dickere Schnittstellen. Der Referent beschreibt sein Wunschbild als persönliche Szene: ein Whiteboard, Kollegen, Reden, Zeigen, Zeichnen, Blicke, Stille, Unruhe, mehrere aufgeklappte Laptops mit Prototypen, Projektionen an der Wand. Ein guter menschlicher Denkraum. Agenten verstehen davon fast nichts, weil ihnen schlicht die Eingaben fehlen.

Eine Antwort wären Kameras, Mikrofone und Sensoren: Agenten, die Hände sehen, Blickrichtung verfolgen und am Whiteboard mitlaufen. Das ist ein alter Traum des Ubiquitous Computing, und es gibt viele Gründe, warum er nicht eingelöst ist: Kosten, Datenschutz, Aufwand, mangelnde Reife.

Eine kleinere, näher liegende Variante: ein Videocall mit einer Kollegin, bei dem Agenten mitsehen und mithören. Sie nehmen Blick, Mimik und Gesten wahr, verfolgen, was auf den Bildschirmen passiert, und müssen nicht gefragt werden, ob ihre Ergebnisse taugen. Sie merken es und können innehalten, umlenken oder nachbessern. Das ist noch nicht perfekt, aber in wenigen Jahren vorstellbar.

Was das konkret bedeutet

Die Lehre ist nicht, dass Planen sinnlos wäre. Suchmans Punkt war präziser: Der Plan ist eine Ressource für die Handlung, kein Skript, das sie ersetzt. Wer kollaborative Planung mit Agenten ernst nehmen will, muss drei Dinge klären. Erstens: Planartefakte müssen bearbeitbar, kommentierbar, versioniert und für das Team sichtbar sein, also echte Grenzobjekte statt Freigabeschleifen. Zweitens: Schnittstellen müssen mehr tragen als Text, sonst bleibt die Mensch-Agent-Zusammenarbeit eine Abfolge von Textwänden. Drittens: Tempo und Unsicherheit brauchen einen Platz.

Ein Agent, der offene Fragen offenlegen darf, und ein Mensch, der langsamer werden darf, sind mehr wert als ein Fragenkatalog, der in vierzig Schritten zur Scheinentscheidung führt. Wer Planung und Kommunikation mit KI-Agenten einführt, sollte deshalb nicht nur auf den Plan schauen, sondern auf die Umgebung, in der er entsteht. Die entscheidet darüber, ob aus situiertem Handeln etwas Brauchbares wird oder nur eine sauber formatierte Wand aus Markdown.

Die Informatik hat sich angewöhnt, Theorie aus den achtziger und neunziger Jahren für erledigt zu halten, weil sich Technik schnell ändert. Die Beispiele von Gladwin und Suchman zeigen das Gegenteil. Solange Mensch und Agent durch ein Schlüsselloch aufeinander blicken, entscheidet nicht das Modell über die Qualität der Planung, sondern die Schnittstelle dazwischen.

Quelle: maggieappleton.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 82
Relevanz 75
Hype 20
Einschätzung 78
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.