61 Prozent. So oft stimmte die Rangfolge, die ein KI-Agent nach einem kurzen Gespräch über Lesevorlieben vorschlug, mit der überein, die der Mensch selbst gewählt hatte. Reines Raten hätte 50 Prozent ergeben.
Die Zahl stammt aus „Project Swap“, einem Experiment, das Anthropic in einem längeren Bericht beschreibt. 201 Anthropic-Mitarbeitende aus sechs Büros brachten jeweils ein Buch mit, das sie abgeben wollten. Ein von Claude gesteuerter Agent ging für sie auf einen digitalen Handelssaal. Dort sollten die Agenten so lange untereinander tauschen, bis möglichst jede Person ein Sommerbuch hatte, das zu ihr passt. Der Aufbau erinnert an eine Modellbahn: zu klein für echten Personenverkehr, aber groß genug, um Weichen, Signale und Zusammenstöße unter kontrollierten Bedingungen zu beobachten.
Darum geht es, wenn KI-Agenten für uns handeln. Nicht darum, ob ein Modell eine Bestellung auslösen kann, sondern darum, was passiert, wenn autonome Agenten in einem Marktplatz im Namen ihrer Nutzer verhandeln. Project Swap ist die zweite Untersuchung dieser Art; der Vorgänger „Project Deal“ ließ Agenten eine Woche lang reale Gegenstände kaufen und verkaufen. Damals ließ sich kaum sagen, wie gut die Ergebnisse hätten sein können, weil Ping-Pong-Bälle und Snowboards schwer zu vergleichen sind. Diesmal ist der Markt bewusst einfach gehalten – und dadurch messbar.
Warum so viele Deals nie zustande kommen
Das Team beginnt seinen Bericht mit einer Beobachtung aus dem Alltag: Viele Tauschgeschäfte, die alle Beteiligten besser stellen würden, kommen nie zustande, weil Suche und Verhandlung zu viel Zeit kosten. Ein Patient bricht eine Behandlung ab, weil ihm eine Klinik zu teuer erscheint – obwohl eine andere deutlich weniger verlangt oder dieselbe Klinik auf Nachfrage den Preis gesenkt hätte. Ähnlich bei der Jobsuche: Irgendwo gibt es eine passendere Stelle und einen Arbeitgeber, der sich über die Bewerbung freuen würde, nur finden beide Seiten nicht zueinander.
Das gilt auch für kleinere Dinge. Schichttausch im Betrieb, Fahrgemeinschaften, die abwechselnde Übernahme des Schulwegs – überall liegen Deals herum, die niemand einsammelt, weil ständiges Suchen und Feilschen nicht in einen normalen Arbeitstag passt. In all diesen Fällen fehlt keine Zahlungsbereitschaft, sondern jemand, der rund um die Uhr sucht, verhandelt und Angebote abgleicht.
Ein Agent könnte genau das leisten. Ob er es tut, hängt an Fragen, für die es noch keine belastbaren Antworten gibt. Versteht ein Agent überhaupt, was sein Nutzer will? Und wenn viele Agenten aufeinandertreffen, braucht es jemanden, der die Marktregeln für KI-Agenten und Märkte festlegt – wer darf mitmachen, was passiert bei einem geplatzten Deal. Je häufiger Agenten in echte Märkte geschickt werden, desto dringlicher werden diese Fragen.
Zentrale Clearingstelle oder direkte Verhandlung
Ein Markt lässt sich auf zwei Weisen organisieren. In einem zentralen Markt teilen alle einer einzigen Instanz mit, was sie wollen, und diese Instanz rechnet die besten Tauschgeschäfte aus. Ökonomen kennen das Verfahren seit Langem. Das praktische Problem ist die Mühe der Beschreibung: Eine Café-Leiterin könnte den optimalen Dienstplan für 20 Mitarbeitende errechnen lassen, wenn jede Person genau auflisten würde, was ihr jeder einzelne Dienst im Verhältnis zu jedem anderen wert ist – ob zwei Samstagmorgen einen Freitagabend aufwiegen, ob ein spätes Ende akzeptabel ist, solange am nächsten Morgen keine Öffnung folgt.
Niemand stellt solche Tabellen freiwillig auf. Wenn ein Agent Vorlieben aus einem lockeren Gespräch ableiten kann, werden Märkte machbar, die zentral schlicht zu teuer waren. Ein zentraler Markt braucht aber jemanden, der ihn betreibt – eine Clearingstelle –, und die Teilnehmenden müssen dieser Instanz ihre Informationen anvertrauen und ihre Entscheidungen akzeptieren. Oft gibt es eine solche Stelle nicht, oder man möchte ihr nicht alles erzählen: Wer eine neue Stelle sucht, will vielleicht nicht, dass eine zentrale Vermittlung davon erfährt, und schon gar nicht, wonach genau gesucht wird.
Dann bleibt der dezentrale Weg: Menschen und Agenten finden einander direkt und verhandeln. Darin liegt die Chance autonomer Agenten – sie senken den Aufwand für Suche und Verhandlung. Dass diese Hilfe wertvoll ist, zeigt der Markt bereits: Immobilienmakler, Headhunter und Heiratsvermittler verdienen ihr Geld genau damit. Weil echte Menschen dafür ihre knappe Aufmerksamkeit stundenlang einsetzen, bleibt diese Dienstleistung teuer und denen vorbehalten, die sie sich leisten können. Die Aufmerksamkeit eines Agenten ist deutlich weniger knapp.
Wie das Experiment aufgebaut war
Die 201 Teilnehmenden verteilten sich auf sechs lokale Gruppen in San Francisco, New York, London, Seattle, Washington und Dublin. Die Gruppen reichten von drei Personen in Dublin bis zu 115 in San Francisco; die Dubliner Gruppe wurde wegen ihrer Größe aus den meisten Auswertungen herausgenommen. Jede Person brachte ein Buch mit, das sie abgeben wollte, und führte anschließend ein kurzes, halbstrukturiertes Gespräch mit Claude über Geschmack und Sommerlektüre. Aus diesem Gespräch baute ein starkes Modell eine Rangfolge über alle Bücher des jeweiligen Pools. Als Vergleichsmaßstab bewerteten die Teilnehmenden zusätzlich zehn Bücher selbst – diese Wahrheit sahen die Agenten nie.
Auf dem Trading Floor galten klare Regeln. Jede Laufzeit war begrenzt, und um Staus zu vermeiden, durften nur eine bestimmte Anzahl Agenten gleichzeitig sprechen. Erlaubt waren Nachrichten an einen gemeinsamen Kanal: ein Tauschvorschlag, die Annahme oder Ablehnung eines solchen oder einfach Geplauder. Deals konnten bilateral sein oder als Rotation zwischen mehreren Parteien laufen; ausgeführt wurde ein Geschäft nur, wenn alle Beteiligten zustimmten. Die gesamte Historie – wer was gesagt und welcher Tausch stattgefunden hatte – war öffentlich einsehbar. Die Hälfte der Agenten erhielt die Anweisung, rücksichtslos nur das eigene Ergebnis zu verfolgen, die andere Hälfte sollte zusätzlich darauf achten, dass möglichst alle ein passendes Buch bekamen.
Eine einzelne Live-Runde zeigt nur, wie es einmal ausgegangen ist, nicht wie es ausgehen musste. Deshalb ließ das Team den Markt dutzendfach neu laufen und änderte jeweils nur eine Variable. In einer Reihe von Läufen blieb alles wie beim Live-Event, nur die Zuteilung der Anweisungen wechselte. In einer zweiten Reihe erhielten alle Agenten neutrale Instruktionen, und 80 Handelssäle liefen mit jeweils einem einzigen Modell. In einer dritten Reihe starteten 60 gemischte Säle, in denen die Hälfte der Agenten auf Opus und die andere Hälfte auf einem der drei anderen Modelle lief. Als Vergleichsmarken dienten zwei zentrale Verfahren: die bestmögliche Zuteilung, bei der eine Clearingstelle einfach alle Vorlieben abfragt, und ein in der Ökonomie gut untersuchter Mechanismus namens Top Trading Cycles, der ohne Ehrlichkeit der Beteiligten auskommt.
Wie gut der Agent seine Person verstand
Alles, was ein Agent tut, hängt davon ab, wie gut er versteht, was sein Nutzer möchte. Genau dieses Verständnis ließ sich hier messen: Bei allen Buchpaaren, die eine Person selbst geordnet hatte, stimmte Claudes Reihenfolge in 61 Prozent der Fälle mit ihrer überein. Zum Vergleich: Zufall läge bei 50 Prozent. Für ein Gespräch von wenigen Minuten ist das viel.
Denn die Ergebnisse des Marktes blieben vor allem deshalb hinter dem Optimum zurück, weil den Agenten Informationen über ihre Menschen fehlten – nicht, weil sie schlecht verhandelt hätten. In Zahlen: Bei genauer Kenntnis der Vorlieben wäre im Schnitt ein Wert von 0,89 möglich gewesen, das entspricht etwa dem zweitliebsten von zehn Büchern. Tatsächlich landeten die Teilnehmenden bei 0,55, ungefähr beim fünftliebsten. 85 Prozent dieser Lücke gehen auf die ungenau erfassten Vorlieben zurück, nur 15 Prozent auf das freie Verhandeln. Die Agenten tauschten Bücher, sie einigten sich auf Rotationen, und trotzdem war die Ausgangslage unscharf. Verhandlungsgeschick und Auftragsklärung sind zwei verschiedene Dinge – wer wissen will, wie Agenten Nutzerinteressen verstehen, muss beides getrennt betrachten.
Modell oder Anweisung – was den Agentenhandel entscheidet
Der überraschendste Befund betrifft die Frage, was ein Verhandlungsergebnis stärker prägt. Über alle Wiederholungen hinweg machte das Modell, auf dem ein Agent lief, mehr Unterschied als die Anweisung, die er mitbekommen hatte. Ob ein Agent rücksichtslos oder kooperativ auftreten sollte, veränderte die Resultate weniger stark als der Wechsel zwischen den Modellklassen. Märkte, in denen stärkere Modelle verhandelten, arbeiteten effizienter – es kamen also mehr Tauschgeschäfte zustande, die die Beteiligten besser stellten. Allerdings gilt das nur gemessen an den Rangfolgen, die Claude aus den Gesprächen abgeleitet hatte. Gemessen an den eigenen Rangfolgen der Menschen schrumpfen die Unterschiede fast auf null: Der größte Modellabstand, 0,12 zwischen Haiku und Opus, wird dort zu 0,01.
Für die Praxis hat das eine unangenehme Implikation. Wer einen Agenten für sich handeln lässt, kann dessen Verhalten über Instruktionen nur begrenzt steuern; die Fähigkeit des zugrunde liegenden Modells schlägt stärker durch. Ein sorgfältig formulierter Auftrag hilft, aber er ersetzt kein leistungsfähiges Modell. Und weil der Agentenhandel auf offenen Märkten stattfindet, treffen unterschiedlich starke Agenten aufeinander. Auf gemischten Handelsflächen lagen die Opus-Agenten stets vorn – nicht dramatisch, aber messbar.
Was Menschen einem Agenten anvertrauen würden
Drei Wochen nach der Verteilung fragte das Team nach, wie zufrieden die Teilnehmenden mit ihrem Buch waren und wie viel Vertrauen sie einem Agenten für ähnliche Entscheidungen entgegenbringen würden. Die meisten, die ihr Buch gelesen hatten, mochten es. Und der durchschnittliche Teilnehmende gab an, etwa ein Drittel seines jährlichen Buchbudgets einem Agenten überlassen zu wollen. Einem belesenen Freund würden die Teilnehmenden rund 40 Prozent anvertrauen. Das ist keine Blankovollmacht, aber auch keine Skepsis. Eine Einschränkung nennt Anthropic selbst: Die eigenen Mitarbeitenden dürften Claude eher vertrauen als die Allgemeinheit.
Was passiert, wenn KI-Agenten für uns handeln? Sie tun es bereits im Kleinen, und die Hemmschwelle sinkt mit jedem guten Ergebnis. Die Beispiele aus dem Bericht sind unspektakulär und deshalb plausibel – Schichttausch, Fahrgemeinschaften, die Suche nach der günstigeren Klinik, die diskrete Jobanfrage bei wenigen Arbeitgebern. Überall dort, wo heute ein Mensch mit knapper Zeit suchen und feilschen müsste, könnte morgen ein Agent den ersten Kontakt übernehmen.
Offen bleibt, wie sich das kontrollieren lässt. Wer prüft, ob ein Agent seinen Auftraggeber richtig verstanden hat? Wer darf auf einem Marktplatz für Agenten überhaupt mitmachen? Was geschieht, wenn ein Deal platzt, nachdem beide Seiten darauf gebaut haben? Und wie viel vom Marktgeschehen sollte für die Menschen sichtbar sein, in deren Namen gehandelt wird? Das sind weniger technische als institutionelle Fragen, und sie entscheiden darüber, ob aus dem Modellbahn-Experiment einmal ein belastbares Schienennetz wird.
Project Swap liefert darauf keine fertigen Antworten, aber eine Reihenfolge. Zuerst muss ein Agent verstehen, was sein Mensch will. Daran hängt alles Weitere. Dann braucht es Regeln, die Fairness und Nachvollziehbarkeit sichern, statt sie dem stärksten Modell zu überlassen. Erst danach lohnt die Diskussion über Effizienz. Das Verständnis der Nutzerinteressen ist der Engpass, nicht die Verhandlungsroutine.
Quelle: anthropic.com
