KI-Training mit abgeleiteten Daten: Warum der Umweg das Urheberrechtsproblem nicht löst

Nahaufnahme von Netzwerk-Switches und Patchkabeln in einem schwach beleuchteten Serverraum
Deine Reaktion:

Die Debatte über KI und Urheberrecht dreht sich fast nur um Rohstoffe: Welche Bücher, Bilder und Webseiten wurden abgegriffen? Wie viele Klagen gibt es? Wer den Thread von Ed Newton-Rex liest, stößt auf einen zweiten Weg. Er läuft leiser, wirkt für Kreative aber gleich. Es geht um KI-Training mit abgeleiteten Daten: Inhalte, die vor dem Training von einem Modell umgeschrieben wurden. Dazu gibt es kaum Schlagzeilen. Das ist das Problem.

Um den Mechanismus zu verstehen, hilft ein Bild: Ein Werk ist wie Wasser in einem Fluss. Fließt es direkt ins Modell, lässt sich der Weg halbwegs zurückverfolgen. Bei abgeleiteten Daten wird der Fluss vorher umgeleitet. Das Wasser bleibt dasselbe. Nur der Weg ist ein anderer – und die Spur verliert sich.

Was abgeleitete Daten im KI-Training genau sind

Newton-Rex bleibt in seinem Thread nüchtern: Abgeleitete Daten sind kreative Inhalte, die eine KI umschreibt, bevor sie zum Training verwendet werden. Statt auf den Sätzen eines Buchs zu trainieren, lässt ein Unternehmen sie erst von einem Modell umformulieren und trainiert dann auf den Ergebnissen. Zwischen Original und Trainingsdaten liegt also ein Arbeitsschritt, der den Text an der Oberfläche verändert. Kurz gesagt: erst umschreiben, dann lernen.

Abgrenzen muss man sie von zwei anderen Quellen, die in der Diskussion längst präsent sind. Da sind die abgegriffenen oder schlicht raubkopierten Bestände – aus ihnen stammt der Großteil der inzwischen mehr als hundert Klagen. Da sind synthetische Daten, erzeugt von Modellen, die selbst auf belastetem Material trainiert wurden. Abgeleitete Daten liegen dazwischen und passen in keine der beiden Erzählungen: Sie stammen aus echten Werken, wurden aber durch ein Modell geschleust. Schwer greifbar. Deshalb selten Thema.

Derselbe Schaden, schwierigerer Nachweis

Der Kern der Argumentation: Der Schaden bleibt derselbe. Ein Werk wird ohne Erlaubnis verwendet, um ein Produkt zu bauen, das mit seinem Urheber konkurriert. Ob das Modell später wörtliche Passagen ausspuckt oder nicht, ändert daran nichts. Der Eingriff in die Rechte findet im Training statt, nicht in der Ausgabe. Man muss dabei zwei Dinge trennen, die gern vermischt werden: Beweislage und Betroffenheit. Die Beweislage verschiebt sich durch das Umschreiben. Die Betroffenheit nicht.

Juristisch ist das kein abgeschlossenes Kapitel, und Newton-Rex argumentiert auch nicht juristisch, sondern mit dem Schaden: Das Werk werde ohne Erlaubnis benutzt, um ein Konkurrenzprodukt zu bauen. Für den Nachweis hat das eine unangenehme Folge: Wenn Wortgleichheit zum Maßstab wird, können Kreative kaum noch bemerken, dass etwas mit ihren Werken geschieht. Die Umleitung sorgt dafür, dass niemand mehr sagen kann, woher das Wasser kommt – und niemand mehr nachweisen kann, dass es entnommen wurde.

Opt-out umgehen durch abgeleitete Daten

Hier wird der Mechanismus praktisch. Wer Texte, Bilder oder Musik auf einer Plattform veröffentlicht, kann dort immer häufiger erklären, dass die eigenen Inhalte nicht zum Training verwendet werden dürfen. Solche Opt-outs sind ein Fortschritt. Sie erfassen aber nur den direkten Zugriff. Der Thread zeigt die naheliegende Lücke: Ein Widerspruch gegen das Training auf den eigenen Werken ist noch kein Widerspruch dagegen, diese Werke vorher umschreiben zu lassen und dann auf den Fassungen zu trainieren. Wer den Opt-out umgehen will, muss den Umweg nur oft genug gehen.

So entsteht eine Lage, die schwer zu bestreiten ist und trotzdem unbefriedigend bleibt. Auf den Hinweis, man habe doch widersprochen, kann ein Unternehmen mit dem Verweis auf die Zwischenstufe antworten: Man habe nichts falsch gemacht. Newton-Rex nennt das als Szenario. Er ergänzt einen zweiten, unbequemeren Punkt: Je besser die Modelle werden, desto leichter fällt das Umschreiben – und deshalb, so Newton-Rex, passiere es schon jetzt immer häufiger.

Warum der Nachweis so schwierig ist

Der Nachweis ist schwer, weil der Zwischenschritt ihn verhindert. Ein Modell, das auf umgeschriebenen Fassungen trainiert wurde, gibt das Original seltener wörtlich wieder. Das klingt nach einem Vorteil für alle. Es ist einer für den, der nicht auffallen will. Wer wissen möchte, ob das eigene Buch, Bild oder Musikstück in einem Modell steckt, hat bei direkt abgegriffenen Daten wenigstens die Chance über wörtliche Übereinstimmungen. Bei abgeleiteten Daten fällt die weg.

Daraus folgt eine Verschiebung, die Kreative benachteiligt. Im besten Fall erfahren sie von der Nutzung lange nach dem Training, wenn das Modell längst im Einsatz ist und sich kaum zurückdrehen lässt. Im schlechteren Fall erfahren sie es nie – und können sich nicht wehren. Transparenz von KI-Trainingsdaten fordert hier nicht eine bessere Beweisführung im Nachhinein. Sie fordert überhaupt erst eine Grundlage für Streit oder Zustimmung.

Warum nur Offenlegung hilft

Newton-Rex zieht einen klaren Schluss: Offenlegungspflichten. Staaten müssten Gesetze erlassen, die KI-Unternehmen zwingen, ihre Trainingsdaten bekanntzugeben. Ohne das sind Kreative dauerhaft im Hintertreffen – sie spielen hinterher, statt mitzuspielen. Der Vorschlag ist bewusst unspektakulär: Er verbietet keine Technik, er beschreibt nur, was sie verwendet. Fehlt diese Beschreibung, bleibt jede Diskussion über Erlaubnis, Vergütung und Widerspruch ein Gespräch über einen Umweg, den niemand einsehen kann.

Wie weit solche Pflichten reichen sollen und ob sie technisch und wirtschaftlich umsetzbar sind, darüber kann man streiten. Kaum zu bestreiten ist der Ausgangspunkt: Ein System, in dem die verwendeten KI-Trainingsdaten unbekannt sind, kann Fairness nicht herstellen. Es kann sie nur behaupten. Transparenz ist hier keine Forderung nach mehr Bürokratie, sondern die Voraussetzung dafür, dass die bestehenden Regeln zum Urheberrecht anwendbar bleiben – auch dann, wenn zwischen Werk und Modell ein Umschreibschritt liegt.

Was das konkret bedeutet

Für dich als Leser, Autor, Musikerin oder Fotograf ändert der Begriff allein nichts an der Rechtslage. Was sich ändert, ist die Aufmerksamkeit. Wer künftig über KI und Urheberrecht spricht, sollte nicht nur nach den abgegriffenen Daten fragen, sondern auch nach dem, was zwischen Original und Training passiert ist. Die Frage lautet dann nicht mehr nur: Wurde mein Werk verwendet? Sondern: Lief es vorher durch ein Modell, das die Spuren verwischt hat?

Für Unternehmen heißt das: Der Umweg über abgeleitete Daten ist kein Schlupfloch, das dauerhaft trägt, sondern eine Verzögerung. Wer auf Nachfragen mit dem Hinweis auf die Zwischenstufe antwortet, gewinnt Zeit, kein Vertrauen. Für die Politik bleibt die Reihenfolge unbequem: erst Offenlegung, dann Bewertung. Alles andere ist ein Gespräch über Wasser, dessen Flussrichtung niemand kennt.

Quelle: threadreaderapp.com

Deine Reaktion:
Artikel teilen:
Krötzsch-Check0 — 100
Fakten 65
Relevanz 75
Hype 20
Einschätzung 72
Redaktion 50 Stand 50 · noch keine Stimmen
Ist das Hype?
Sebastian Krötzsch
Autor

Sebastian Krötzsch

Sebastian Krötzsch schreibt auf sebask.de über Künstliche Intelligenz, Automatisierung, digitale Systeme und die Frage, was davon im Alltag wirklich nützlich ist. Ohne Buzzword-Nebel, dafür mit klarem Blick auf Praxis, Tools und echte Wirkung.