863 Paarurteile über 48 kommerzielle Szenen, dreizehn Produktionsprofis und vier Kandidaten in einem gemeinsamen Blindtest – mit diesem Aufbau hat das Everypixel-Produktionsteam im August 2026 KI-Bildmodelle verglichen. Am Ende steht kein eindeutiger Sieger, sondern die Erkenntnis, dass Qualität an der Spitze keine einzige Dimension mehr hat.
Wer einen Vergleich sucht, in dem ein Modell alles andere schlägt, wird nicht fündig. Stattdessen entsteht ein Netz voneinander abhängiger Urteile: Dieses Bild trifft die Vorgabe genauer, jenes wirkt fotografischer, ein drittes hat die bessere Komposition. Die Ergebnisse lassen sich deshalb eher als Landkarte lesen denn als Rangliste.
Was der Blindtest 2026 gemessen hat
Wie die Zahlen zu lesen sind, hängt von der Methode ab. Bewertet wurden nicht absolute Punktzahlen, sondern immer zwei Bilder direkt gegeneinander – verblindet, ohne Hinweis auf die Herkunft. So entsteht kein absolutes Ranking, sondern eine Reihenfolge, die von der Zusammensetzung der Vergleiche abhängt.
Über das gesamte Vergleichsnetz landete GPT Image 2 vor der fotografischen Referenz. Im direkten Duell zwischen Modell und Foto war dieser Vorsprung jedoch nicht statistisch klar. Ein guter Platz in einem Netzwerk aus vielen Paarurteilen ist etwas anderes als ein belegter Sieg im Zweikampf.
Man kann sich das wie eine Filmcrew vorstellen. Auf einem Set arbeiten verschiedene Gewerke, und keines davon ist „das beste“. Die Aufnahmeleitung sorgt für Tempo, die Regie für Präzision, die Maske für Details, die Postproduktion für den Feinschliff. Bei den besten KI-Bildmodellen 2026 ist es ähnlich: Der Vergleich der Bildmodelle führt nicht zu einem Sieger, sondern zu einer Besetzung.
GPT Image 2 im Test: Präzision als Stärke, Tempo als Preis
Wenn aus einem detaillierten Briefing ein fertiges kommerzielles Motiv werden soll, ist GPT Image 2 die naheliegendste Wahl. In einer separaten Produktionsstudie bewerteten vier Profis 34 strukturierte Generierungen aus 13 Anwendungsklassen. Der Durchschnitt lag bei 9,8 von 10 Punkten für Prompt-Treue, und neun der dreizehn Kategorien galten ohne Nachbearbeitung als produktionsreif.
Die Stärke liegt nicht darin, dass das Modell hübsche Bilder erzeugt. Sie liegt darin, dass es viele Elemente eines langen Briefings im fertigen Frame erhält. Besonders deutlich zeigte sich das bei Produktfotografie, Architektur, Text im Bild, UI-Konzepten, Verpackungen, mehrsprachigen Layouts und professionellen Porträts.
Der Preis dafür ist Zeit. Im Mai-Test lag die Ausgabezeit bei etwa 40 bis 90 Sekunden pro Bild. Für ein finales Motiv mit festem Briefing ist das vertretbar, für das Durchprobieren von dreißig Richtungen nicht. Wer schnell Ideen braucht, arbeitet besser mit einem anderen Gewerk aus derselben Crew.
Fotorealismus verliert seine Eindeutigkeit
In der blinden Gegenüberstellung erhielt echte Fotografie 51,7 Prozent der Präferenzen, wenn es um fotografische Plausibilität gegenüber GPT Image 2 ging. Das Konfidenzintervall enthielt die 50-Prozent-Marke, eine statistisch klare Überlegenheit ließ sich also nicht belegen. Wichtig ist die Einschränkung: Das gilt für die getesteten Szenen, nicht für Bilder allgemein.
In kontrollierten kommerziellen Situationen war das Modell sehr stark. Architekturfotografie erreichte im Schnitt 9,90 von 10, ein Luxusparfüm-Produktbild 9,75. Glas, Metall, Flüssigkeit, Stoff, Studiolicht und wiederkehrende architektonische Geometrien wurden sauber gehalten.
Mit steigender Komplexität kippt das Bild. Eine Szene auf einem Tokioter Markt kam nur auf 6,9 von 10, die Bewertenden benannten Probleme im dichten Menschengewimmel. Fotorealismus ist also kein Schalter, sondern ein Spektrum – und Menschenmengen bleiben eine Schwachstelle der KI-Bildgenerierung.
Dazu kommt eine Unterscheidung, die in Diskussionen oft untergeht. Ein generiertes Bild kann fotografisch wirken, ohne etwas zu dokumentieren. Ein Foto funktioniert als Beleg für eine reale Person, einen Ort oder ein Ereignis, ein generiertes Bild kann das nicht. Bildwirkung und Herkunft sind zwei getrennte Fragen.
Qwen Image 2 für Bildbearbeitung: Zurückhaltung als Tugend
Ein neues Bild erzeugen und ein bestehendes verändern sind unterschiedliche Aufgaben. Beim Generieren darf ein Modell kreativ mitdenken, beim Bearbeiten ist genau das oft der Fehler. Wer „Hintergrund austauschen“ schreibt, will keinen neu erfundenen Menschen, sondern denselben Menschen vor anderer Kulisse.
Qwen Image 2 ist für diese zweite Aufgabe gebaut. Die Architektur vereint Generierung und Bearbeitung in einem Modell, erzeugt nativ 2048 × 2048 Pixel und hält Text zuverlässig – nützlich für Plakate, Präsentationsfolien, Comics, Infografiken und zweisprachige Layouts. In einem Produktionsvergleich wurde Qwen ausdrücklich für Präzisionseingriffe empfohlen: Hintergründe tauschen, Objekte verschieben, Text in einem bestehenden Bild ersetzen.
Die Grenze zeigt sich in dichten Szenen. Viele Objekte und exakte räumliche Beziehungen driften, Richtungsangaben wie „hinter“, „links von“ oder „vor“ werden gelegentlich frei interpretiert, und das Modell reagiert empfindlich auf Umformulierungen im Prompt. Solange der Großteil eines Bildes unangetastet bleiben soll, ist diese Zurückhaltung genau das gewünschte Verhalten.
FLUX.2 Klein und Nano Banana 2: schnelle Iteration vor der Entscheidung
Am Anfang steht selten die perfekte Aufnahme. Du brauchst erst genug brauchbare Richtungen, um zu wissen, wohin es gehen soll. Hier spielt FLUX.2 Klein seine Stärke aus: schnelle visuelle Richtungssuche, bevor überhaupt eine Bildidee feststeht.
Nano Banana 2 besetzt dieselbe Etappe mit anderer Gewichtung. Im Produktionsvergleich rendert es spürbar schneller als Nano Banana Pro und kostete im getesteten Workflow etwa halb so viele Credits. Damit eignet es sich für Social-Varianten, Moodboards, Lokalisierungen, alternative Kompositionen und schnelle Korrekturrunden.
Sein Vorteil ist nicht das letzte Detail in einem Frame, sondern die schiere Zahl möglicher Frames. Sobald eine Richtung freigegeben ist, verschiebt sich die Priorität. Ein Charakter muss in einer weiteren Einstellung gleich aussehen, ein Produkt seine Form behalten, Haar, Garderobe und Licht müssen einen weiteren Eingriff oder den Sprung ins Image-to-Video überstehen.
Hier wird Nano Banana Pro interessant. Im direkten Porträt-Vergleich erhielt es mehr sichtbare Hautstruktur, schärfere Haaransätze, stärkeren Mikrokontrast und eine kontrolliertere Basis für nachgelagerte Schritte. Daraus lässt sich eine einfache Produktionsregel ableiten: Nano Banana 2 für die Iteration, Nano Banana Pro, sobald der Look festgezurrt ist.
Grok Imagine, FLUX.2 Pro und die fertige Datei
Nicht jedes Briefing profitiert von striktem Gehorsam. Manchmal ist genau das die wertvollste Zutat, was das Modell von sich aus beisteuert. Grok Imagine war in diesem Terrain ungewöhnlich stark: Ein Kinderbuch-Prompt über einen Fuchs, der im Wald eine Laterne findet, erreichte 9,8 von 10 Punkten für praktischen Nutzen und 10 von 10 für Ästhetik, eine aufwendigere Aquarell-Variante schnitt praktisch gleich.
Ein zweiter Test zeigte den Preis dieser Freiheit. Ein Steinbogen im Nebel, ausdrücklich ohne Figuren, bekam trotzdem Personen ins Bild gesetzt. Streng an der Vorgabe gemessen ist das ein Fehler, als Interpretation bleibt es eine Stärke. Ob das stört, hängt davon ab, ob du ein Motiv oder eine Stimmung bestellt hast.
Ist die Richtung gesetzt, übernimmt FLUX.2 Pro die Feinarbeit: Materialien, Lichtführung, Typografie, Finish. Das Modell ist langsamer und kommt deshalb erst am Ende der Kette sinnvoll zum Einsatz. Die praktische Konsequenz ist unspektakulär, aber folgenreich.
KI-Bildmodelle für kommerzielle Produktion werden selten einzeln eingesetzt. Teams kombinieren mehrere Modelle entlang des Workflows: eines für die Exploration, eines für die kontrollierte Bearbeitung, eines für das Hero-Motiv, eines für den Feinschliff. Die Frage ist deshalb nicht, welches Modell den besten Gesamtwert erreicht, sondern was das nächste Bild leisten soll.
Quelle: journal.everypixel.com
