Was steht in der Model Card von Nano Banana 2.1? Google DeepMind hat am 6. Oktober 2026 ein Dokument veröffentlicht, das Eigenschaften, Messwerte und bekannte Schwächen des Bildmodells bündelt. Wichtig für die Einordnung: Die Modellkarte stammt vom Hersteller selbst, und auch die Benchmarks darin hat Google selbst erhoben, überwiegend mit menschlichen Vergleichsbewertungen. Trotzdem ist eine Model Card kein Werbeprospekt. Sie ähnelt eher einem Prüfprotokoll bei der Hauptuntersuchung eines Fahrzeugs, das der Hersteller allerdings selbst ausfüllt: Beschrieben werden nicht die Fahrt, sondern Messwerte, vorgesehene Einsatzbereiche und dokumentierte Mängel.
Diese Analogie erklärt, warum eine Modellkarte so nüchtern klingt. Ein Prüfprotokoll sagt nichts darüber, ob ein Fahrzeug dir gefällt. Es sagt, was gemessen wurde, unter welchen Bedingungen und was gar nicht geprüft wurde. Genauso ist die Model Card von Nano Banana 2.1 aufgebaut: erst die Beschreibung, dann die Verweise auf das Basismodell, danach Benchmarks, Grenzen und Sicherheit.
Was die Model Card über das multimodale Modell festhält
Nano Banana 2.1 gehört zur Gemini-3-Familie, einer Reihe nativ multimodaler Reasoning-Modelle. Laut Model Card versteht das Modell Eingaben aus unterschiedlichen Quellen, konkret Text und Bilder, und erzeugt in der Antwort sowohl Bild- als auch Textausgabe. Als Eingabe nennt das Dokument Textstrings wie Prompts oder Dokumente sowie Bilder, bei einem Kontextfenster von bis zu einer Million Token. Auf der Ausgabeseite stehen Bilder mit einem Budget von 4K Token und Text mit bis zu 64K Token.
Nano Banana 2.1 erzeugt Bild und Text also in derselben Antwort. Wie das intern umgesetzt ist, beschreibt die Modellkarte nicht selbst; für die Architektur verweist sie auf das Basismodell. Für die Praxis ist vor allem der Einsatzzweck interessant, den Google nennt: Das Modell soll Geminis Weltwissen nutzen, um präzise Ergebnisse von komplexen Infografiken bis zu historisch stimmigen Szenen zu liefern. Verfügbar ist es laut Modellkarte in der Gemini-App, in Google AI Studio, über die Gemini API, im AI Mode der Google-Suche sowie in Google Ads, Google Flow und Google Stitch.
Warum fast alle Angaben auf Gemini 3.6 Flash verweisen
Der Abschnitt zu den Model Dependencies sagt es klar: Nano Banana 2.1 basiert auf Gemini 3.6 Flash. Dasselbe gilt für Architektur, Trainingsdatensatz, Datenverarbeitung, Hardware und Software. In allen diesen Punkten verweist die Model Card auf die Gemini 3.6 Flash Modellkarte, statt eigene Angaben zu wiederholen. Das wirkt wie ein bewusstes Vorgehen: Dokumentiert wird im Wesentlichen, was das neue Modell vom Basismodell unterscheidet.
Für Leser hat das eine praktische Folge. Wer verstehen will, woher die Trainingsdaten stammen, wie sie aufbereitet wurden oder auf welcher Hardware trainiert und betrieben wird, muss zwei Dokumente lesen. Die Modellkarte von Nano Banana 2.1 beschreibt im Wesentlichen das Delta, also die Bildausgabe, die Editierfähigkeiten und die zugehörigen Messungen. Der Rest steht im Prüfprotokoll des Grundmodells, und dessen Einschränkungen gelten weiter.
Wie Text-zu-Bild und Bildbearbeitung gemessen werden
Die Evaluation teilt sich in zwei Bereiche: Capability Sets und Regression Sets. Für die Capability Sets nutzt Google öffentliche Benchmarks und interne Tests. Zu den Capability Sets gehören auf der Seite der Bildgenerierung allgemeine Text-zu-Bild-Aufgaben, Textrendering über mehrere Sprachen hinweg, Factuality mit Weltwissen und Bildungsinhalten, Tool-Nutzung und visuelles Design. Auf der Bearbeitungsseite stehen allgemeine Bildbearbeitung, Stilisierung, Figurenkonsistenz, Objekt- und Umgebungseingriffe, Bearbeitung auf Basis von Kritzeleien (Ink), Multi-Image-Aufgaben wie die Neukontextualisierung mehrerer Produkte sowie Multi-Turn-Szenarien mit statischen und dynamischen Dialogen.
Die Regression Sets sind der Gegencheck. Sie bestehen aus häufigen Anwendungsfällen, die bereits auf Gemini 2.5 Flash Image und Gemini 3 Pro Image beobachtet wurden, und sollen sicherstellen, dass Nano Banana 2.1 keine spürbaren Rückschritte zeigt. Methodisch arbeitet Google mit zwei Verfahren: einem Side-by-Side-Humaneval, das über Präferenzurteile zu Elo-Werten führt, und einem einseitigen AutoRater für Factuality. Elo-Werte sind relative Größen. Sie beschreiben nicht, wie gut ein Bild in absoluten Maßstäben ist, sondern wie es im direkten Vergleich abschneidet.
Was die Benchmarks von Nano Banana 2.1 zeigen
In Googles eigenen Tests mit Stand Oktober 2026 liegt das neue Modell klar vorn. Bei der allgemeinen Präferenz für Text-zu-Bild erreicht Nano Banana 2.1 im Thinking-Modus 1050 Punkte (±14), ohne Thinking 1015 (±13). Die Vergleichsmodelle liegen darunter: Gemini 3.1 Flash Image („Nano Banana 2“, Thinking) kommt auf 990 (±7), Gemini 3 Pro Image („Nano Banana Pro“) auf 935 (±8). Beim Infografik-Design liegen die Werte bei 1048, 1001, 961 und 912, also dieselbe Reihenfolge. Auffällig ist die Factuality der Infografiken: 0,521 im Thinking-Modus gegenüber 0,328 ohne Thinking, 0,179 bei „Nano Banana 2“ und 0,265 bei „Nano Banana Pro“.
Bei der Bildbearbeitung setzt sich das Muster fort. Den größten Vorsprung zeigt die Konsistenz mehrerer Figuren. Allgemeine Bearbeitung liegt bei 1026 (±12) gegenüber 938 und 939 bei den Vergleichsmodellen. Figurenkonsistenz mit einer Figur erreicht 1028 (±14), mit mehreren Figuren sogar 1106 (±14) gegenüber 978 und 1011. Masken- und Kritzeleibearbeitung kommt auf 1049 (±15), Produktkonsistenz auf 1024 (±18), Stilisierung auf 1062 (±20) und Bearbeitung mit mehreren Referenzbildern auf 1066 (±22).
Drei Einschränkungen sind beim Lesen dieser Zahlen zu beachten. Erstens liegt der Thinking-Modus fast überall vorn, teils um dreißig bis vierzig Elo-Punkte; bei der Konsistenz einzelner Figuren und bei der Masken- und Kritzeleibearbeitung ist der Unterschied dagegen kleiner als die Fehlerbalken. Zweitens überschneiden sich die Konfidenzintervalle der älteren Vergleichsmodelle in mehreren Kategorien, während die Abstände zum neuen Modell meist klar außerhalb liegen. Drittens hat Google die Tests selbst durchgeführt und die Vergleichsmodelle selbst ausgewählt; Modelle anderer Anbieter fehlen, eine unabhängige Überprüfung gibt es nicht. Die Rangfolge innerhalb der Google-Modelle wirkt damit plausibel, mehr sagen die Zahlen nicht.
Wo das Modell an Grenzen stößt
Die Model Card benennt die Schwächen offen. Kleine Texte werden weiterhin schlecht gerendert und erscheinen im 1K-Modus oft unscharf; das gilt auch für lange Absätze und seitenfüllende Layouts. Die Konsistenz von Figuren ist zwischen Eingabebild und Ausgabebild nicht immer perfekt. Bei masken- oder kritzelbasierter Bearbeitung folgt das Modell Anweisungen nur teilweise, und Tinte bleibt mitunter stehen, obwohl sie entfernt werden sollte.
Hinzu kommen seltene, aber dokumentierte Effekte: Manchmal übernimmt ein bearbeitetes Bild die Körperhaltung und den strukturellen Aufbau des Ausgangsmotivs. Die räumliche Verortung, also links und rechts, geht gelegentlich durcheinander. Bei Weltwissen, 3D-Schlussfolgerungen und Factuality bleibt das Modell begrenzt, und wie jedes Grundmodell kann es halluzinieren. Gelegentliche Langsamkeit und Timeouts werden ebenfalls erwähnt.
Ein Punkt betrifft die zeitliche Einordnung. Der Knowledge Cutoff von Gemini 3.6 Flash liegt im März 2026, in manchen Domänen aber bereits im Januar 2025, analog zur Gemini-3-Modellfamilie. Wer Nano Banana 2.1 für aktuelle Inhalte nutzt, sollte also nicht davon ausgehen, dass der Wissensstand überall gleich frisch ist. Für ein Modell, das Fakten in Infografiken abbilden soll, ist das eine Einschränkung mit direkter Wirkung auf die Ausgabe.
Sicherheit, Frontier Safety und die praktische Einordnung
Beim Human Red Teaming prüfen spezialisierte Teams außerhalb der Modellentwicklung das Verhalten des Modells; ihre Erkenntnisse fließen zurück ins Entwicklungsteam. Nach Googles Angaben erfüllt Nano Banana 2.1 bei der Kindersicherheit die geforderten Startschwellen, die von Expertenteams zum Schutz von Kindern im Netz entwickelt wurden. Im allgemeinen Vergleich zeigt das Modell ähnliche oder bessere Sicherheitsleistungen als Gemini 3 Flash, und das Red Teaming fand bei einem Vergleich mit Gemini 3.1 Pro keine schwerwiegenden Bedenken.
Beim Frontier Safety Assessment stützt sich Google auf Evaluationen von Gemini 3.1 Pro und Gemini 3.7 Flash. Diese erreichten keine Tracked oder Critical Capability Levels, und da Nano Banana 2.1 nach Googles eigener Bewertung keine wesentlich neuen Fähigkeiten mitbringt, hält das Unternehmen es für unwahrscheinlich, dass das Bildmodell diese Schwellen erreicht. Außerdem arbeite Google laufend an der Widerstandsfähigkeit gegen Jailbreaks und habe die Schutzmaßnahmen im Frontier-Safety-Bereich zuletzt verstärkt. Dieser Teil des Dokuments zeigt sich kaum in Bildern, setzt aber den Rahmen für den produktiven Einsatz.
Die Model Card von Nano Banana 2.1 ist ein Fortschrittsbericht des Herstellers mit klarem Umfang. Als Stärken nennt Google Bildbearbeitung mit professioneller Präzision und schnellen Iterationen, klaren Text für Poster und komplexe Diagramme, Weltwissen mit langem Kontext und mehrsprachiges Textrendering. Ein Versprechen auf Perfektion ist sie nicht. Wenn du das Modell für eine Pipeline planst, lies die dokumentierten Grenzen als Arbeitsanweisung: kleine Schrift vermeiden, Figurenkonsistenz prüfen, maskenbasierte Eingriffe nachkontrollieren, Wissensstichtage beachten. Ein Prüfprotokoll hilft nur, wenn man es vor der Fahrt liest.
Quelle: deepmind.google
