Ein Standbild, das in Echtzeit spricht: Meta hat mit dem Muse-Team ein Verfahren vorgestellt, bei dem das Bild lernt, dem Klang zu folgen. Muse Realtime Avatar heißt diese Embodiment-Technik, also die Übersetzung von Sprache in einen sichtbaren Körper. Aus einer einzigen Vorlage – einem Porträtfoto, einer Ganzkörperillustration, einem Tier oder auch einem Alltagsgegenstand – wird eine Figur, die im laufenden Gespräch spricht, gestikuliert und ihren Gesichtsausdruck verändert.
Zwei Instrumente lesen dasselbe Notenblatt. Das Notenblatt ist der Strom aus Sprach-Tokens, den Muse Realtime Voice erzeugt. Ein Instrument macht daraus hörbare Sprache, das andere sichtbare Bewegung. Weil beide dieselbe Vorlage lesen, passen Lippenbewegung, Mimik und Stimme zusammen, ohne dass jemand sie nachträglich synchronisieren müsste. Diese geteilte Grundlage trägt die ganze Konstruktion.
Der folgende Text erklärt, was Muse Realtime Avatar tatsächlich erzeugt, wie die Architektur aufgebaut ist, warum Echtzeit hier vor allem ein Problem der Stabilität ist und was ein Vergleich mit zwei kommerziellen Systemen zeigt. Am Ende steht, was davon für Anwender und Entwickler wirklich zählt – und was die gezeigten Beispiele offenlassen.
Was Muse Realtime Avatar aus einer Vorlage macht
Ein Echtzeit-Avatar soll lebendig wirken und trotzdem erkennbar bleiben. Muse Realtime Avatar arbeitet mit Referenzmedien als Bedingung: Das Modell bekommt ein Ausgangsbild und leitet daraus ab, wie sich diese konkrete Figur verhalten soll. Ein fotografisches Porträt antwortet dann mit subtilen Regungen im Gesicht, eine Ganzkörperillustration gestikuliert und verlagert ihr Gewicht, während sie spricht. Tiere und Gegenstände werden ausdrucksstark, ohne aufzuhören, ein Tier oder ein Gegenstand zu sein.
Das ist kein Detail. Ein KI-Avatar, der bei jeder Antwort etwas anders aussieht, zerstört die Illusion schneller als eine schlechte Lippenbewegung. Deshalb bleibt bei diesem Ansatz das Erscheinungsbild über die einzelnen Gesprächsrunden hinweg stabil: Aussehen, Mimik und Eigenheiten werden von einem Redebeitrag zum nächsten weitergetragen. Wer schon einmal mit generierten Videosequenzen gearbeitet hat, kennt das Gegenteil – nach wenigen Sekunden wandert das Gesicht, die Frisur verändert sich, die Figur wird zu jemand anderem.
Die Bandbreite der Vorlagen ist groß. Statt nur sprechende Köpfe zu erzeugen, deckt die Avatar-Technik ausdrucksstarke Bewegungen von Gesicht, Händen und dem gesamten Körper ab. Die Frage lautet damit nicht mehr „Sieht es echt aus?“, sondern „Bleibt es dieselbe Figur, während sie spricht?“. Für KI-Avatare in Live-Gesprächen ist das die entscheidende Verschiebung.
Wie Muse Realtime Voice und der Avatar denselben Token-Strom teilen
Muse Realtime Voice liefert die Gesprächsintelligenz und erzeugt einen Strom aus Sprach-Tokens, intern VQs genannt. Diese Tokens tragen nicht nur, was gesagt wird, sondern auch, wie: Betonung, Tempo und Klangfarbe stecken bereits in der Sequenz. Ein Audio-Decoder übersetzt sie in hörbare Sprache. Muse Realtime Avatar greift denselben Strom ab und erzeugt daraus die zugehörige visuelle Darbietung. Weil beide Seiten aus derselben Quelle lesen, bleiben Stimme, Lippenbewegung und Ausdruck aufeinander abgestimmt.
Der Avatar selbst ist ein audiogesteuerter Diffusion Transformer. Er ist bedingt auf den Speech-Token-Strom, die Referenzmedien und ein rollendes Fenster der zuletzt erzeugten Video-Latents. Generiert wird nicht am Stück, sondern in kurzen kausalen Blöcken. Sobald ein Block fertig ist, werden seine jüngsten Latents zum Bewegungskontext für den nächsten Block. So wandert das Aussehen der Figur durch das Gespräch, während der Rechenaufwand pro Schritt begrenzt bleibt.
Das rollende Fenster funktioniert wie ein Kurzzeitgedächtnis: Niemand spielt das ganze Stück von vorn, aber jeder kennt die letzten Takte und weiß, wie es weitergeht. Diese Konstruktion erlaubt eine Generierung, die so lange läuft, wie das Gespräch dauert – ohne dass die Figur mit der Zeit auseinanderfällt. Ein sprachgesteuerter Avatar in Echtzeit braucht keine Ewigkeit, er braucht einen verlässlichen Anschluss an den Moment davor.
Warum schnelles Video allein nicht reicht: Drift und Destillation
Live-Streaming löst zwei Probleme gleichzeitig. Das erste ist Geschwindigkeit: Das Video muss schnell genug entstehen, um interaktiv zu wirken. Das zweite ist Konsistenz: Über die Dauer eines Gesprächs darf sich kein Fehler aufsummieren. Kleine Abweichungen in der Echtzeit-Video-Generierung für Avatare addieren sich sonst zu sichtbarem Drift, und am Ende spricht eine leicht verschobene Version der ursprünglichen Figur.
Das Team beschreibt dafür einen Lehrer-Schüler-Aufbau. Ein hochwertiger bidirektionaler Lehrer erzeugt Videos in guter Qualität, braucht dafür aber 40 Diffusionsschritte mit dreifacher Classifier-Free-Guidance. Das sind drei Modelldurchläufe pro Schritt und 120 Modellbewertungen pro Block. Für ein Live-Gespräch ist das unbrauchbar. Der Schüler wird deshalb als kausales Modell mit festem KV-Cache trainiert, unter anderem mit Self-Forcing und Distribution-Matching-Destillation.
Self-Forcing heißt: Der Schüler wird auf seinem eigenen generierten Kontext trainiert. Er lernt unter den Bedingungen, die er später im Betrieb vorfindet – mit den eigenen kleinen Fehlern als Ausgangslage. Destilliert wird nicht nur der Diffusionsprozess, sondern auch die Wirkung der Guidance, sodass am Ende zwei ungesteuerte Schritte genügen. Aus 120 Bewertungen werden zwei, eine Reduktion um den Faktor 60. Die menschliche Präferenz zwischen Lehrer und Schüler liegt laut der Auswertung bei 45 zu 55 Prozent und damit nahe am Gleichstand – ein Ergebnis, das für die Destillation spricht.
Was der Vergleich mit Runway Characters und HeyGen LiveAvatar zeigt
Um die Qualität im Gespräch zu prüfen, verglich das Team Muse Realtime Avatar mit Runway Characters und HeyGen LiveAvatar, zwei kommerziellen Systemen für Avatare. Bewerter führten jeweils zwei- bis dreiminütige Gespräche mit jedem System, mit identischen Avatar-Identitäten, und verglichen anschließend die Erfahrung. Bewertet wurden unter anderem visuelle Qualität, Synchronisation, Konsistenz der Figur und natürliche Eigenheiten.
In der Gesamtpräferenz lag Muse Realtime Avatar den Angaben zufolge mit 78 zu 22 Prozent vor Runway Characters und mit 88 zu 12 Prozent vor HeyGen LiveAvatar. Auch in den Einzeldimensionen – Ausdrucksstärke des Gesichts, Natürlichkeit der Bewegung, Lippensynchronisation, Erhalt der Figur und Eigenheiten – wurde das System bevorzugt. Eine Ausnahme nennt der Bericht selbst: Beim Vergleich der Eigenheiten mit Runway Characters war das Ergebnis nicht statistisch von Gleichstand zu unterscheiden.
Solche Zahlen stammen aus einer unternehmenseigenen Auswertung, nicht aus einer unabhängigen Studie, und Bewertungen in Live-Gesprächen sind schwer zu standardisieren. Interessant ist ohnehin weniger der Prozentwert als die Liste der Kategorien. Wer realistische Avatar-Animation beurteilt, achtet offenbar weniger auf Pixel als auf Konsistenz und Körpersprache – also auf Fragen, die sich nicht mit höherer Auflösung beantworten lassen.
Latenz unter einer Sekunde bei vielen parallelen Sitzungen
Ein Avatar, der beim ersten Byte hängt, ist unbrauchbar. Deshalb wurde für diesen Anwendungsfall der Inferenz-Stack neu gebaut und mit einer eigenen Engine für optimierte Echtzeit-Video-Inferenz gekoppelt. Persistente KV-Caches mit speicherbewussten Positionskodierungen erlauben es, Kontext zwischen den Blöcken wiederzuverwenden. Cache-bewusstes Routing und latenzbewusstes dynamisches Batching verteilen die gleichzeitigen Sitzungen auf die verfügbaren Ressourcen.
Auf der Modellseite kommen Quantisierung auf vier Bit, verschmolzene Kernel und CUDA-Graph-Capture zum Einsatz, um Speicherverkehr und Planungsaufwand zu senken; einzelne Optimierungen entstanden in Zusammenarbeit mit NVIDIA. Das Ergebnis sind Porträtvideos mit 448 mal 768 Pixeln bei 25 Bildern pro Sekunde und rund 870 Millisekunden Latenz, gemessen vom Ende eines Nutzerbeitrags bis zum ersten Byte der synchronen Antwort aus Stimme und Video. Auf einer GB200 erzeugt jeder Generierungsschritt acht Bilder, also 320 Millisekunden Wiedergabe, in 20 Millisekunden – rechnerisch 2,5 Millisekunden Modellzeit pro Bild.
Verglichen mit einer BF16-Basis steigt die Kapazität laut Bericht um den Faktor acht, was zwölf gleichzeitige Echtzeit-Sitzungen für die Videogenerierung auf einer einzelnen GB200 ermöglicht. Dahinter steckt weniger ein einzelner schöner Clip als ein System, das viele Sitzungen parallel bedient. Wer solche Dienste plant, sollte genau hinschauen, an welcher Stelle Rechenzeit gespart wurde – an der Qualität des Modells oder an der Organisation des Betriebs.
Wasserzeichen, Sicherheit und was die Beispiele nicht zeigen
Generierte Medien, die eine reale Person zeigen könnten, verlangen Vorkehrungen. Nach Angaben des Teams gelten durchgehende Sicherheitsanforderungen, um Missbrauch zu erschweren. Erzeugte Videos erhalten ein dauerhaftes, unsichtbares Wasserzeichen über Meta Video Seal, das ohne zusätzliche Latenz in den laufenden Strom eingebettet wird. Wie belastbar solche Markierungen gegen Bearbeitung sind, ist eine offene technische Frage, die nicht mit dem Start eines Produkts endet.
Zwei Einschränkungen benennt der Beitrag ausdrücklich. Die gezeigten Beispiele illustrieren die Fähigkeit des Modells und entsprechen nicht zwangsläufig den Avataren, die in der Muse-App verfügbar sind. Und Muse richtet sich an Nutzer ab 18 Jahren. Beide Punkte trennen die Demonstration vom Produkt.
Muse Realtime Avatar verschiebt die Grenze zwischen Sprachmodell und Darstellung. Bisher war ein KI-Avatar ein Video, das zu einer Tonspur passte. Künftig liest die Figur dieselbe Partitur wie die Stimme, und daraus entsteht der Eindruck von Anwesenheit. Ob das ein Fortschritt ist, hängt weniger an der Technik als an der Frage, wofür sie eingesetzt wird – im Kundengespräch, in der Schulung, in der Unterhaltung oder in einem Kontext, in dem eine echte Person erwartet wird.
Quelle: research.meta.ai
