In diesem Zeitalter von Politikern, die der Post-Wahrheit und der Ad-Hominem-Falle verfallen sind, hat ein neues Projekt der University of Washington Algorithmen entwickelt, die Videos mit sehr fortgeschrittener Lippen-Synchronisation aus einer einfachen Audioaufnahme erzeugen. Ein geübtes Auge wird Fehler im Prozess leicht erkennen, aber das ist nicht der Punkt. Schließlich braucht es nur eine ausreichend gute Simulation, die man bis zum Überdruss wiederholt.

Neue Lippen-Synchronisationstechnologie kann Videos „erfinden“
Obama

Hintergrund: Die Macht des Archivs

Für diejenigen, die George Orwells „1984“ noch nicht gelesen haben: Die Figur Winston Smith ist ein Redakteur im Ministerium der Wahrheit, das historischen Revisionismus betreibt, also frühere Aufzeichnungen verändert, um sie an die Sicht und den Willen des Staates anzupassen. Heute hält sich der Glaube, dass „niemand überlebt das Archiv“, hartnäckig. Aber wenn wir die Möglichkeit hinzunehmen, das Archiv zu bearbeiten oder von Grund auf neu zu erstellen, die die Digitalisierung eröffnet, wird es viel schwieriger, Wahrheit von Lüge zu unterscheiden. Und genau das zeigt ein neues Projekt der University of Washington: die erstaunliche Kraft neuronaler Netze, angewendet auf visuelle Verarbeitung und Lippen-Synchronisation. Es lässt uns auch besorgt zurück.

Wie die Technologie funktioniert

Im Grunde erzeugt die Software präzise Lippen- und Mundbewegungen aus einer Audioaufnahme und legt sie dann über das Gesicht einer Person in einem bereits vorhandenen Video. Die Verantwortlichen des Projekts sagen, dass diese „realistische Umwandlung von Audio in Video“ praktische Anwendungen hat, wie die Optimierung von Videokonferenzen (statt ein ganzes Videosignal zu übertragen, erhält man nur den Ton und ein lokales Modell „spricht“ zu uns) oder in nicht allzu ferner Zukunft Gespräche mit historischen Figuren und Schauspielern per virtueller Realität. Warum Barack Obama? Eine einfache Frage des verfügbaren Materials. Das neuronale Netz muss trainiert werden, und es gibt eine enorme Menge an Videos des Ex-Präsidenten, die gemeinfrei sind.

Nein, die Synchronisation ist nicht perfekt, und die Macher wissen das. Aber es ist nur eine Frage der Zeit, bis die Effekte des Uncanny Valley der Vergangenheit angehören. Derzeit kann das neuronale Netz nur mit den Daten einer einzelnen Person gleichzeitig trainiert werden. Laut Professor und Koautor Steve Seitz ist es „nicht möglich“, die Stimme von irgendjemandem zu nehmen und in ein Video von Präsident Obama zu verwandeln. Wenn man sich jedoch die Kommentare in den Videos ansieht (eine hat sie bereits deaktiviert), denken die Leute anders.

Offizielle Ankündigung: