„Lege mir keine Worte in den Mund, die ich nicht gesagt habe“ – dieser Satz wird in tausenden Diskussionen wiederholt, aber was wäre, wenn es möglich wäre, genau das zu tun? Denken wir einen Moment darüber nach: Heute zeigt uns Photoshop Dinge, die es nicht gibt. Wir haben Initiativen beobachtet, die das Potenzial haben, verstorbene Schauspieler zu digitalisieren und sie auf die große Leinwand zurückzubringen. Die Assistenten auf mobilen Geräten erkennen unsere Stimme perfekt. Wie schwierig wäre es, sie dann zu imitieren? Das Project VoCo von Adobe versucht, das herauszufinden.

Project VoCo: Das „Photoshop“ für Audio von Adobe
Project VoCo

Was ist Project VoCo?

Die MAX-Konferenz, die Adobe jedes Jahr veranstaltet, ermöglicht Entwicklern und Verbrauchern gleichermaßen, einige der Dinge, an denen das Unternehmen arbeitet, genauer zu sehen, sei es direkt auf den Markt gebrachte Produkte oder relativ obskure Prototypen. In diese zweite Kategorie passt Project VoCo, etwas, das uns mit seinem Namen nicht viel sagt, aber ein erschreckendes Potenzial mit sich bringt. Was für ein Potenzial? Schauen wir: Wir alle wissen, was Photoshop in den Händen eines Experten tun kann. Modelle haben keine einzige Unvollkommenheit auf ihrer Haut, noch nicht gebaute Autos führen spektakuläre Manöver am Strand aus, und Politiker verlieren zehn oder fünfzehn Jahre, wenn sie im Wahlkampf sind. Nun denken wir an diese Ressourcen, angewendet auf Audio. Die Rede von jemandem nehmen, sie bearbeiten, Wörter ersetzen und platzieren, die nicht dort sind.

Project VoCo: Das „Photoshop“ für Audio von Adobe
Live-Demo von VoCo während der MAX-Konferenz

Darum geht es bei Project VoCo. In den Worten des Adobe-Entwicklers Zeyu Jin: VoCo macht für Audio das, was Photoshop für die Fotografie macht. Die Software ist derzeit so etwas wie eine Pre-Alpha, aber wenn wir den kurzen Demonstrationen glauben, muss der Benutzer nur Text in ein kleines Dialogfeld eingeben, und VoCo wird es mit genau derselben Stimme abspielen. Natürlich erfordert eine solche Funktion eine sehr umfassende Analyse des Audios, und mehrere Quellen deuten darauf hin, dass VoCo mindestens 20 Minuten Inhalt benötigt, um eine getreue Wiedergabe zu erstellen. Wenn wir berechnen, wie lange Reden einiger Politiker im Durchschnitt dauern, bin ich überzeugt, dass VoCo mehr als genug Material hat.

Ethische Bedenken

Obwohl Adobe legitime Gründe hat, ein Projekt mit diesen Eigenschaften voranzutreiben, haben die ethischen Alarmglocken nicht aufgehört zu läuten. Wie immer ist nicht das Werkzeug schuld, sondern derjenige, der es benutzt. Wenn VoCo in skrupellose Hände gerät, könnte eine logische und kohärente Rede in aggressiv oder streitlustig umgewandelt werden – und umgekehrt. Es ist bereits sehr schwierig für uns, bearbeitete Bilder und gefälschte Videos zu erkennen. Stellen Sie sich vor, diesen Konflikt auf ein Audiostück auszudehnen, das ein paar Stunden dauern kann. Trotzdem werden wir VoCo weiterhin genau beobachten.

Quelle: