Das Internet ist nicht mehr dasselbe. Wir haben Deepfakes, Deepnudes, falsche Menschen, falsche Landschaften … und natürlich Stimmen. Mit ausreichend Training kann ein Algorithmus früher oder später Stimmen klonen, ohne zu viel Präzision oder Geschwindigkeit zu opfern. Mitte 2018 sprachen wir über Lyrebird (heute Descript) und seine Fähigkeit, mit kleinen Proben zu arbeiten. Heute ist Real Time Voice Cloning an der Reihe, ein offenes Projekt von Corentin Jemine, das nur fünf Sekunden Stimme für die Echtzeitwiedergabe benötigt.
Stell dir die Konsequenzen vor. Ein „geleaktes“ Audio eines Politikers oder Prominenten, das schreckliche Dinge sagt. Widersprüchliche und unhaltbare Aussagen. Lügen. Fehler. Und alles das Produkt eines Algorithmus, einer künstlichen Intelligenz, die darauf trainiert ist, diese Botschaften mit einem bestimmten Ton zu reproduzieren. Stimmen zu klonen ist kein Privileg des Terminators mehr. Heute können diejenigen, die über das entsprechende Wissen verfügen, freien und offenen Code nehmen, der in diesem Moment verfügbar ist, und beginnen, Stimmen in Echtzeit zu reproduzieren. Wenn sie Beweise brauchen, nun ja…
… ich denke, diese Demonstration des auf maschinelles Lernen spezialisierten Ingenieurs Corentin Jemine ist mehr als ausreichend. Sein Projekt Real Time Voice Cloning kann in Echtzeit beliebige Sätze generieren, indem es minimale Proben als Grundlage verwendet. Und wenn ich „minimal“ sage, meine ich fünf Sekunden.
Seine Arbeit basiert auf einer Studie, die im Januar dieses Jahres von einem Team von Google Research veröffentlicht wurde, mit dem Titel „Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis“. Auf der GitHub-Seite finden wir auch Verweise auf andere Dokumente, die sich mit dem WaveRNN-Vocoder, dem Synthesizer Tacotron 2 und dem GE2E-Encoder befassen.
Also … was ist das Kleingedruckte? Im Wesentlichen gibt es keine Binärdateien zum Herunterladen. Jeder Benutzer, der sich mit Real Time Voice Cloning die Füße nass machen möchte, benötigt einige Kenntnisse in Python, muss vortrainierte Modelle herunterladen oder sich um das Training kümmern. Leider arbeitet der Entwickler Vollzeit, und seine Zeit für das Repository ist gleich null. Trotzdem ist es eine Frage der Geduld. Dasselbe geschah mit dem Stimmseparator Spleeter, und nach ein paar Wochen gab es bereits eine Online-Version …
Real Time Voice Cloning (GitHub): Hier klicken