La Rete non è più la stessa. Abbiamo deepfakes, deepnudes, persone false, paesaggi falsi… e ovviamente voci. Con un addestramento sufficiente, prima o poi un algoritmo potrà clonare voci senza sacrificare troppo in precisione o velocità. A metà 2018 abbiamo parlato di Lyrebird (oggi Descript) e della sua capacità di lavorare con campioni piccoli. Oggi tocca a Real Time Voice Cloning, un progetto open source di Corentin Jemine che richiede solo cinque secondi di voce per la riproduzione in tempo reale.

Clonazione vocale in tempo reale con un campione di cinque secondi

Immagina le conseguenze. Un audio «filtrato» di un politico o di un personaggio famoso che dice cose terribili. Dichiarazioni contraddittorie e insostenibili. Bugie. Errori. E tutto frutto di un algoritmo, di un'intelligenza artificiale addestrata a riprodurre quei messaggi con un tono specifico. Clonare voci ha smesso di essere un privilegio del Terminator. Oggi, chi possiede le conoscenze adeguate può prendere codice libero e aperto, disponibile in questo momento, e iniziare a riprodurre voci in tempo reale. Se servono prove, beh…

… credo che questa dimostrazione dell'ingegnere specializzato in apprendimento automatico Corentin Jemine sia più che sufficiente. Il suo progetto Real Time Voice Cloning può generare frasi arbitrarie in tempo reale utilizzando campioni minimi come base. E quando dico «minime» intendo cinque secondi.

Il suo lavoro si basa su uno studio pubblicato a gennaio di quest'anno da un team di Google Research, intitolato «Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis». Nella pagina di GitHub troviamo anche riferimenti ad altri documenti orientati al vocoder WaveRNN, al sintetizzatore Tacotron 2 e al codificatore GE2E.

Quindi… qual è la clausola? In sostanza, non ci sono binari da scaricare. Qualsiasi utente che decida di bagnarsi i piedi con Real Time Voice Cloning avrà bisogno di alcune conoscenze di Python, scaricare modelli pre-addestrati o occuparsi dell'addestramento. Purtroppo, lo sviluppatore sta lavorando full time e il suo tempo per il repository è nullo. In ogni caso, è questione di pazienza. Lo stesso è successo con il separatore di voci Spleeter, e dopo poche settimane esisteva già una versione online

Real Time Voice Cloning (GitHub): Clicca qui