Le Web n'est plus le même. Nous avons des deepfakes, des deepnudes, des personnes fictives, des paysages fictifs… et bien sûr, des voix. Avec un entraînement suffisant, tôt ou tard un algorithme pourra cloner des voix sans sacrifier trop de précision ou de vitesse. A la mi-2018, nous parlions de Lyrebird (aujourd'hui Descript) et de sa capacité à travailler avec de petits échantillons. Aujourd'hui, c'est au tour de Real Time Voice Cloning, un projet open source de Corentin Jemine qui ne nécessite que cinq secondes de voix pour une reproduction en temps réel.

Clonage de voix en temps réel avec un échantillon de cinq secondes

Imaginez les conséquences. Un audio « filtré » d'un politicien ou d'une célébrité disant des choses horribles. Des déclarations contradictoires et insoutenables. Des mensonges. Des erreurs. Et tout cela issu d'un algorithme, d'une intelligence artificielle entraînée à reproduire ces messages, en suivant un ton spécifique. Cloner des voix a cessé d'être un privilège de Terminator. Aujourd'hui, ceux qui possèdent les connaissances appropriées peuvent prendre du code libre et ouvert, disponible à l'instant même, et commencer à reproduire des voix en temps réel. S'il vous faut des preuves, eh bien…

… je pense que cette démonstration de l'ingénieur spécialisé en apprentissage automatique Corentin Jemine est plus que suffisante. Son projet Real Time Voice Cloning peut générer des phrases arbitraires en temps réel en utilisant des échantillons minimaux comme base. Et quand je dis « minimaux », je fais référence à cinq secondes.

Son travail s'appuie sur une étude publiée en janvier de cette année par une équipe de Google Research, intitulée «Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis». Sur la page GitHub, on trouve également des références à d'autres documents orientés vers le vocodeur WaveRNN, le synthétiseur Tacotron 2, et l'encodeur GE2E.

Alors, quelle est la petite lettre ? En substance, il n'y a pas de binaires à télécharger. Tout utilisateur qui décide de se mouiller les pieds avec Real Time Voice Cloning devra avoir quelques connaissances en Python, télécharger des modèles pré-entraînés, ou s'occuper de l'entraînement. Malheureusement, le développeur travaille à plein temps, et son temps pour le référentiel est nul. De toute façon, c'est une question de patience. Il en a été de même avec le séparateur de voix Spleeter, et en quelques semaines, il y avait déjà une version en ligne...

Real Time Voice Cloning (GitHub) : Cliquez ici