Het web is niet meer hetzelfde. We hebben deepfakes, deepnudes, nepmensen, neplanschappen... en natuurlijk stemmen. Met voldoende training kan een algoritme vroeg of laat stemmen klonen zonder al te veel precisie of snelheid op te offeren. Halverwege 2018 spraken we over Lyrebird (nu Descript) en zijn vermogen om met kleine samples te werken. Vandaag is het de beurt aan Real Time Voice Cloning, een open project van Corentin Jemine dat slechts vijf seconden spraak nodig heeft voor realtime reproductie.

Realtime stemklonen, met een sample van vijf seconden

Beeld je de gevolgen in. Een ‘gelekte’ audio van een politicus of een beroemdheid die vreselijke dingen zegt. Tegenstrijdige en onhoudbare verklaringen. Leugens. Fouten. En alles product van een algoritme, een kunstmatige intelligentie die getraind is om die boodschappen te reproduceren, volgens een specifieke toon. Stemmen klonen is niet langer een privilege van de Terminator. Vandaag kunnen zij die over de juiste kennis beschikken vrije en open code nemen, beschikbaar op dit moment, en beginnen met het in realtime reproduceren van stemmen. Als ze bewijs nodig hebben, nou ja…

… ik denk dat deze demonstratie van machine learning-ingenieur Corentin Jemine meer dan genoeg is. Zijn project Real Time Voice Cloning kan willekeurige zinnen in realtime genereren met behulp van minimale samples als basis. En als ik 'minimaal' zeg, bedoel ik vijf seconden.

Zijn werk is gebaseerd op een studie die in januari van dit jaar is gepubliceerd door een team van Google Research, genaamd Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis. Op de GitHub-pagina vinden we ook verwijzingen naar andere documenten die gericht zijn op de WaveRNN-vocoder, de Tacotron 2-synthesizer en de GE2E-encoder.

Dus… wat is de kleine lettertjes? In wezen zijn er geen binaries om te downloaden. Elke gebruiker die zijn voeten wil natmaken met Real Time Voice Cloning heeft wat kennis van Python nodig, het downloaden van voorgetrainde modellen, of het verzorgen van de training. Helaas werkt de ontwikkelaar fulltime, en heeft hij geen tijd voor de repository. Hoe dan ook, het is een kwestie van geduld. Hetzelfde gebeurde met de stemmenafscheider Spleeter, en na een paar weken was er al een onlineversie

Real Time Voice Cloning (GitHub): Klik hier