A web não é mais a mesma. Temos deepfakes, deepnudes, pessoas falsas, paisagens falsas... e, claro, vozes. Com treinamento suficiente, mais cedo ou mais tarde um algoritmo poderá clonar vozes sem sacrificar muita precisão ou velocidade.
Em meados de 2018, falamos sobre o Lyrebird (hoje Descript) e sua capacidade de trabalhar com amostras pequenas. Hoje é a vez do Real Time Voice Cloning, um projeto aberto de Corentin Jemine que precisa de apenas cinco segundos de voz para reprodução em tempo real.
Imagine as consequências. Um áudio “vazado” de um político ou famoso dizendo coisas horríveis. Declarações contraditórias e insustentáveis. Mentiras. Erros. E tudo produto de um algoritmo, uma inteligência artificial treinada para reproduzir essas mensagens, seguindo um tom específico. Clonar vozes deixou de ser um privilégio do Terminator. Hoje, aqueles que possuem o conhecimento adequado podem pegar código livre e aberto, disponível neste momento, e começar a reproduzir vozes em tempo real. Se precisam de provas, bem...
... creio que essa demonstração do engenheiro especializado em aprendizado de máquina Corentin Jemine é mais que suficiente. Seu projeto Real Time Voice Cloning pode gerar frases arbitrárias em tempo real utilizando amostras mínimas como base. E quando digo “mínimas” me refiro a cinco segundos.
Seu trabalho se baseia em um estudo publicado em janeiro por uma equipe do Google Research, chamado “Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis”. Na página do GitHub também encontramos referências a outros documentos voltados para o vocoder WaveRNN, o sintetizador Tacotron 2 e o codificador GE2E.
Então... qual é a letra miúda? Em essência, não há binários para download. Qualquer usuário que decidir se aventurar com o Real Time Voice Cloning precisará de alguns conhecimentos de Python, baixar modelos pré-treinados ou se encarregar do treinamento. Infelizmente, o desenvolvedor está trabalhando em tempo integral, e seu tempo para o repositório é nulo. De todo modo, é questão de paciência. O mesmo aconteceu com o separador de vozes Spleeter, e em poucas semanas já existia uma versão online...
Real Time Voice Cloning (GitHub): Clique aqui