O pessoal da Meta continua compartilhando seus desenvolvimentos de inteligência artificial. Em meados de abril exploramos Animated Drawings para animar desenhos, seu chatbot Llama 2 apareceu nos últimos dias de julho, e agora é a vez do AudioCraft. Como o nome sugere, o AudioCraft se concentra na geração de áudio com inteligência artificial e consiste em três modelos: AudioGen, MusicGen e EnCodec. O código já está disponível para todos, mas se você quiser testar o MusicGen agora, pode fazer isso sem instalar nada.
Riffusion, MusicLM, Soundraw, SongR. A ideia de gerar música com inteligência artificial está ganhando tração na Web. Do ponto de vista técnico, essas plataformas ainda estão longe se comparadas com a geração de imagens, mas o tempo está definitivamente a seu favor, e com cada novo modelo, os parâmetros de qualidade continuarão melhorando.
Assim chegamos ao projeto AudioCraft de Meta. Esta biblioteca foi especialmente projetada para realizar pesquisas de aprendizado profundo em geração de áudio e se divide em três modelos avançados: AudioGen para a criação de efeitos sonoros, MusicGen para gerar música e EnCodec, um "codec de áudio neural" de alta fidelidade. O perfil do AudioCraft no GitHub contém todo o código e as instruções de instalação, mas você pode testar o MusicGen agora graças à presença da Meta no HuggingFace.
Como gerar música com prompts usando AudioCraft e MusicGen
Esta versão do MusicGen possui duas ferramentas: uma caixa para inserir nosso prompt e outra que nos permite carregar uma melodia ou amostra de microfone como referência. Clicamos em Generate, e isso nos levará à fila de espera. Em média, o HuggingFace reporta uma demora de 600-900 segundos, mas em alguns testes, o modelo levou metade desse tempo (é claro, isso dependerá da carga nos servidores). O resultado final é uma amostra de quinze segundos, em formato MP4.
"um bardo animado tocando alaúde em uma taverna"
"uma melodia de piano de igreja sinistra e premonitória, antecipando a aparição de um inimigo em um videogame"
"trilha sonora de um momento de êxtase em uma batalha espacial de um filme de ficção científica"
Quão bem funciona? Bem... não é terrível. O modelo não oferece nenhum controle de seed ou intensidade, mas parece seguir com certa precisão o nosso prompt. Obviamente, a descrição é escrita em inglês, e qualquer modificação mínima pode gerar melodias muito diferentes. O limite de quinze segundos é absoluto aqui, e também não devemos esperar um "loop" para utilizá-lo como fundo em algum projeto, no entanto, acredito que o MusicGen tem o potencial para se tornar uma ferramenta muito mais robusta.
Acesse o MusicGen: Clique aqui
AudioCraft no Facebook: Clique aqui