Em meados de dezembro falamos sobre o Riffusion, uma variante do Stable Diffusion que permite criar música com inteligência artificial a partir de um simples texto. O tempo está a favor dos algoritmos, e a cada novo projeto conseguimos resultados mais precisos. Agora é a vez do Google Research, que acaba de apresentar o MusicLM. Além de criar áudio em 24 kHz, esse modelo suporta condições especiais como a geração de melodias longas e um «modo história» para preparar sequências.
A explosão viral do ChatGPT provocou um «código vermelho» no Google. O gigante de Mountain View usa inteligência artificial em vários níveis, mas tudo indica que se aproxima uma onda de novos projetos como resposta direta ao chatbot da OpenAI. Em outras palavras, o Google precisa mostrar suas cartas um pouco mais, e uma delas é o MusicLM. Este trabalho do Google Research nos propõe algo muito interessante: gerar música com inteligência artificial usando uma simples descrição.
MusicLM: como soa a música feita com inteligência artificial?
A página de demonstração não possui um modelo ativo do MusicLM, mas está repleta de exemplos acompanhados de seus respectivos prompts. O treinamento do MusicLM é baseado em «um grande dataset de música sem etiquetas» e em outro dataset chamado MusicCaps, com um total de 5.521 combinações de música e texto. As descrições do MusicCaps foram criadas por humanos, e o áudio associado vem do AudioSet, uma coleção com mais de dois milhões de clipes de áudio (dez segundos de duração), extraídos do YouTube.
«A trilha sonora principal de um jogo de arcade. É acelerada e animada, com um riff de guitarra elétrica cativante. A música é repetitiva e fácil de lembrar, mas com sons inesperados, como batidas de prato ou rufos de tambor.»
Os resultados do MusicLM estão divididos em várias categorias. A primeira delas é «Rich Captions», com amostras de 30 segundos baseadas em uma breve descrição. «Long Generation» nos mostra o potencial do modelo para criar músicas completas com duração de cinco minutos. «Story Mode» converte as descrições em sequências com intervalos definidos, «Text and Melody Conditioning» combina o texto do prompt com uma melodia de referência, e «Painting Caption Conditioning» gera áudio inspirado em uma pintura ou imagem.
A isso se soma a capacidade do MusicLM de reproduzir instrumentos e gêneros específicos, níveis de experiência musical (um pianista novato ou um maestro violinista), lugares, épocas e muito mais. No entanto, tudo o que temos até aqui são os exemplos oficiais. O Google Research confirmou que «não há planos» para compartilhar modelos por enquanto, e eles têm muitos desafios pela frente (hipotéticos problemas de copyright, viés cultural etc.).
Site oficial: Clique aqui