Os desenvolvedores de plataformas generativas se adaptam a novas exigências. Entusiastas e artistas combatem nas redes sociais. E em meio a todo esse caos surgem novos projetos baseados em inteligência artificial. Um deles é o Riffusion, que utiliza uma versão otimizada do Stable Diffusion para criar espectrogramas, representações visuais do som que podemos ouvir facilmente.

Riffusion: uma variante do Stable Diffusion para criar música com inteligência artificial
Riffusion

Imagens, vídeos, vozes, música. Os projetos de inteligência artificial continuam evoluindo… com opiniões a favor e contra. Recentemente vimos protestos, muitas trocas que equivalem a tijoladas digitais, e enormes dúvidas em matéria de copyright e fair use. Tarde ou cedo, os conflitos legais chegarão a instâncias superiores, mas independentemente do que aconteça, a inteligência artificial continuará nos surpreendendo.

Hoje é a vez de uma nova plataforma generativa chamada Riffusion, desenvolvida por Seth Forsgren e Hayk Martiros. Tal como o nome sugere, Riffusion tem alma de Stable Diffusion, com uma diferença: o modelo foi especialmente otimizado para gerar sonogramas/espectrogramas. Em outras palavras, representações visuais de áudio baseadas em prompts de texto.

Riffusion: de texto a áudio com inteligência artificial

Riffusion: uma variante do Stable Diffusion para criar música com inteligência artificial
Insira um prompt e deixe o modelo fazer o resto

A página não requer nenhum tipo de conta, nem a compra de tokens para gerar sons. Na verdade, recomenda que o usuário experimente inserindo seus estilos e instrumentos favoritos. As combinações são definitivamente bem-vindas, por exemplo, gospel tropical. Também é possível criar prompts que indiquem a presença de vozes (um dos mais interessantes que encontrei foi «vencedor de programa de talentos pop pós-adolescente»), mas não devemos esperar nenhum diálogo claro.

O sonograma/espectrograma é fácil de interpretar: o eixo X representa o tempo, o eixo Y a frequência dos sons, e a cor de cada pixel a amplitude. A última fase fica a cargo do Torchaudio, que pega a imagem gerada pelo Stable Diffusion e a converte em áudio. A seção About do Riffusion é excelente e merece sua atenção.

Riffusion: uma variante do Stable Diffusion para criar música com inteligência artificial
Assim como em outros modelos, você pode alterar o seed e o nível de denoising

A configuração avançada nos permite alterar a imagem que serve como seed (cinco opções diferentes) e o nível de denoising. Quanto mais alto, mais "criativo" é o output... mas se afastará do que você deseja. Esse comportamento é idêntico ao do Stable Diffusion processando imagens. Outra coisa que ele pega emprestado é o peso dos prompts. Por exemplo, uma ênfase em violinos pode ser escrita como (violin:1.25) entre parênteses, ou colchetes para minimizar seu impacto: [violin] equivale a uma redução de 1.1x.

Para finalizar, o servidor do Riffusion está sendo bombardeado com solicitações, portanto, é preciso ter paciência. Você também precisará de boa aceleração de hardware no seu navegador, porque o site oficial é bastante exigente. Faça o teste!

Site oficial: Clique aqui