Os desenvolvedores de plataformas generativas se adaptam a novas exigências. Entusiastas e artistas combatem nas redes sociais. E em meio a todo esse caos surgem novos projetos baseados em inteligência artificial. Um deles é o Riffusion, que utiliza uma versão otimizada do Stable Diffusion para criar espectrogramas, representações visuais do som que podemos ouvir facilmente.
Imagens, vídeos, vozes, música. Os projetos de inteligência artificial continuam evoluindo… com opiniões a favor e contra. Recentemente vimos protestos, muitas trocas que equivalem a tijoladas digitais, e enormes dúvidas em matéria de copyright e fair use. Tarde ou cedo, os conflitos legais chegarão a instâncias superiores, mas independentemente do que aconteça, a inteligência artificial continuará nos surpreendendo.
Hoje é a vez de uma nova plataforma generativa chamada Riffusion, desenvolvida por Seth Forsgren e Hayk Martiros. Tal como o nome sugere, Riffusion tem alma de Stable Diffusion, com uma diferença: o modelo foi especialmente otimizado para gerar sonogramas/espectrogramas. Em outras palavras, representações visuais de áudio baseadas em prompts de texto.
Riffusion: de texto a áudio com inteligência artificial
A página não requer nenhum tipo de conta, nem a compra de tokens para gerar sons. Na verdade, recomenda que o usuário experimente inserindo seus estilos e instrumentos favoritos. As combinações são definitivamente bem-vindas, por exemplo, gospel tropical. Também é possível criar prompts que indiquem a presença de vozes (um dos mais interessantes que encontrei foi «vencedor de programa de talentos pop pós-adolescente»), mas não devemos esperar nenhum diálogo claro.
O sonograma/espectrograma é fácil de interpretar: o eixo X representa o tempo, o eixo Y a frequência dos sons, e a cor de cada pixel a amplitude. A última fase fica a cargo do Torchaudio, que pega a imagem gerada pelo Stable Diffusion e a converte em áudio. A seção About do Riffusion é excelente e merece sua atenção.
A configuração avançada nos permite alterar a imagem que serve como seed (cinco opções diferentes) e o nível de denoising. Quanto mais alto, mais "criativo" é o output... mas se afastará do que você deseja. Esse comportamento é idêntico ao do Stable Diffusion processando imagens. Outra coisa que ele pega emprestado é o peso dos prompts. Por exemplo, uma ênfase em violinos pode ser escrita como (violin:1.25) entre parênteses, ou colchetes para minimizar seu impacto: [violin] equivale a uma redução de 1.1x.
Para finalizar, o servidor do Riffusion está sendo bombardeado com solicitações, portanto, é preciso ter paciência. Você também precisará de boa aceleração de hardware no seu navegador, porque o site oficial é bastante exigente. Faça o teste!
Site oficial: Clique aqui