Riffusion: una variante di Stable Diffusion per creare musica con intelligenza artificiale
Riffusion

Gli sviluppatori di piattaforme generative si adattano a nuove esigenze. Gli appassionati e gli artisti «combattono» sui social network. E in mezzo a tutto questo caos emergono nuovi progetti basati sull'intelligenza artificiale. Uno di questi è Riffusion, che utilizza una versione ottimizzata di Stable Diffusion per creare spettrogrammi, rappresentazioni visive del suono che possiamo ascoltare facilmente.

Immagini, video, voci, musica. I progetti di intelligenza artificiale continuano a evolversi... con opinioni a favore e contro. Recentemente abbiamo visto proteste, molti «scambi» che equivalgono a mattonate digitali, e enormi dubbi in materia di copyright e fair use. Prima o poi, i conflitti legali arriveranno a istanze superiori, ma indipendentemente da ciò che accadrà, l'intelligenza artificiale continuerà a sorprenderci.

Oggi è il turno di una nuova piattaforma generativa chiamata Riffusion, sviluppata da Seth Forsgren e Hayk Martiros. Come suggerisce il nome, Riffusion ha l'anima di Stable Diffusion, con una differenza: il modello è stato appositamente ottimizzato per generare sonogrammi/spettrogrammi. In altre parole, rappresentazioni visive dell'audio basate su prompt di testo.

Riffusion: dal testo all'audio con intelligenza artificiale

Riffusion: una variante di Stable Diffusion per creare musica con intelligenza artificiale
Inserisci un prompt e lascia che il modello faccia il resto

La pagina non richiede alcun account, né l'acquisto di token per generare suoni. Infatti, consiglia all'utente di sperimentare inserendo i propri stili e strumenti preferiti. Le combinazioni sono decisamente benvenute, ad esempio «gospel tropical». È anche possibile creare prompt che indichino la presenza di voci (uno dei più interessanti che ho trovato è stato «vincitore di un talent show pop post-adolescenziale»), ma non dobbiamo aspettarci alcun dialogo chiaro.

Il sonogramma/spettrogramma è facile da interpretare: l'asse X rappresenta il tempo, l'asse Y la frequenza dei suoni e il colore di ogni pixel la sua ampiezza. L'ultima fase è affidata a Torchaudio, che prende l'immagine generata da Stable Diffusion e la converte in audio. La sezione About di Riffusion è eccellente e merita la tua attenzione.

Riffusion: una variante di Stable Diffusion per creare musica con intelligenza artificiale
Come in altri modelli, puoi modificare il seed e il livello di denoising

La configurazione avanzata ci permette di cambiare l'immagine che funge da seed (cinque opzioni diverse) e il livello di denoising. Più è alto, più «creativo» risulta il suo output... ma si allontanerà da ciò che vuoi. Questo comportamento è identico a quello di Stable Diffusion che elabora immagini. Un'altra cosa che prende in prestito è il peso dei prompt. Ad esempio, un'enfasi sui violini può essere scritta come (violin:1.25) tra parentesi, o con parentesi quadre per minimizzarne l'impatto: [violin] equivale a una riduzione di 1.1x.

Per concludere, il server di Riffusion è bombardato di richieste, quindi bisogna armarsi di pazienza. Avrai anche bisogno di una buona accelerazione hardware nel tuo browser, perché il sito ufficiale è piuttosto esigente. Fai la prova!

Sito ufficiale: Clicca qui