A metà dicembre abbiamo parlato di Riffusion, una variante di Stable Diffusion che ci permette di creare musica con intelligenza artificiale a partire da un semplice testo. Il tempo è dalla parte degli algoritmi, e con ogni nuovo progetto otteniamo risultati sempre più precisi. Oggi è il turno di Google Research, che ha appena presentato MusicLM. Oltre a creare audio a 24 KHz, questo modello supporta condizioni speciali come la generazione di melodie lunghe e una «modalità storia» per preparare sequenze.
L'esplosione virale di ChatGPT ha provocato un «codice rosso» in Google. Il gigante di Mountain View utilizza intelligenza artificiale a più livelli, ma tutto sembra indicare che si avvicina un'ondata di nuovi progetti come risposta diretta al chatbot di OpenAI. In altre parole, Google ha bisogno di mostrare un po' di più le sue carte al pubblico, e una di queste è MusicLM. Questo lavoro di Google Research ci propone qualcosa di molto interessante: Generare musica con intelligenza artificiale, usando una semplice descrizione.
MusicLM: come suona la musica fatta con intelligenza artificiale?
La pagina di dimostrazione non possiede un modello attivo di MusicLM, ma è piena di esempi accompagnati dai rispettivi prompt. L'addestramento di MusicLM si basa su «un grande dataset di musica non etichettata» e su un altro dataset chiamato MusicCaps, con un totale di 5.521 combinazioni di musica e testo. Le descrizioni di MusicCaps sono state create da esseri umani, e l'audio associato proviene da AudioSet, una collezione con più di due milioni di clip audio (dieci secondi di durata), estratti da YouTube.
«La colonna sonora principale di un gioco arcade. È veloce e allegra, con un riff di chitarra elettrica orecchiabile. La musica è ripetitiva e facile da ricordare, ma con suoni inaspettati, come colpi di piatti o rullate di tamburi.»
I risultati di MusicLM sono divisi in diverse categorie. La prima è «Rich Captions», con campioni di 30 secondi basati su una breve descrizione. «Long Generation» ci mostra il potenziale del modello per creare canzoni complete della durata di cinque minuti. «Story Mode» converte le descrizioni in sequenze con intervalli definiti, «Text and Melody Conditioning» combina il testo del prompt con una melodia di riferimento, e «Painting Caption Conditioning» genera audio ispirato a un dipinto o un'immagine.
A ciò si aggiunge la capacità di MusicLM di riprodurre strumenti e generi specifici, livelli di esperienza musicale (un pianista principiante o un maestro violinista), luoghi, epoche e altro. Tuttavia, tutto ciò che abbiamo finora sono i suoi esempi ufficiali. Google Research ha confermato che «non ci sono piani» per condividere i modelli per ora, e hanno molte sfide davanti (ipotetici problemi di copyright, pregiudizi culturali, ecc.).
Sito ufficiale: Clicca qui