MusicLM : intelligence artificielle pour générer de la musique à partir de texte
Intelligence artificielle pour générer de la musique

À la mi-décembre, nous avons parlé de Riffusion, une variante de Stable Diffusion qui nous permet de créer de la musique avec l'intelligence artificielle à partir d'un simple texte. Le temps joue en faveur des algorithmes, et chaque nouveau projet nous donne des résultats plus précis. Aujourd'hui, c'est au tour de Google Research, qui vient de présenter MusicLM. En plus de créer de l'audio en 24 kHz, ce modèle prend en charge des conditions spéciales comme la génération de longues mélodies et un « mode histoire » pour préparer des séquences.

L'explosion virale de ChatGPT a provoqué un « code rouge » chez Google. Le géant de Mountain View utilise l'intelligence artificielle à plusieurs niveaux, mais tout semble indiquer qu'une vague de nouveaux projets approche en réponse directe au chatbot d'OpenAI. Autrement dit, Google doit montrer un peu plus ses cartes au public, et l'une d'elles est MusicLM. Ce travail de Google Research nous propose quelque chose de très intéressant : générer de la musique avec l'intelligence artificielle en utilisant une simple description.

MusicLM : comment sonne la musique créée par intelligence artificielle ?

MusicLM : intelligence artificielle pour générer de la musique à partir de texte
C'est ainsi : MusicLM peut s'inspirer de peintures

La page de démonstration ne dispose pas d'un modèle actif de MusicLM, mais elle est pleine d'exemples accompagnés de leurs prompts respectifs. L'entraînement de MusicLM repose sur « un grand ensemble de données musicales non étiquetées » et sur un autre ensemble de données appelé MusicCaps, avec un total de 5 521 combinaisons de musique et de texte. Les descriptions de MusicCaps ont été créées par des humains, et l'audio associé provient d'AudioSet, une collection de plus de deux millions de clips audio (d'une durée de dix secondes) extraits de YouTube.

La bande-son principale d'un jeu d'arcade. Elle est rapide et entraînante, avec un riff de guitare électrique accrocheur. La musique est répétitive et facile à retenir, mais avec des sons inattendus, comme des crashes de cymbales ou des roulements de tambour.

Les résultats de MusicLM sont répartis en plusieurs catégories. La première est «Rich Captions», avec des échantillons de 30 secondes basés sur une brève description. «Long Generation» nous montre le potentiel du modèle pour créer des chansons complètes d'une durée de cinq minutes. «Story Mode» transforme les descriptions en séquences à intervalles définis, «Text and Melody Conditioning» combine le texte du prompt avec une mélodie de référence, et «Painting Caption Conditioning» génère de l'audio inspiré d'une peinture ou d'une image.

MusicLM : intelligence artificielle pour générer de la musique à partir de texte
Le mode Story transforme le prompt en une séquence à suivre

S'ajoute à cela la capacité de MusicLM à reproduire des instruments et des genres spécifiques, des niveaux d'expérience musicale (un pianiste débutant ou un maître violoniste), des lieux, des époques, et plus encore. Cependant, tout ce que nous avons jusqu'ici, ce sont ses exemples officiels. Google Research a confirmé qu'il n'y a « pas de projets » pour partager des modèles pour l'instant, et ils ont de nombreux défis à relever (problèmes hypothétiques de droit d'auteur, biais culturel, etc.).

Site officiel : Cliquez ici