Les équipes de Meta continuent de partager leurs développements en intelligence artificielle. À la mi-avril, nous avons exploré Animated Drawings pour animer des dessins, leur chatbot Llama 2 est apparu à la fin de juillet, et c'est maintenant au tour d'AudioCraft. Comme son nom l'indique, AudioCraft se concentre sur la génération audio par intelligence artificielle, et se compose de trois modèles : AudioGen, MusicGen et EnCodec. Le code est déjà disponible pour tous, mais si vous voulez essayer MusicGen dès maintenant, vous pouvez le faire sans rien installer.
Riffusion, MusicLM, Soundraw, SongR. L'idée de générer de la musique avec l'IA gagne du terrain sur le Web. D'un point de vue technique, ces plateformes sont encore loin en comparaison avec la génération d'images, mais le temps est clairement en leur faveur, et avec chaque nouveau modèle, les paramètres de qualité continueront de s'améliorer.
Nous arrivons donc au projet AudioCraft de Meta. Cette bibliothèque a été spécialement conçue pour la recherche en apprentissage profond pour la génération audio, et se divise en trois modèles avancés : AudioGen pour la création d'effets sonores, MusicGen pour générer de la musique, et EnCodec, un « codec audio neuronal » haute fidélité. Le profil AudioCraft sur GitHub contient tout le code et les instructions d'installation, mais vous pouvez essayer MusicGen dès maintenant grâce à la présence de Meta sur HuggingFace.
Comment générer de la musique avec des prompts en utilisant AudioCraft et MusicGen
Cette version de MusicGen dispose de deux outils : une boîte pour saisir notre prompt, et une autre qui nous permet de charger une mélodie ou un échantillon de micro comme référence. Nous cliquons sur Generate, et cela nous mènera à la file d'attente. En moyenne, HuggingFace rapporte un délai de 600 à 900 secondes, mais lors de certains tests, le modèle a mis la moitié de ce temps (bien sûr, cela dépendra de la charge des serveurs). Le résultat final est un échantillon de quinze secondes, au format MP4.
«a lively bard playing the lute on a tavern»
«an ominous, foreboding church piano melody, anticipating the appearance of an enemy in a videogame»
«soundtrack of a ecstatic moment in a space battle of a sci fi movie»
Est-ce que ça fonctionne bien ? Eh bien… ce n'est pas terrible. Le modèle n'offre aucun contrôle de graine (seed) ou d'intensité, mais il semble suivre notre prompt avec une certaine précision. Évidemment, la description s'écrit en anglais, et toute modification minimale peut générer des mélodies très différentes. La limite de quinze secondes est absolue ici, et il ne faut pas non plus espérer un « boucle » pour l'utiliser en fond de projet. Cependant, je pense que MusicGen a le potentiel pour devenir un outil beaucoup plus robuste.
Accédez à MusicGen : Cliquez ici
AudioCraft sur GitHub : Cliquez ici