Les développeurs de plateformes génératives s'adaptent à de nouvelles exigences. Les passionnés et les artistes « se battent » sur les réseaux sociaux. Et au milieu de tout ce chaos, de nouveaux projets basés sur l'intelligence artificielle émergent. L'un d'eux est Riffusion, qui utilise une version optimisée de Stable Diffusion pour créer des spectrogrammes, représentations visuelles du son que nous pouvons facilement écouter.

Images, vidéos, voix, musique. Les projets d'intelligence artificielle continuent d'évoluer… avec des opinions pour et contre. Récemment, nous avons vu des protestations, de nombreux « échanges » qui équivalent à des briques numériques, et d'énormes doutes en matière de copyright et d'utilisation équitable. Tôt ou tard, les conflits juridiques atteindront les instances supérieures, mais indépendamment de ce qui se passe, l'intelligence artificielle continuera de nous surprendre.

Aujourd'hui, c'est au tour d'une nouvelle plateforme générative appelée Riffusion, développée par Seth Forsgren et Hayk Martiros. Comme son nom l'indique, Riffusion a l'âme de Stable Diffusion, avec une différence : le modèle a été spécialement optimisé pour générer des sonogrammes/spectrogrammes. En d'autres termes, des représentations visuelles de l'audio basées sur des prompts textuels.

Riffusion : une variante de Stable Diffusion pour créer de la musique avec l'intelligence artificielle
Riffusion

Riffusion : du texte à l'audio avec l'intelligence artificielle

Le site ne nécessite aucun compte, ni l'achat de jetons pour générer des sons. En fait, il recommande à l'utilisateur d'expérimenter en saisissant ses styles et instruments préférés. Les combinaisons sont définitivement bienvenues, par exemple, « gospel tropical ». Il est également possible de créer des prompts indiquant la présence de voix (l'un des plus intéressants que j'ai trouvés était «post-teen pop talent show winner»), mais il ne faut pas s'attendre à un dialogue clair.

Riffusion : une variante de Stable Diffusion pour créer de la musique avec l'intelligence artificielle
Entrez un prompt, et laissez le modèle faire le reste.

Le sonogramme/spectrogramme est facile à interpréter : l'axe X représente le temps, l'axe Y la fréquence des sons, et la couleur de chaque pixel son amplitude. La dernière phase incombe à Torchaudio, qui prend l'image générée par Stable Diffusion et la convertit en audio. La section À propos de Riffusion est excellente et mérite votre attention.

Riffusion : une variante de Stable Diffusion pour créer de la musique avec l'intelligence artificielle
Comme pour d'autres modèles, vous pouvez modifier le seed et le niveau de denoising.

La configuration avancée nous permet de changer l'image qui sert de seed (cinq options différentes), et le niveau de denoising. Plus il est élevé, plus son output est « créatif »… mais il s'éloignera de ce que vous voulez. Ce comportement est identique à celui de Stable Diffusion lors du traitement d'images. Une autre chose qu'elle emprunte, c'est le poids des prompts. Par exemple, une emphase sur les violons peut être écrite comme (violin:1.25) entre parenthèses, ou entre crochets pour minimiser son impact : [violin] équivaut à une réduction de 1.1x.

Pour terminer, le serveur de Riffusion est bombardé de requêtes, il faut donc s'armer de patience. Vous aurez également besoin d'une bonne accélération matérielle dans votre navigateur, car le site officiel est assez exigeant. Faites l'essai !

Site officiel : Cliquez ici.