Riffusion: Eine Variante von Stable Diffusion zum Erzeugen von Musik mit künstlicher Intelligenz
Riffusion

Die Entwickler generativer Plattformen passen sich neuen Anforderungen an. Enthusiasten und Künstler „kämpfen“ in den sozialen Medien. Und in diesem ganzen Chaos entstehen neue Projekte, die auf künstlicher Intelligenz basieren. Eines davon ist Riffusion, das eine optimierte Version von Stable Diffusion verwendet, um Spektrogramme zu erzeugen, visuelle Darstellungen von Klang, die wir leicht anhören können.

Bilder, Videos, Stimmen, Musik. Die Projekte der künstlichen Intelligenz entwickeln sich weiter… mit Meinungen dafür und dagegen. In letzter Zeit haben wir Proteste gesehen, viele „Austausche“, die digitalen Hieben gleichkommen, und enorme Zweifel in Bezug auf Urheberrecht und Fair Use. Früher oder später werden die rechtlichen Konflikte in höhere Instanzen gelangen, aber unabhängig davon, was passiert, wird uns die künstliche Intelligenz weiterhin überraschen.

Heute ist eine neue generative Plattform namens Riffusion, entwickelt von Seth Forsgren und Hayk Martiros. Wie der Name schon sagt, hat Riffusion die Seele von Stable Diffusion, mit einem Unterschied: Das Modell wurde speziell optimiert, um Sonogramme/Spektrogramme zu erzeugen. Mit anderen Worten, visuelle Darstellungen von Audio, die auf Text-Prompts basieren.

Riffusion: Von Text zu Audio mit künstlicher Intelligenz

Riffusion: Eine Variante von Stable Diffusion zum Erzeugen von Musik mit künstlicher Intelligenz
Gib einen Prompt ein und lass das Modell den Rest erledigen

Die Seite erfordert kein Konto und auch keinen Kauf von Tokens, um Geräusche zu erzeugen. Tatsächlich empfiehlt sie dem Nutzer, mit seinen Lieblingsstilen und -instrumenten zu experimentieren. Kombinationen sind ausdrücklich willkommen, zum Beispiel „gospel tropical“. Es ist auch möglich, Prompts zu erstellen, die das Vorhandensein von Stimmen anzeigen (einer der interessantesten, die ich fand, war „post-teen pop talent show winner“), aber wir sollten keinen klaren Dialog erwarten.

Das Sonogramm/Spektrogramm ist einfach zu interpretieren: Die X-Achse stellt die Zeit dar, die Y-Achse die Frequenz der Töne, und die Farbe jedes Pixels seine Amplitude. Die letzte Phase übernimmt Torchaudio, das das von Stable Diffusion erzeugte Bild nimmt und in Audio umwandelt. Der About-Bereich von Riffusion ist exzellent und verdient deine Aufmerksamkeit.

Riffusion: Eine Variante von Stable Diffusion zum Erzeugen von Musik mit künstlicher Intelligenz
Wie bei anderen Modellen kannst du den Seed und den Denoising-Wert verändern

Die erweiterten Einstellungen erlauben uns, das Bild zu ändern, das als Seed dient (fünf verschiedene Optionen), und den Grad des Denoising. Je höher er ist, desto „kreativer“ ist das Output… aber es entfernt sich von dem, was du willst. Dieses Verhalten ist identisch mit dem von Stable Diffusion bei der Bildverarbeitung. Eine weitere Sache, die es übernimmt, ist das Gewicht der Prompts. Zum Beispiel kann eine Betonung auf Geigen als (violin:1.25) in Klammern geschrieben werden, oder eckige Klammern, um ihre Wirkung zu minimieren: [violin] entspricht einer Reduzierung um das 1,1-fache.

Zum Schluss wird der Riffusion-Server mit Anfragen bombardiert, daher muss man sich in Geduld üben. Außerdem brauchst du eine gute Hardwarebeschleunigung in deinem Browser, denn die offizielle Website ist ziemlich anspruchsvoll. Probier es aus!

Offizielle Website: Klicke hier