Ontwikkelaars van generatieve platforms passen zich aan nieuwe eisen aan. Enthousiastelingen en kunstenaars 'vechten' op sociale media. En te midden van al die chaos ontstaan nieuwe projecten op basis van kunstmatige intelligentie. Een daarvan is Riffusion, dat een geoptimaliseerde versie van Stable Diffusion gebruikt om spectrogrammen te maken, visuele weergaven van geluid die we gemakkelijk kunnen beluisteren.

Riffusion: een variant van Stable Diffusion om muziek te maken met kunstmatige intelligentie
Riffusion

Afbeeldingen, video's, stemmen, muziek. De projecten op het gebied van kunstmatige intelligentie blijven evolueren... met voor- en tegenstanders. Recentelijk hebben we protesten gezien, veel 'uitwisselingen' die neerkomen op digitale bakstenen, en enorme twijfels over copyright en fair use. Vroeg of laat zullen juridische conflicten naar hogere instanties gaan, maar ongeacht wat er gebeurt, kunstmatige intelligentie zal ons blijven verrassen.

Vandaag is het de beurt aan een nieuw generatief platform genaamd Riffusion, ontwikkeld door Seth Forsgren en Hayk Martiros. Zoals de naam al doet vermoeden, heeft Riffusion een ziel van Stable Diffusion, met één verschil: het model is speciaal geoptimaliseerd om sonogrammen/spectrogrammen te genereren. Met andere woorden, visuele weergaven van audio op basis van tekstprompts.

Riffusion: van tekst naar audio met kunstmatige intelligentie

Riffusion: een variant van Stable Diffusion om muziek te maken met kunstmatige intelligentie
Voer een prompt in en laat het model de rest doen

De site vereist geen account of aankoop van tokens om geluiden te genereren. Sterker nog, het raadt gebruikers aan om te experimenteren door hun favoriete stijlen en instrumenten in te voeren. Combinaties zijn zeker welkom, bijvoorbeeld gospel tropical. Het is ook mogelijk om prompts te maken die de aanwezigheid van stemmen aangeven (een van de meest interessante die ik vond was "post-teen pop talent show winner"), maar we mogen geen duidelijke dialoog verwachten.

Het sonogram/spectrogram is gemakkelijk te interpreteren: de X-as vertegenwoordigt tijd, de Y-as de frequentie van de geluiden, en de kleur van elke pixel de amplitude. De laatste fase wordt verzorgd door Torchaudio, dat de door Stable Diffusion gegenereerde afbeelding neemt en omzet in audio. De About-sectie van Riffusion is uitstekend en verdient je aandacht.

Riffusion: een variant van Stable Diffusion om muziek te maken met kunstmatige intelligentie
Net als bij andere modellen kun je de seed en het denoising-niveau aanpassen

De geavanceerde instellingen stellen ons in staat om de afbeelding die als seed dient te wijzigen (vijf verschillende opties), en het denoising-niveau. Hoe hoger dit is, hoe 'creatiever' de output... maar het zal verder afwijken van wat je wilt. Dit gedrag is identiek aan Stable Diffusion bij het verwerken van afbeeldingen. Een ander ding dat het overneemt is het gewicht van de prompts. Zo kan een nadruk op violen worden geschreven als (violin:1.25) tussen haakjes, of blokhaken om de impact te minimaliseren: [violin] staat gelijk aan een reductie van 1,1x.

Tot slot wordt de server van Riffusion gebombardeerd met verzoeken, dus we moeten geduld hebben. Je hebt ook goede hardware-versnelling in je browser nodig, omdat de officiële site behoorlijk veeleisend is. Probeer het maar!

Officiële site: Klik hier