Riffusion: Wariant Stable Diffusion do tworzenia muzyki za pomocą sztucznej inteligencji
Riffusion

Twórcy platform generatywnych dostosowują się do nowych wymagań. Entuzjaści i artyści „walczą” w mediach społecznościowych. Wśród tego chaosu powstają nowe projekty oparte na sztucznej inteligencji. Jednym z nich jest Riffusion, które wykorzystuje zoptymalizowaną wersję Stable Diffusion do tworzenia spektrogramów, czyli wizualnych reprezentacji dźwięku, które możemy łatwo odsłuchać.

Obrazy, wideo, głosy, muzyka. Projekty oparte na sztucznej inteligencji rozwijają się dalej… z opiniami za i przeciw. Ostatnio widzieliśmy protesty, wiele „wymian”, które można porównać do cyfrowych cegieł, oraz ogromne wątpliwości dotyczące praw autorskich i dozwolonego użytku. Prędzej czy później konflikty prawne trafią do wyższych instancji, ale niezależnie od tego sztuczna inteligencja nadal będzie nas zaskakiwać.

Dziś przyszedł czas na nową platformę generatywną nazwaną Riffusion stworzoną przez Setha Forsgrena i Hayka Martirosa. Jak sugeruje nazwa, Riffusion ma ducha Stable Diffusion, z jedną różnicą: model został specjalnie zoptymalizowany do generowania sonogramów/spektrogramów. Innymi słowy, wizualnych reprezentacji audio opartych na promptach tekstowych.

Riffusion: od tekstu do audio dzięki sztucznej inteligencji

Riffusion: Wariant Stable Diffusion do tworzenia muzyki za pomocą sztucznej inteligencji
Wpisz prompt i pozwól modelowi zrobić resztę

Strona nie wymaga żadnego konta ani kupowania tokenów do generowania dźwięków. W rzeczywistości zaleca użytkownikowi eksperymentowanie, wprowadzając swoje ulubione style i instrumenty. Kombinacje są zdecydowanie mile widziane, na przykład „gospel tropical”. Można też tworzyć prompty wskazujące na obecność głosów (jednym z najciekawszych, jakie znalazłem, był «post-teen pop talent show winner»), ale nie należy oczekiwać wyraźnego dialogu.

Sonogram/spektrogram można łatwo zinterpretować: oś X reprezentuje czas, oś Y częstotliwość dźwięków, a kolor każdego piksela jego amplitudę. Ostatni etap należy do Torchaudio, które pobiera obraz wygenerowany przez Stable Diffusion i przekształca go w audio. Sekcja About na Riffusion jest doskonała i zasługuje na twoją uwagę.

Riffusion: Wariant Stable Diffusion do tworzenia muzyki za pomocą sztucznej inteligencji
Podobnie jak w innych modelach, możesz zmieniać seed i poziom denoisingu

Zaawansowana konfiguracja pozwala nam zmienić obraz, który służy jako seed (pięć różnych opcji) oraz poziom denoisingu. Im jest wyższy, tym bardziej „kreatywny” jest wynik… ale będzie się oddalał od tego, czego chcesz. To zachowanie jest identyczne jak w Stable Diffusion przy przetwarzaniu obrazów. Kolejną zapożyczoną rzeczą jest waga promptów. Na przykład nacisk na skrzypce można zapisać jako (violin:1.25) w nawiasach, albo w nawiasach kwadratowych, aby zminimalizować ich wpływ: [violin] odpowiada redukcji 1.1x.

Na koniec serwer Riffusion jest bombardowany żądaniami, więc trzeba uzbroić się w cierpliwość. Będziesz także potrzebować dobrego przyspieszenia sprzętowego w przeglądarce, ponieważ oficjalna strona jest dość wymagająca. Wypróbuj!

Strona oficjalna: Kliknij tutaj