Ludzie z Meta wciąż dzielą się swoimi osiągnięciami w dziedzinie sztucznej inteligencji. W połowie kwietnia eksplorowaliśmy Animated Drawings do animowania rysunków, ich chatbot Llama 2 pojawił się pod koniec lipca, a teraz przyszła kolej na AudioCraft. Jak sugeruje nazwa, AudioCraft koncentruje się na generowaniu dźwięku za pomocą sztucznej inteligencji i składa się z trzech modeli: AudioGen, MusicGen i EnCodec. Kod jest już dostępny dla wszystkich, ale jeśli chcesz przetestować MusicGen już teraz, możesz to zrobić bez instalowania czegokolwiek.

MusicGen: jak generować muzykę za pomocą sztucznej inteligencji i tekstu
Jak generować muzykę za pomocą sztucznej inteligencji

Riffusion, MusicLM, Soundraw, SongR. Idea generowania muzyki za pomocą sztucznej inteligencji zyskuje na popularności w sieci. Z technicznego punktu widzenia te platformy są jeszcze daleko w porównaniu z generowaniem obrazów, ale czas zdecydowanie działa na ich korzyść, a wraz z każdym nowym modelem parametry jakości będą się poprawiać.

Tak dochodzimy do projektu AudioCraft od Meta. Ta biblioteka została zaprojektowana specjalnie do badań nad głębokim uczeniem w generowaniu dźwięku i dzieli się na trzy zaawansowane modele: AudioGen do tworzenia efektów dźwiękowych, MusicGen do generowania muzyki oraz EnCodec, wysokiej jakości «neuralny kodek audio». Profil AudioCraft na GitHubie zawiera cały kod i instrukcje instalacji, ale możesz wypróbować MusicGen już teraz dzięki obecności Meta na HuggingFace.

Jak generować muzykę za pomocą promptów w AudioCraft i MusicGen

MusicGen: jak generować muzykę za pomocą sztucznej inteligencji i tekstu
Oczekiwanie może być dłuższe niż zwykle, w zależności od obciążenia serwera i pory dnia

Ta wersja MusicGen ma dwa narzędzia: pole do wpisania promptu oraz drugie, które pozwala wczytać melodię lub próbkę z mikrofonu jako odniesienie. Klikamy Generate i trafiamy do kolejki oczekiwania. Średnio HuggingFace podaje opóźnienie 600–900 sekund, ale w niektórych testach model zajmował połowę tego czasu (oczywiście zależy to od obciążenia serwerów). Efektem końcowym jest piętnastosekundowa próbka w formacie MP4.

«żywy bard grający na lutni w tawernie»

«mroczna, złowieszcza melodia fortepianowa w kościele, zapowiadająca pojawienie się wroga w grze wideo»

«ścieżka dźwiękowa do ekstatycznego momentu w kosmicznej bitwie z filmu science fiction»

Jak dobrze to działa? Cóż… nie jest źle. Model nie daje żadnej kontroli nad seedem czy intensywnością, ale wydaje się dość wiernie podążać za promptem. Oczywiście opis pisze się po angielsku, a każda minimalna zmiana może wygenerować zupełnie inne melodie. Limit piętnastu sekund jest tu absolutny i nie powinniśmy oczekiwać «pętli» do wykorzystania w tle w jakimś projekcie, ale uważam, że MusicGen ma potencjał, aby stać się znacznie bardziej solidnym narzędziem.

Dostęp do MusicGen: Kliknij tutaj

AudioCraft na GitHubie: Kliknij tutaj