W połowie grudnia pisaliśmy o Riffusion, wariancie Stable Diffusion, który pozwala tworzyć muzykę za pomocą sztucznej inteligencji na podstawie prostego tekstu. Czas działa na korzyść algorytmów, a każdy nowy projekt przynosi coraz precyzyjniejsze wyniki. Dziś przyszła kolej na Google Research, które właśnie zaprezentowało MusicLM. Oprócz tworzenia audio w 24 kHz, model obsługuje specjalne warunki, takie jak generowanie długich melodii i „tryb historii” do przygotowywania sekwencji.
Wirusowa eksplozja ChatGPT wywołała „czerwony kod” w Google. Gigant z Mountain View wykorzystuje sztuczną inteligencję na wielu poziomach, ale wszystko wskazuje na to, że zbliża się fala nowych projektów jako bezpośrednia odpowiedź na czatbota OpenAI. Innymi słowy, Google musi nieco bardziej pokazać publiczności swoje karty, a jedną z nich jest MusicLM. Ta praca Google Research proponuje coś bardzo interesującego: generowanie muzyki za pomocą sztucznej inteligencji na podstawie prostego opisu.
MusicLM: Jak brzmi muzyka tworzona przez sztuczną inteligencję?
Strona demonstracyjna nie zawiera aktywnego modelu MusicLM, ale jest pełna przykładów wraz z odpowiadającymi im promptami. Trening MusicLM opiera się na „dużym zbiorze danych muzycznych bez etykiet” oraz na innym zbiorze danych o nazwie MusicCaps, który zawiera łącznie 5521 kombinacji muzyki i tekstu. Opisy w MusicCaps zostały stworzone przez ludzi, a powiązane audio pochodzi z AudioSet, kolekcji z ponad dwoma milionami klipów audio (dziesięciosekundowych) pobranych z YouTube.
„Główna ścieżka dźwiękowa gry zręcznościowej. Jest szybka i radosna, z chwytliwym riffem gitary elektrycznej. Muzyka jest powtarzalna i łatwa do zapamiętania, ale z nieoczekiwanymi dźwiękami, jak uderzenia talerzy lub werble.”
Wyniki MusicLM są podzielone na kilka kategorii. Pierwsza z nich to „Rich Captions” – próbki 30-sekundowe oparte na krótkim opisie. „Long Generation” pokazuje potencjał modelu do tworzenia całych piosenek o długości pięciu minut. „Story Mode” zamienia opisy w sekwencje z określonymi odstępami, „Text and Melody Conditioning” łączy tekst prompta z melodią referencyjną, a „Painting Caption Conditioning” generuje audio inspirowane obrazem lub zdjęciem.
Do tego dochodzi zdolność MusicLM do odtwarzania konkretnych instrumentów i gatunków, poziomów umiejętności muzycznych (początkujący pianista lub mistrz skrzypiec), miejsc, epok i nie tylko. Jednak wszystko, co mamy na razie, to oficjalne przykłady. Google Research potwierdziło, że „nie ma planów” na udostępnienie modeli na razie, a przed nimi wiele wyzwań (hipotetyczne problemy z prawami autorskimi, uprzedzenia kulturowe itp.).
Oficjalna strona: Kliknij tutaj