MusicLM: Künstliche Intelligenz zur Musikerzeugung aus Text
Künstliche Intelligenz zum Erzeugen von Musik

Mitte Dezember sprachen wir über Riffusion, eine Variante von Stable Diffusion, die es uns ermöglicht, mit künstlicher Intelligenz Musik aus einem einfachen Text zu erzeugen. Die Zeit spielt den Algorithmen in die Hände, und mit jedem neuen Projekt erzielen wir genauere Ergebnisse. Heute ist Google Research an der Reihe, das gerade MusicLM vorgestellt hat. Neben der Erzeugung von Audio mit 24 kHz unterstützt dieses Modell besondere Bedingungen wie die Generierung langer Melodien und einen „Story-Modus“ zum Vorbereiten von Sequenzen.

Die virale Explosion von ChatGPT hat bei Google einen „Code Red“ ausgelöst. Der Technologieriese aus Mountain View nutzt künstliche Intelligenz auf verschiedenen Ebenen, aber es scheint, dass sich eine Welle neuer Projekte als direkte Antwort auf den Chatbot von OpenAI nähert. Mit anderen Worten: Google muss der Öffentlichkeit seine Karten etwas mehr zeigen, und eine davon ist MusicLM.

MusicLM: Wie klingt Musik, die mit künstlicher Intelligenz erstellt wurde?

MusicLM: Künstliche Intelligenz zur Musikerzeugung aus Text
So ist es: MusicLM lässt sich von Gemälden inspirieren.

Die Demo-Seite verfügt über kein aktives MusicLM-Modell, ist aber voller Beispiele mit den jeweiligen Prompts. Das Training von MusicLM basiert auf „einem großen Datensatz ungelabelter Musik“ und einem weiteren Datensatz namens MusicCaps mit insgesamt 5.521 Musik-Text-Kombinationen. Die Beschreibungen von MusicCaps wurden von Menschen erstellt, und das zugehörige Audio stammt von AudioSet, einer Sammlung mit mehr als zwei Millionen Audioclips (zehn Sekunden Dauer), die von YouTube extrahiert wurden.

„Der Hauptsoundtrack eines Arcade-Spiels. Er ist schnell und optimistisch, mit einem eingängigen E-Gitarren-Riff. Die Musik ist repetitiv und leicht zu merken, aber mit unerwarteten Klängen wie Becken-Crashes oder Trommelwirbeln.“

Die Ergebnisse von MusicLM sind in mehrere Kategorien unterteilt. Die erste ist „Rich Captions“ mit 30-Sekunden-Beispielen, die auf einer kurzen Beschreibung basieren. „Long Generation“ zeigt das Potenzial des Modells, komplette Songs mit einer Dauer von fünf Minuten zu erstellen. „Story Mode“ verwandelt Beschreibungen in Sequenzen mit definierten Intervallen, „Text and Melody Conditioning“ kombiniert den Text des Prompts mit einer Referenzmelodie, und „Painting Caption Conditioning“ erzeugt Audio, das von einem Gemälde oder Bild inspiriert ist.

MusicLM: Künstliche Intelligenz zur Musikerzeugung aus Text
Story Mode verwandelt den Prompt in eine Sequenz, der gefolgt wird.

Dazu kommt die Fähigkeit von MusicLM, spezifische Instrumente und Genres zu reproduzieren, Musikkenntnisse (ein Anfänger-Pianist oder ein Meistergeiger), Orte, Epochen und mehr. Allerdings haben wir bisher nur die offiziellen Beispiele. Google Research bestätigte, dass es „keine Pläne“ gibt, Modelle vorerst zu teilen, und sie haben viele Herausforderungen vor sich (hypothetische Urheberrechtsprobleme, kulturelle Voreingenommenheit usw.).

Offizielle Website: Klicken Sie hier