Half december hadden we het over Riffusion, een variant van Stable Diffusion waarmee je met kunstmatige intelligentie muziek kunt maken op basis van een simpele tekst. De tijd is in het voordeel van de algoritmen, en met elk nieuw project krijgen we nauwkeurigere resultaten. Vandaag is het de beurt aan Google Research, dat onlangs MusicLM heeft gepresenteerd. Naast het creëren van audio op 24 kHz ondersteunt dit model speciale condities zoals het genereren van lange melodieën en een 'storymodus' voor het voorbereiden van sequenties.

MusicLM: Kunstmatige intelligentie voor het genereren van muziek uit tekst
Kunstmatige intelligentie om muziek te genereren

De virale explosie van ChatGPT heeft bij Google een 'code rood' veroorzaakt. De gigant uit Mountain View gebruikt kunstmatige intelligentie op verschillende niveaus, maar alles lijkt erop te wijzen dat er een golf van nieuwe projecten aankomt als direct antwoord op de chatbot van OpenAI. Anders gezegd: Google moet zijn kaarten wat meer tonen, en een daarvan is MusicLM. Dit werk van Google Research stelt iets heel interessants voor: muziek genereren met kunstmatige intelligentie op basis van een eenvoudige beschrijving.

MusicLM: hoe klinkt muziek gemaakt met kunstmatige intelligentie?

MusicLM: Kunstmatige intelligentie voor het genereren van muziek uit tekst
Zo is het: MusicLM kan zich laten inspireren door schilderijen

De demonstratiepagina heeft geen actief MusicLM-model, maar staat vol met voorbeelden en hun respectievelijke prompts. De training van MusicLM is gebaseerd op 'een grote dataset van ongelabelde muziek' en een andere dataset genaamd MusicCaps, met in totaal 5.521 combinaties van muziek en tekst. De beschrijvingen van MusicCaps zijn door mensen gemaakt en de bijbehorende audio komt van AudioSet, een collectie met meer dan twee miljoen audioclips (tien seconden lang), afkomstig van YouTube.

De belangrijkste soundtrack van een arcadespel. Het is snel en vrolijk, met een pakkende elektrische gitaarriff. De muziek is repetitief en gemakkelijk te onthouden, maar met onverwachte geluiden, zoals cimbaal crashes of drumroffels.

De resultaten van MusicLM zijn onderverdeeld in verschillende categorieën. De eerste is Rich Captions, met samples van 30 seconden op basis van een korte beschrijving. Long Generation toont het potentieel van het model om volledige nummers van vijf minuten te maken. Storymodus verandert beschrijvingen in sequenties met gedefinieerde intervallen, Text and Melody Conditioning combineert de tekst van de prompt met een referentiemelodie, en Painting Caption Conditioning genereert audio geïnspireerd op een schilderij of afbeelding.

MusicLM: Kunstmatige intelligentie voor het genereren van muziek uit tekst
Storymodus maakt van de prompt een sequentie om te volgen

Daarnaast kan MusicLM specifieke instrumenten en genres reproduceren, niveaus van muzikale ervaring (een beginnende pianist of een meesterlijke violist), plaatsen, tijdperken en meer. Maar alles wat we tot nu toe hebben zijn de officiële voorbeelden. Google Research heeft bevestigd dat er 'geen plannen' zijn om modellen te delen, en ze staan voor veel uitdagingen (hypothetische copyrightproblemen, culturele vooroordelen, enz.).

Officiële website: Klik hier