De mensen van Meta blijven hun AI-ontwikkelingen delen. Half april verkenden we Animated Drawings om tekeningen te animeren, eind juli verscheen hun chatbot Llama 2, en nu is het de beurt aan AudioCraft. Zoals de naam al suggereert, richt AudioCraft zich op het genereren van audio met kunstmatige intelligentie en bestaat uit drie modellen: AudioGen, MusicGen en EnCodec. De code is al voor iedereen beschikbaar, maar als je MusicGen nu wilt uitproberen kun je dat doen zonder iets te installeren.
Riffusion, MusicLM, Soundraw, SongR. Het idee om muziek te genereren met kunstmatige intelligentie wint terrein op het web. Vanuit technisch oogpunt staan deze platforms nog ver achter bij beeldgeneratie, maar de tijd is zeker in hun voordeel, en met elk nieuw model blijven de kwaliteitsparameters verbeteren.
Zo komen we bij het project AudioCraft van Meta. Deze bibliotheek is speciaal ontworpen voor onderzoek naar deep learning in audiogeneratie en is verdeeld in drie geavanceerde modellen: AudioGen voor het creëren van geluidseffecten, MusicGen voor het genereren van muziek, en EnCodec, een "neurale audiocodec" met hoge betrouwbaarheid. Het AudioCraft-profiel op GitHub bevat alle code en installatie-instructies, maar je kunt MusicGen op dit moment uitproberen dankzij de aanwezigheid van Meta op HuggingFace.
Hoe je muziek genereert met prompts met AudioCraft en MusicGen
Deze versie van MusicGen heeft twee hulpmiddelen: een vak voor het invoeren van onze prompt en een ander waarmee we een melodie of microfoonmonster als referentie kunnen laden. We klikken op Generate en dat brengt ons naar de wachtrij. Gemiddeld rapporteert HuggingFace een vertraging van 600-900 seconden, maar bij sommige tests duurde het model de helft van die tijd (uiteraard hangt dit af van de belasting van de servers). Het eindresultaat is een sample van vijftien seconden in MP4-formaat.
"een levendige bard die luit speelt in een herberg"
"een onheilspellende, dreigende kerkpianomelodie die de verschijning van een vijand in een videogame aankondigt"
"soundtrack van een extatisch moment in een ruimtegevecht van een sci-fi film"
Hoe goed werkt het? Nou... het is niet verschrikkelijk. Het model biedt geen controle over seed of intensiteit, maar het lijkt onze prompt redelijk nauwkeurig te volgen. Uiteraard wordt de beschrijving in het Engels geschreven en kan elke kleine wijziging totaal verschillende melodieën opleveren. De limiet van vijftien seconden is hier absoluut, en we moeten ook geen 'loop' verwachten om als achtergrond in een project te gebruiken. Toch denk ik dat MusicGen het potentieel heeft om een veel robuustere tool te worden.
Toegang tot MusicGen: Klik hier
AudioCraft op Facebook: Klik hier