Project VoCo: Adobe's 'Photoshop' voor audio
Project VoCo

Stop me niet woorden in de mond die ik nooit heb gezegd is een zin die in duizenden discussies terugkeert, maar wat als het mogelijk zou zijn om precies dat te doen? Laten we er even over nadenken: vandaag de dag laat Photoshop ons dingen zien die niet bestaan. We hebben initiatieven gezien met het potentieel om overleden acteurs digitaliseren en ze terug te brengen naar het witte doek. Assistenten op mobiele apparaten herkennen onze stem feilloos. Hoe moeilijk zou het dan zijn om die te imiteren? Project VoCo van Adobe probeert daar achter te komen.

De MAX-conferentie die Adobe elk jaar organiseert, stelt ontwikkelaars en consumenten in staat om sommige dingen waaraan het bedrijf werkt van dichterbij te bekijken, of het nu producten zijn die direct op de markt komen of relatief onbekende prototypes. In deze tweede categorie past Project VoCo, iets waarvan de naam ons niet veel zegt, maar dat een griezelig potentieel met zich meedraagt. Wat voor potentieel is dat? Laten we eens kijken: we weten allemaal wat Photoshop kan doen in de handen van een deskundige. Modellen hebben geen enkele imperfectie op hun huid, auto's die nog niet zijn gebouwd maken spectaculaire manoeuvres op het strand, en politici verliezen tien of vijftien jaar wanneer ze in campagne zijn. Denk nu eens aan die middelen toegepast op audio. Iemands toespraak nemen, bewerken, woorden vervangen en plaatsen die er niet zijn..

Project VoCo: Adobe's 'Photoshop' voor audio
Live demo van VoCo tijdens de MAX-conferentie

Daar gaat Project VoCo over. In de woorden van Adobe-ontwikkelaar Zeyu Jin, VoCo doet voor audio wat Photoshop voor fotografie doet. De software is op dit moment zoiets als een pre-alfa, maar als we de korte demonstraties mogen geloven, hoeft de gebruiker alleen maar tekst in een klein dialoogvenster in te voeren, en zal VoCo die afspelen met exact dezelfde stem. Natuurlijk brengt zo'n functie een zeer uitgebreide analyse van de audio met zich mee, en verschillende bronnen geven aan dat VoCo ten minste 20 minuten aan inhoud nodig heeft om een getrouwe weergave te maken. Als we berekenen hoe lang de toespraken van sommige politici gemiddeld duren, ben ik ervan overtuigd dat VoCo meer dan genoeg materiaal heeft.

Hoewel Adobe legitieme redenen heeft om door te gaan met een project met deze kenmerken, zijn de ethische alarmbellen blijven rinkelen. Zoals altijd ligt de schuld niet bij het gereedschap, maar bij degene die het gebruikt. Als VoCo in onbetrouwbare handen valt, zou een logische en coherente toespraak kunnen worden omgevormd tot agressief of strijdlustig… en vice versa. We vinden het al moeilijk genoeg om bewerkte afbeeldingen en neppe video's te detecteren. Stel je voor dat je datzelfde probleem uitbreidt naar een stuk audio dat een paar uur kan duren. Toch zullen we VoCo in de gaten blijven houden.

Bron: