Het is een kwestie van tijd, dat weten we allemaal. De videogeneratie met kunstmatige intelligentie bevindt zich in een basisstaat, bijna primitief... maar hetzelfde werd een jaar geleden gezegd over beeldgeneratie, en vandaag kunnen we niet meer zonder de algoritmes. Onlangs deelde het bedrijf Runway een teaser via YouTube en Twitter, waarmee ze het potentieel van hun tool Text to Video voorspiegelen. De demo ziet er goed uit... maar wat kunnen we in het echte leven verwachten?

De volgende fase: videogeneratie met kunstmatige intelligentie en tekst
Videogeneratie

De beeldgeneratie met kunstmatige intelligentie kan tot enorme verschillen leiden afhankelijk van de gebruikte algoritme, maar over het algemeen werken ze allemaal op dezelfde manier: eerst beschrijven we wat we willen (een portret, een landschap, enz.), en daarna voegen we secundaire elementen toe die als invloed of inspiratiebron dienen, zoals de naam van een kunstenaar, een specifiek genre, een schilderstijl, en zelfs de naam van een fotocamera.

Nu, stel je dat voor bij het creëren van video. We openen de editor en vragen om een stad met veel verkeer. Daarna vragen we om een taxi die tegen een verkeerslicht is geknald, en uiteindelijk de reden van de crash: een gigantische dinosaurus die voorbij rent. Natuurlijk kan een video-editing expert dat vandaag doen met het juiste budget, maar de mensen van Runway suggereren dat elke gebruiker in de toekomst vergelijkbare resultaten zou kunnen behalen met hun nieuwe tool, Text to Video:

Runway Text to Video: Video's maken met kunstmatige intelligentie en tekst

De straat van een stad, een cinematisch filter, een lantaarnpaal die als bij toverslag verdwijnt. Een prachtige tuin, meerdere afbeeldingen, dynamische tekstinsertie. Een 'groen' personage, een wazige achtergrond in realtime, en een vleugje Robert Capa als kruiden. De teaser is kort maar belooft veel, en helpt ons ook om de visie van Runway te definiëren. In plaats van een onafhankelijk algoritme met vrije toegang te trainen, lijkt het bedrijf te mikken op de ontwikkeling van een geavanceerdere editor met de geïntegreerde functie van tekst-naar-video.

Als je deel wilt uitmaken van de early access, hoef je alleen maar de officiële pagina te bezoeken en een formulier in te vullen. Dit roept echter een vraag op: Hoe gaan ze zo'n model trainen? Er is momenteel niets vergelijkbaars met LAION-5B voor video, en de benodigde verwerkingskracht is immens. We wachten af...

Bronnen: Runway, Ars Technica