Na het genereren van miljoenen en miljoenen afbeeldingen bereiden de kunstmatige intelligenties zich voor om beweging en dimensie te krijgen. De rol van 3D-modellering in de industrie is gigantisch, en als een nieuw platform het creatieproces nog verder kan versnellen, zou dat een echte revolutie kunnen ontketenen. Met dat in gedachten ontdekten we Point-E, een systeem ontworpen door OpenAI dat driedimensionale modellen genereert door tekst en puntenwolken te combineren.
Van katten-astronauten tot fantastische scènes vol details, de generatieve beeldmodellen hebben geleid tot een explosie van activiteit op het web. Een deel van het publiek heeft zich gericht op het debatteren over de juridische en ethische situatie van sommige ontwikkelingen, maar één ding is zeker: de vooruitgang van deze technologie zal niet stoppen.
Wat staat er nu op de lijst? Naast video is een andere prioriteit 3D-modellering. Over het algemeen hebben professionele tools een vrij complexe leercurve, maar als het concept van “tekst-naar-3D” werkelijkheid wordt, zou het niet onredelijk zijn om te spreken over een democratisering van driedimensionaal ontwerp. In die richting wijst het team van OpenAI na het bevestigen van de openstelling van hun project Point-E.
Point-E: van tekst naar 3D-objecten met AI
Volgens het officiële paper is een van de belangrijkste voordelen van Point-E de snelheid. Terwijl DreamFusion van Google een grote hoeveelheid tijd en grafische kaarten nodig heeft om modellen te genereren, doet Point-E er minder dan twee minuten over op een Nvidia V100. Jim Fan van Nvidia legt uit dat Point-E 600 keer sneller is dan DreamFusion, al scoort het lager in kwaliteit.
Dit komt door de generatiemethode in Point-E. Het systeem gebruikt puntenwolken om het driedimensionale object te representeren. Deze beperking vermindert de precisie van bepaalde kenmerken zoals textuur of de uiteindelijke vorm, maar de objecten zijn veel gemakkelijker te reproduceren. De truc van Point-E om dit te compenseren is de conversie van de puntenwolk naar mallen (lees: meshes). In losse termen kunnen we spreken van drie modellen: een van tekst naar afbeelding, een andere van afbeelding naar 3D-puntenwolk, en de derde die verantwoordelijk is voor de mesh.
OpenAI heeft dit systeem getraind met enkele miljoenen 3D-objecten, inclusief metadata. Nu maakt Point-E vaak fouten, vooral bij het interpreteren van de door het eerste model gegenereerde afbeelding, maar er is nog veel werk aan de winkel, wat onvermijdelijk zal leiden tot meer geoptimaliseerde modellen.
Officiële site: Klik hier.
Toegang tot de studie (PDF): Klik hier.