Ik moet toegeven dat ik de beeldgeneratie met kunstmatige intelligentie heb opgegeven. De nieuwste modellen vragen om al het VRAM ter wereld, leveren zeer beperkte resultaten op, of zitten achter een betaalmuur. Toch herinnert Google mij eraan dat het mogelijk is om naar de gratis versie van Gemini 2.0 Flash te gaan en de geïntegreerde versie van het model Imagen 3 te gebruiken om afbeeldingen te genereren terwijl we een gesprek voeren. Hoe goed werkt dat?
Ja, het web is overspoeld met door AI gegenereerde afbeeldingen. Nee, ze zijn niet echt goed. Sterker nog, de overgrote meerderheid is, kort gezegd, verschrikkelijk. Ik geef toe dat ik ze in het verleden heb gebruikt, maar ik ben ermee gestopt omdat de kwaliteitsfactor er simpelweg niet is. Tegelijkertijd is het opvallend dat grote merken blijven inzetten op zulke middelmatige visuele resultaten en kritiek negeren (ik neem aan dat het besparen van het salaris van een ontwerper belangrijker is).
Maar de evolutie gaat verder, of dat is tenminste wat de hype suggereert. Google kondigde de opening aan van een experimentele versie van Gemini 2.0 Flash voor zijn AI Studio-platform, die multimodale ondersteuning, geavanceerd redeneren en een beter begrip van natuurlijke taal omvat. Veruit het meest opvallende aan dat pakket is de "conversatiegerichte bewerking" van een afbeelding (iets dat we in het verleden al hebben verkend), maar vandaag wil ik zien wat de huidige staat is van beeldgeneratie onder de conventionele versie van Gemini. Ik opende een nieuwe chat en deelde enkele ideeën…
Afbeeldingen genereren in een chat, met Google Gemini 2.0 Flash
Het enige 'voordeel' dat ik Gemini wilde geven, was om het gesprek in het Engels te beginnen en te houden, om fouten in de interpretatie te minimaliseren. Ik beschreef eerst een bushalte, op een regenachtige nacht, verlicht door een lantaarnpaal, met de stadslichten op enige afstand die het landschap bedekten. De eerste resultaten waren veelbelovend, maar de generator begon fouten te maken en belangrijke aspecten te negeren naarmate ik meer details vroeg. Bij één afbeelding vroeg ik alleen om de lantaarnpaal 90 graden te draaien om de lichtrichting te veranderen... en het verving alles door een nieuwe afbeelding.
Wat gebeurt er met het genereren van mensen? Gemini is zonder twijfel veel confronterender. Zwarte spandexpakken voor onze ruimteheldinnen van dienst zijn geen probleem, maar bij het vragen om een bikini of badpak kwamen botsingen met het filter steeds vaker voor. Het had ook hetzelfde probleem als de bushalte: er kwam een punt waarop het basiskenmerken uit de beschrijving negeerde, zoals de oogkleur.
Tot slot een beetje eten: de eerste kom ijs was eigenlijk een dessertkom, maar wel heel goed gemaakt. Daarna veranderde het correct in drie bollen ijs (twee chocolade, één vanille). Maar toen ik vroeg om de textuur te verbeteren, besloot het een vierde bol ijs toe te voegen... en die nooit meer te verwijderen.
Dus ik verlaat deze sessie met Google Gemini 2.0 Flash nadat ik de dagelijkse limiet aan gegenereerde afbeeldingen heb bereikt, en ik voel precies wat ik vooraf al dacht: de teleurstelling van 'bijna, maar niet'. Ik kan op de opdracht 'Redo' klikken en me volledig overgeven aan de algoritmische goden, in de hoop dat het volgende seed-nummer gunstiger is... maar uiteindelijk wil niemand dat. Het 'Eureka-moment' voelt nog ver weg, en als ik pessimistisch mag zijn, komt het waarschijnlijk nooit.
Toegang tot Gemini: Klik hier