Ich muss zugeben, dass ich die KI-Bildgenerierung aufgegeben habe. Die neuesten Modelle verlangen die gesamte VRAM der Welt, liefern sehr begrenzte Ergebnisse oder verstecken sich hinter einer Paywall. Google erinnert mich jedoch daran, dass es möglich ist, sich bei der kostenlosen Version von Gemini 2.0 Flash anzumelden und die integrierte Version des Modells Imagen 3 zu verwenden, um Bilder zu generieren, während wir ein Gespräch führen. Wie gut funktioniert das?
Ja, das Web wurde mit KI-generierten Bildern überschwemmt. Nein, sie sind nicht gerade gut. Tatsächlich ist die überwiegende Mehrheit, um es mit einem Wort zu sagen, schrecklich. Ich gebe zu, dass ich sie in der Vergangenheit benutzt habe, aber ich habe ihre Nutzung abgebrochen, weil der Qualitätsfaktor einfach nicht vorhanden ist. Gleichzeitig ist es auffällig, dass wichtige Marken darauf bestehen, auf so mittelmäßige visuelle Ergebnisse zu setzen und die Kritik zu ignorieren (ich nehme an, das Gehalt eines Designers zu sparen ist wichtiger).
Aber ihre Entwicklung geht weiter, oder zumindest deutet der Hype darauf hin. Google hat die Öffnung einer experimentellen Version von Gemini 2.0 Flash für seine AI-Studio-Plattform angekündigt, die multimodale Unterstützung, fortgeschrittenes Denken und ein besseres Verständnis natürlicher Sprache umfasst. Bei Weitem das Bemerkenswerteste an diesem Paket ist die „Bildbearbeitung per Konversation“ eines Bildes (etwas, das wir in der Vergangenheit bereits erkundet haben), aber heute interessiere ich mich dafür, den aktuellen Stand der Bildgenerierung unter der herkömmlichen Version von Gemini zu sehen. Ich öffnete einen neuen Chat und teilte einige Ideen ...
Bildgenerierung im Chat mit Google Gemini 2.0 Flash
Der einzige „Vorteil“, den ich Gemini gewährt habe, war, das Gespräch auf Englisch zu beginnen und zu führen, um Interpretationsfehler zu minimieren. Zuerst beschrieb ich eine Bushaltestelle, an einem regnerischen Abend, beleuchtet von einer Laterne, mit den Lichtern der Stadt in einiger Entfernung, die die Landschaft bedecken. Die ersten Ergebnisse waren vielversprechend, aber der Generator begann Fehler zu machen und wichtige Aspekte zu ignorieren, je mehr Details ich anforderte. Bei einem Bild bat ich nur darum, die Laterne um 90 Grad zu drehen, um die Richtung des Lichts zu ändern ... und er ersetzte alles durch ein neues Bild.
Was ist mit der Generierung von Personen? Gemini ist ohne Zweifel viel konfrontativer. Schwarze Spandex-Anzüge für unsere Raumheldinnen sind kein Problem, aber bei der Anfrage nach einem Bikini oder Badeanzug wurden die Zusammenstöße mit seinem Filter häufiger. Es litt auch unter dem gleichen Problem wie die Bushaltestelle: Es kam zu einem Punkt, an dem es grundlegende Elemente der Beschreibung ignorierte, wie die Augenfarbe.
Zum Schluss noch etwas Essen: Die erste Eisschale war eigentlich eine Dessertschale, obwohl sehr gut gemacht. Danach änderte er sie korrekt in drei Eiskugeln (zwei Schokolade, eine Vanille). Aber als ich bat, die Textur zu verbessern, entschied er sich, eine vierte Eiskugel einzufügen ... und entfernte sie nie.
Also verlasse ich diese Sitzung von Google Gemini 2.0 Flash, nachdem ich das tägliche Limit an generierten Bildern erreicht habe, und habe genau das Gefühl, was ich mir vor Beginn vorgestellt habe: Die Enttäuschung des „Fast, aber nicht“. Ich nehme an, ich kann auf den Befehl „Redo“ klicken und mich vollständig den algorithmischen Göttern überlassen, in der Hoffnung, dass die nächste Seed-Nummer günstiger ist ... aber am Ende will das niemand. Der „Eureka-Moment“ ist noch weit entfernt, und wenn Sie mir den Pessimismus erlauben, wird er wahrscheinlich nie kommen.
Zugang zu Gemini: Klicken Sie hier