Je dois admettre que j'ai abandonné la génération d'images par intelligence artificielle. Les derniers modèles exigent toute la VRAM du monde, offrent des résultats très limités, ou se trouvent derrière un paywall. Cependant, Google me rappelle qu'il est possible d'accéder à la version gratuite de Gemini 2.0 Flash et d'utiliser son édition intégrée du modèle Imagen 3 pour générer des images tout en maintenant une conversation. Est-ce que ça fonctionne bien ?
Mais son évolution continue, ou du moins, c'est ce que suggère le hype. Google a annoncé l'ouverture d'une version expérimentale de Gemini 2.0 Flash pour sa plateforme AI Studio, qui inclut un support multimodal, un raisonnement avancé et une meilleure compréhension du langage naturel. De loin, le plus remarquable de ce pack est « l'édition par conversation » d'une image (quelque chose que nous avons déjà exploré dans le passé), cependant, aujourd'hui je veux voir quel est l'état actuel de la génération d'images sous la version conventionnelle de Gemini. J'ai ouvert un nouveau chat et partagé quelques idées…
Génération d'images dans un chat, ft. Google Gemini 2.0 Flash
La seule « avantage » que j'ai décidé d'accorder à Gemini a été de commencer et de maintenir la conversation en anglais, afin de minimiser toute erreur d'interprétation. J'ai d'abord décrit un arrêt de bus, sous une nuit pluvieuse, éclairé par un lampadaire, avec les lumières de la ville à une certaine distance, couvrant le paysage. Les résultats initiaux étaient très prometteurs, mais le générateur a commencé à commettre des erreurs et à ignorer des aspects importants à mesure que je demandais plus de détails. Sur une image, je n'ai demandé que de faire pivoter le lampadaire de 90 degrés pour changer la direction de la lumière… et il a fini par tout remplacer par une nouvelle image.
Qu'en est-il de la génération de personnes ? Gemini est sans aucun doute beaucoup plus conflictuel. Les combinaisons en spandex noir pour nos héroïnes spatiales du moment ne posent pas problème, mais en demandant un bikini ou un maillot de bain, les conflits avec son filtre sont devenus plus fréquents. Il a également souffert du même problème que l'arrêt de bus : il est arrivé un point où il a ignoré des éléments de base de la description, comme la couleur des yeux.
Pour terminer, un peu de nourriture : le premier bol de glace était en réalité un bol de dessert, bien que très bien fait. Ensuite, il l'a correctement changé en trois boules de glace (deux au chocolat, une à la vanille). Mais quand j'ai demandé d'améliorer la texture, il a décidé d'insérer une quatrième boule de glace… et ne l'a jamais retirée.
Alors, je sors de cette session de Google Gemini 2.0 Flash ayant atteint la limite quotidienne d'images générées, et ressentant exactement ce que j'imaginais avant de commencer : la déception du « presque, mais non ». Je suppose que je peux cliquer sur la commande « Redo » et m'abandonner complètement aux dieux algorithmiques, en espérant que le prochain numéro de seed soit plus favorable… mais au final, personne ne veut ça. Le « moment Eureka » semble encore loin, et si vous me permettez le pessimisme, il est probable qu'il n'arrive jamais.
Accédez à Gemini : Cliquez ici