Preciso admitir que abandonei a geração de imagens com inteligência artificial. Os modelos mais recentes exigem toda a VRAM do mundo, apresentam resultados muito limitados ou ficam atrás de um paywall. No entanto, o Google me lembra que é possível acessar a versão gratuita do Gemini 2.0 Flash e usar sua edição integrada do modelo Imagen 3 para gerar imagens enquanto mantemos uma conversa. Será que funciona bem?
Sim, a web foi invadida por imagens geradas por inteligência artificial. Não, elas não são lá muito boas. Na verdade, a grande maioria é, em uma palavra, horrível. Admito que as usei no passado, mas interrompi sua adoção porque o fator qualidade simplesmente não está lá. Ao mesmo tempo, chama a atenção que grandes marcas insistam em apostar em resultados visuais tão medíocres e ignorem as críticas (suponho que economizar o salário de um designer seja mais importante).
Mas sua evolução continua, ou pelo menos é o que sugere o hype. O Google anunciou a abertura de uma versão experimental do Gemini 2.0 Flash para sua plataforma AI Studio, que inclui suporte multimodal, raciocínio avançado e melhor compreensão da linguagem natural. De longe, o mais notável desse pacote é a «edição por conversação» de uma imagem (algo que já exploramos no passado). No entanto, hoje quero ver qual é o estado atual da geração de imagens na versão convencional do Gemini. Abri um novo chat e compartilhei algumas ideias…
Gerando imagens em um chat, com Google Gemini 2.0 Flash
A única «vantagem» que decidi conceder ao Gemini foi iniciar e manter a conversa em inglês, com o objetivo de minimizar qualquer erro de interpretação. Primeiro, descrevi um ponto de ônibus sob uma noite chuvosa, iluminado por um poste, com as luzes da cidade a certa distância, cobrindo a paisagem. Os resultados iniciais foram muito promissores, mas o gerador começou a cometer erros e ignorar aspectos importantes à medida que eu pedia mais detalhes. Em uma imagem, a única coisa que pedi foi girar o poste de luz 90 graus para mudar a direção da luz... e ele acabou substituindo tudo por uma imagem nova.
E quanto à geração de pessoas? O Gemini é, sem dúvida, muito mais confrontador. Os ternos de spandex preto para nossas heroínas espaciais da vez não são um problema, mas ao pedir um biquíni ou um maiô, os conflitos com seu filtro se tornaram mais frequentes. Ele também sofreu do mesmo problema que o ponto de ônibus: chegou a um ponto em que ignorava elementos básicos da descrição, como a cor dos olhos.
Para finalizar, um pouco de comida: a primeira tigela de sorvete era, na verdade, uma tigela de sobremesa, embora muito bem feita. Depois, ele mudou corretamente para três bolas de sorvete (duas de chocolate, uma de baunilha). Mas quando pedi para melhorar a textura, ele decidiu inserir uma quarta bola de sorvete... e nunca mais a removeu.
Então, saio desta sessão do Google Gemini 2.0 Flash tendo atingido o limite diário de imagens geradas e sentindo exatamente o que imaginava antes de começar: a decepção do «quase, mas não». Acho que posso clicar no comando «Redo» e me entregar completamente aos deuses algorítmicos, esperando que o próximo número de seed seja mais favorável... mas, no fim das contas, ninguém quer isso. O «momento Eureka» ainda parece distante e, se me permitem o pessimismo, é provável que nunca chegue.
Acesse o Gemini: Clique aqui