Os desenvolvimentos que cercam a geração de imagens com inteligência artificial continuam avançando. Temos aplicativos móveis, efeitos de profundidade, vídeo e animação, mas não devemos esquecer as interfaces para execução local de modelos. No caso específico do Stable Diffusion, a solução da Automatic1111 é a mais compatível e flexível, mas se você prefere um ambiente intuitivo e fácil de usar, com excelentes funções para expandir imagens além do tamanho original, precisa conhecer de perto o InvokeAI.
Três rotas para gerar imagens com IA
Existem pelo menos três rotas para gerar imagens com inteligência artificial. Por um lado, temos o DALL-E, com o Craiyon como uma de suas melhores opções gratuitas online. Depois aparece o Midjourney, extremamente popular nas redes sociais, mas requer Discord e a compra de tokens. Finalmente, chegamos ao Stable Diffusion, que além de oferecer um modo online gratuito, também permite sua execução offline, com uma placa de vídeo.
Nos primeiros dias, tudo funcionava no console do sistema, mas o projeto da Automatic1111 deu origem a uma interface web para Stable Diffusion com alto nível de compatibilidade e flexibilidade. No entanto, também devemos reconhecer que o estado do Auto1111 é um pouco caótico, com mais de 1.300 issues abertos no GitHub, e uma documentação não muito boa. Agora, se você tem poder de fogo suficiente para executar o Stable Diffusion offline e procura uma alternativa à interface da Automatic1111, todas as setas apontam para o InvokeAI.
InvokeAI: Uma das melhores interfaces web para Stable Diffusion
Instalação
Um dos aspectos mais positivos do InvokeAI é a sua instalação. Os requisitos principais são três: a instalação do Python (3.10.6 é uma boa opção, pois mantém compatibilidade com o Auto1111), a aplicação de um patch no Registro que ativa caminhos de unidade mais longos, e cerca de 25 GB de espaço em disco. Um clique duplo em install.bat iniciará o processo em si, mas não é automático 100%. O InvokeAI perguntará pelo destino dos arquivos e os modelos a instalar (a lista recomendada é um bom ponto de partida). Obviamente, isso significa que o InvokeAI baixará arquivos muito grandes, portanto, paciência.
Unified Canvas
De longe, a função mais poderosa do InvokeAI é o Unified Canvas, que combina funções de inpainting, outpainting, texto para imagem e imagem para imagem. Tanto o inpainting (modificar ou regenerar partes específicas de uma imagem), quanto o outpainting (expandir uma imagem com detalhes adicionais) deixam muito a desejar na interface da Automatic1111, mas está claro que o InvokeAI acertou em cheio com sua última edição.
Limitações
Apesar dessas funções impressionantes, InvokeAI possui limitações que devemos destacar. A primeira delas é o número de tokens (em outras palavras, se o nosso prompt for muito longo, o InvokeAI ignora o excedente), mas a mais importante é sua falta de eficiência no uso de VRAM, a tal ponto que recomendo ignorar o InvokeAI completamente se a placa de vídeo tiver 6 GB de VRAM ou menos disponível. Nesse caso, a melhor opção é voltar para o Automatic1111 e ativar os comandos --medvram ou --lowvram, que funcionam muito bem (além da perda de desempenho).
Site oficial: Clique aqui