Le saut évolutif le plus important dans la génération d'images par intelligence artificielle est la création de modèles personnalisés. Par cela, je veux dire des paquets secondaires qui reproduisent des styles ou des objets spécifiques, mais qui peuvent aussi être utilisés pour injecter le visage d'une personne dans des scénarios uniques. Cela est possible grâce à la plateforme Dreambooth, développée par Google Research et l'Université de Boston. L'application la plus populaire de DreamBooth aujourd'hui est le fine-tuning de modèles compatibles avec Stable Diffusion, et aujourd'hui nous vous expliquons comment faire.

Dreambooth : comment entraîner votre propre modèle pour générer des images avec intelligence artificielle
Dreambooth

Dépasser les limites

Parmi les trois modèles disponibles pour la génération d'images par intelligence artificielle, Stable Diffusion s'est avéré être le plus flexible. Pourquoi ? Deux raisons : d'une part, il est gratuit et open source, et d'autre part, il s'entend très bien avec des modèles alternatifs. Mais d'où viennent ces modèles ? Des utilisateurs eux-mêmes, qui utilisent leur matériel haut de gamme ou les options gratuites en ligne pour les entraîner. Le problème de l'entraînement personnalisé ou « fine-tuning » de Stable Diffusion est sa consommation de VRAM. Entraîner un modèle avec peu de mémoire vidéo est presque impossible, cependant, grâce à la magie de Google Colab, Google Drive, HuggingFace et le canal DotCSV sur YouTube, aujourd'hui nous pouvons le faire sans trop de soucis, et sans investir des milliers d'euros dans du matériel. Les exigences techniques seront expliquées à chaque étape, alors ne sautez rien !

Entraînez votre propre modèle de génération d'images avec Dreambooth

Dreambooth : comment entraîner votre propre modèle pour générer des images avec intelligence artificielle
Vous aurez besoin d'un jeton d'écriture sur HuggingFace. Ne vous inquiétez pas, c'est gratuit.
  • La première étape consiste à vous rendre sur la page de HuggingFace et créer un compte. Tout ce qu'il demande est une adresse e-mail et un nom d'utilisateur. C'est important car nous avons besoin d'un des jetons d'accès à la plateforme. Une fois le compte créé, allez dans Paramètres > Jetons d'accès, et cliquez sur Nouveau jeton. Attribuez un nom et spécifiez la fonction Écriture. Ne vous éloignez pas trop, car vous devrez copier le jeton d'ici plus tard.
  • Ensuite, vous devrez définir quel type de modèle vous souhaitez entraîner via une sélection d'images. La moyenne recommandée est de 20… et elles doivent être variées. L'objectif est de démontrer un style, un concept, un format, une idée. Par exemple, supposons que vous voulez un modèle inspiré de photos Polaroid. Si vous ne vous concentrez que sur les Polaroids de portraits, le modèle ne sortira jamais de ce moule, alors que l'idéal est de reproduire les détails, les erreurs, la « chaleur » et l'essence « vintage » de ces photos.
Dreambooth : comment entraîner votre propre modèle pour générer des images avec intelligence artificielle
Comme il s'agit d'un fine-tuning de Stable Diffusion 1.5, les images doivent avoir une taille de 512 x 512 pixels. Birme vous aidera. (Oui, je vais entraîner des cyberdecks)
  • La troisième étape est simple : ajuster les images à une taille exacte de 512 x 512 pixels. Le portail Birme dont nous avons parlé récemment vous permettra de le faire en un temps record, en ajustant la taille et en recadrant tout excédent. Enregistrez les images dans un dossier temporaire, nous y reviendrons.
  • C'est maintenant que nous entrons dans l'environnement de Google Colab configuré par DotCSV. Ma première recommandation ? N'ayez pas peur. Au début, cela semble conçu par des extraterrestres, mais en réalité il s'agit d'une interface « pas à pas » plus spartiate que la normale. Avant tout, allez dans « Environnement d'exécution », entrez dans la section « Modifier le type d'environnement d'exécution », et assurez-vous que « GPU » soit l'option sélectionnée. Cela confirmera que Google Colab doit attribuer une carte graphique appropriée pour la tâche.
Dreambooth : comment entraîner votre propre modèle pour générer des images avec intelligence artificielle
Vous devez toujours confirmer que Google Colab attribuera un GPU à la tâche
  • L'environnement de Google Colab nous invite à suivre ses étapes. Nous appuyons sur le bouton Play à l'étape 1 et acceptons l'avertissement pour associer notre Google Drive à l'environnement. Google Drive doit avoir un minimum de 4 Go libres pour cela, et ma suggestion est d'utiliser un compte alternatif.
  • Ensuite, nous appuyons sur le bouton Play à côté de Dependencies. Comme son nom l'indique, cela installera toutes les dépendances nécessaires au bon fonctionnement de Dreambooth. Heureusement, cela ne prend pas trop de temps.
Dreambooth : comment entraîner votre propre modèle pour générer des images avec intelligence artificielle
L'étape 4 est la plus complexe et demande une attention supplémentaire
  • L'étape 3 active le champ où nous devons saisir le jeton que nous avons généré dans HuggingFace. Un clic sur la flèche ouvrira le menu, nous copions le jeton et le collons dans « HuggingFace_Token ». Ignorez le reste des options et appuyez sur Play. Attendez jusqu'à ce que ce soit terminé.
  • La quatrième étape demande des données sur l'entraînement de Dreambooth, et cela change selon vos souhaits : Le plan est-il d'entraîner une personne ou un objet ? Peut-être un artiste ou une série TV ? Choisissez l'option appropriée dans la liste du champ « Training_Subject », puis modifiez l'expression dans « Subject_Type » en suivant les exemples ci-dessous. Cependant, toute votre attention doit aller à « Instance_name ». C'est le joker, le mot-clé que vous utiliserez dans les prompts pour « activer » le contenu que vous avez entraîné. Il est recommandé d'utiliser un mot rare, qui ne soit pas confondu avec autre chose par Stable Diffusion.
Dreambooth : comment entraîner votre propre modèle pour générer des images avec intelligence artificielle
La cinquième étape est facultative, mais si vous entraînez une personne, vous devriez la vérifier
  • En appuyant sur Play à l'étape 4, Google Colab activera un bouton de chargement pour téléverser les images qui serviront de référence dans l'entraînement. Rappelez-vous, elles doivent être en 512 x 512 !
  • La cinquième étape est facultative, et particulièrement utile lorsque nous créons des modèles de personnes. Dans notre test, ce n'est pas nécessaire, mais vous y trouverez cinq valeurs différentes. « person_ddim » est le mode par défaut, n'hésitez pas à le changer pour expérimenter.

Et maintenant, attendre

Dreambooth : comment entraîner votre propre modèle pour générer des images avec intelligence artificielle
Oui, vous aurez besoin d'une tasse de café ou deux. L'entraînement prend entre 45 et 90 minutes.

Le bouton Play de l'étape 6 lance le processus d'entraînement, et à partir de là… patience. Combien de temps cela prend-il ? Pour un paquet standard de 20 images avec 1 600 pas, la moyenne est d'environ une heure, très raisonnable si l'on considère que nous accédons à des gigaoctets entiers de VRAM sans frais. Le niveau d'activité sur Google Colab et la carte graphique configurée pour le projet influencent également ses performances finales.

Dreambooth : comment entraîner votre propre modèle pour générer des images avec intelligence artificielle
Notre entraînement a été un peu plus lent, il a pris environ 90 minutes

Avec le modèle déjà entraîné, il ne reste que deux choses à faire : l'évaluer en ligne en utilisant l'étape 7, ou télécharger le fichier ckpt depuis notre compte Google Drive pour son exécution hors ligne avec Automatic1111. N'oubliez pas d'ajouter votre mot-clé aux prompts, sinon vous ne verrez jamais de résultats corrects parmi les images générées.

Dreambooth : comment entraîner votre propre modèle pour générer des images avec intelligence artificielle
Beaucoup mieux que ce que j'espérais. À partir de là, il faut trouver un bon prompt...

En résumé, Dreambooth est un outil extrêmement puissant, mais il demande quelques heures de vol. Dans certaines occasions, l'entraînement n'est pas entièrement satisfaisant, et il est possible que vous soyez obligé de réessayer avec un ensemble d'images différent. Ne baissez pas les bras !

HuggingFace : Cliquez ici

Dreambooth sur Google Colab : Cliquez ici