Un téléphone Android peut faire tourner un chat IA sans connexion Internet une fois le modèle téléchargé et chargé en mémoire. PocketPal AI et Google AI Edge Gallery illustrent cette possibilité, mais le chat local ne remplace pas à lui seul un assistant connecté comme Gemini : les réponses peuvent être plus lentes et le modèle hors ligne n’accède pas aux informations récentes.

Ce que signifie l’IA hors ligne sur Android

Un modèle exécuté localement produit ses réponses sur le téléphone, plutôt que de transmettre chaque prompt à un service cloud pour le traiter. Le calcul qui génère une réponse s’appelle l’inférence. Une fois le modèle prêt et le réseau coupé, une conversation textuelle peut donc continuer sur l’appareil.

Cela ne signifie pas que l’on peut commencer sans préparation : si le modèle n’est pas déjà sur le téléphone, il faut le télécharger, ce qui nécessite une connexion. Il faut ensuite le charger en mémoire pour l’utiliser.

Deux configurations de chat local

Dans ce tutoriel en anglais, Google AI Edge Gallery et Gemma 4 (2B) fonctionnent hors ligne sur un Samsung Galaxy S25, Wi-Fi et données mobiles désactivés.

Un test individuel relaté le 8 octobre 2026 décrit Gemma 3 1B téléchargé puis chargé dans PocketPal AI. Le téléphone a ensuite été placé en mode avion et le chat a continué hors ligne. Le modèle de téléphone utilisé n’est pas précisé dans ce récit.

Une autre configuration utilise Google AI Edge Gallery avec Gemma 4 (2B). Une démonstration montre le chat hors ligne sur un Samsung Galaxy S25, après désactivation du Wi-Fi et des données mobiles. C’est un exemple concret sur ce téléphone et avec cette application, pas une mesure de performances applicable à tous les appareils.

Télécharger et charger un modèle avant de discuter

Android peut faire tourner un chat IA hors ligne, mais pas remplacer Gemini

Dans PocketPal AI, le parcours décrit consiste à choisir un modèle, à le télécharger, puis à toucher Load pour le placer en mémoire. Une fois cette étape terminée, le chat peut fonctionner hors ligne. PocketPal AI prend en charge le format GGUF, un format de fichiers de modèles, et utilise llama.cpp pour l’inférence sur le processeur, le processeur graphique ou un NPU pris en charge par le téléphone.

Les recommandations de mémoire vive rapportées pour PocketPal AI sont d’au moins 6 Go pour les petits modèles et de 8 Go ou plus pour les grands. Ce sont des indications liées à la taille des modèles, pas une garantie que chaque combinaison de téléphone et de modèle sera compatible ou rapide.

Ce que le chat hors ligne apporte — et ce qu’il perd

Dans l’utilisation de PocketPal AI décrite, les prompts et les réponses étaient traités sur le téléphone. Le traitement local permet donc de poursuivre une conversation sans connexion, et les prompts de cet essai n’étaient pas envoyés à un service cloud pour être traités.

Le compromis concerne notamment la vitesse et l’accès au savoir récent. Dans ce test, les réponses étaient plus lentes que celles d’une IA cloud, et le petit modèle s’est montré moins capable sur certaines tâches. Hors ligne, il ne pouvait pas rechercher des actualités ni répondre à des questions dépendant d’informations récentes.

Le chat local ne remplace pas entièrement Gemini

Une IA locale peut dépanner pour des échanges textuels lorsque le réseau manque ou lorsque l’on veut traiter les prompts sur l’appareil. Mais les deux configurations décrites ne gomment pas les limites observées : le modèle testé dans PocketPal AI répondait plus lentement, et un modèle hors ligne ne pouvait pas récupérer des informations récentes. Pour des réponses liées à l’actualité ou à des données à jour, il faut une connexion à un service qui peut fournir ces informations.