Le 8 septembre 2026, Google DeepMind a annoncé AlphaGenome Atlas, une ressource de recherche qui précompute des prédictions sur plus de 9 milliards de substitutions d’une seule base dans le génome humain. L’objectif est très concret : permettre aux chercheurs de repérer plus vite les variants qui méritent une étude approfondie, notamment dans les régions d’ADN non codant. Les résultats restent toutefois des prédictions moléculaires, pas des mesures expérimentales ni des diagnostics.

Ce qu’est réellement AlphaGenome Atlas

AlphaGenome Atlas : Google DeepMind prédit l’impact de plus de 9 milliards de variants ADN

AlphaGenome Atlas est un catalogue de résultats calculés à l’avance à partir d’AlphaGenome, le modèle de Google DeepMind consacré à la prédiction de plusieurs effets moléculaires de séquences d’ADN. À chaque position d’un génome humain d’environ 3 milliards de bases correspondent jusqu’à trois bases alternatives, ce qui conduit à plus de 9 milliards de substitutions possibles.

Le volume est considérable : le jeu de données est présenté comme représentant environ 1 pétaoctet. La précomputation change surtout le déroulement du travail. Au lieu de lancer une analyse complète pour chaque variant sélectionné, les chercheurs peuvent partir d’un vaste ensemble de résultats déjà calculés et concentrer leurs ressources sur les candidats les plus intéressants.

Le catalogue concerne les régions codantes, qui produisent directement des protéines, mais aussi les régions non codantes. C’est là que se trouve une grande partie du problème : l’ADN non codant ne fabrique pas directement une protéine, mais peut participer à la régulation de l’activité des gènes, de l’épissage ou de l’organisation de la chromatine.

Pourquoi l’ADN non codant est si difficile à interpréter

Une substitution dans une région non codante peut modifier l’activité d’un gène sans changer la séquence d’une protéine. Son effet dépend alors du contexte génomique, du type cellulaire et des mécanismes de régulation concernés. Une même variation ne se résume donc pas facilement à une étiquette « bénéfique » ou « dangereuse ».

AlphaGenome Atlas cherche à rendre ces effets plus lisibles en couvrant notamment l’expression des gènes, l’initiation de la transcription, l’accessibilité de la chromatine, les modifications des histones, la fixation des facteurs de transcription, les contacts entre régions de chromatine et l’utilisation des sites d’épissage.

Google DeepMind décrit des prédictions pour des centaines de types de cellules et de tissus humains et murins. Cette couverture ne règle pas pour autant toute la difficulté biologique : les données d’entraînement représentent un nombre limité de types cellulaires particulièrement étudiés, et certains effets de régulation à longue distance peuvent dépasser le contexte modélisé.

Ce que prédit l’Atlas et ce qu’ajoute le score AVI

Le score AlphaGenome Variant Impact, ou AVI, condense les prédictions d’AlphaGenome et les prédictions d’AlphaMissense pour les variants qui modifient les protéines. Il fournit un signal unique pour classer les variants et décider lesquels examiner en premier.

Le score n’efface pas la complexité du problème. Ses attributions de caractéristiques détaillent des contributions associées à des catégories comme l’accessibilité de la chromatine, l’épissage ou la conservation. Les chercheurs peuvent ainsi utiliser AVI comme un outil de tri, puis revenir aux signaux moléculaires qui ont contribué au classement.

L’Atlas comprend également un répertoire de plus de 2 500 motifs d’ADN récurrents et de leurs emplacements dans le génome. Ces motifs peuvent aider à relier une variation à des séquences de régulation connues, sans transformer cette relation en preuve de causalité.

Des milliards de possibilités à quelques hypothèses de recherche

Démonstration d’un flux de travail avec des scores AVI, des annotations ClinVar et des graphiques comparant les séquences de référence et les séquences alternatives

La démonstration consacrée à un flux de travail sur le gène HBB illustre le rôle pratique de l’Atlas. Le processus récupère des scores AVI, classe des variants, les met en regard d’annotations de ClinVar et produit des graphiques comparant une séquence de référence à une séquence alternative.

Cette chaîne réduit la quantité de code et de calcul nécessaire pour passer d’une liste de variants à une hypothèse biologique. Elle ne remplace pas les expériences : un classement élevé indique qu’un variant mérite davantage d’attention, mais n’établit ni son effet réel dans une cellule ni son rôle dans une maladie.

Dans ce type de travail, l’étape importante n’est donc pas seulement de trouver le score le plus élevé. Il faut aussi examiner le signal moléculaire concerné, le type cellulaire étudié et les données expérimentales capables de confirmer ou de contredire la prédiction.

Les limites qui comptent

Un score AVI élevé ne prouve pas qu’un variant provoque une maladie. Il indique que les modèles prédisent des effets moléculaires suffisamment marqués pour justifier une priorisation. La causalité doit être établie par des analyses biologiques adaptées au variant et au contexte étudiés.

Le même principe vaut pour les traits complexes. Une prédiction d’altération de l’expression d’un gène ne permet pas, à elle seule, de déduire le résultat chez une personne. Les résultats dépendent notamment des données d’entraînement, des tissus représentés, du contexte génomique et de la capacité du modèle à représenter des interactions régulatrices éloignées.

AlphaGenome n’a pas été validé ni approuvé pour un usage clinique. AlphaGenome Atlas ne remplace donc ni un examen médical, ni un diagnostic, ni un traitement. Sa fonction est celle d’un instrument de recherche : réduire le champ des possibilités et aider à choisir les expériences suivantes.

Ce que l’Atlas change pour les chercheurs

La nouveauté la plus tangible se situe dans le flux de travail. AlphaGenome Atlas ne transforme pas une prédiction en observation ; il rend une quantité immense de prédictions plus exploitable. Les chercheurs peuvent commencer par une recherche déjà calculée, comparer les variants au moyen d’AVI et consacrer davantage de temps à l’interprétation et à la validation.

Cette approche est particulièrement utile pour l’ADN non codant, où le nombre de régions candidates est immense et où la relation entre une substitution et un effet biologique est rarement directe. La valeur de l’Atlas se mesure donc moins à la promesse d’une réponse instantanée qu’à sa capacité à faire émerger des hypothèses testables à partir d’un espace de recherche presque ingérable.