Google DeepMind a annoncé SynthID Bio le 30 septembre 2026 : cette famille de méthodes de preuve de concept vise à marquer les séquences de protéines générées par IA et les structures protéiques prédites. L’étude détaillant ces approches a été publiée le même jour. Les essais portent sur trois cibles ; les résultats de détection dépendent de réglages et de seuils précis.

Google DeepMind présente SynthID Bio

Le filigrane est un signal intégré à une création pour aider à en reconnaître la provenance. SynthID Bio décline cette idée en deux méthodes, l’une conçue pour les séquences d’acides aminés, l’autre pour les coordonnées de structures prédites.

Deux méthodes pour les séquences et les structures

SynthIDBio-sequence intervient pendant la génération de séquences avec ProteinMPNN. Une sélection d’acides aminés guidée par une clé secrète et un filtre fondé sur un score de filigrane contribuent à inscrire le signal. La détection s’appuie ensuite sur la clé pour calculer le score de la séquence.

SynthIDBio-structure ajuste finement les modules de diffusion et de confiance d’AlphaFold 3 afin que les coordonnées des structures prédites portent un signal détectable. La méthode utilise un détecteur entraîné séparément. Ces deux approches marquent donc des représentations différentes d’une protéine.

Le message publié avec l’annonce situe le projet dans le domaine des protéines conçues par IA.

Ce que les essais ont mesuré

Les essais in vitro sur les séquences ont porté sur des protéines conçues pour se lier à trois cibles : SC2RBD, VEGF-A et PD-L1. La résonance plasmonique de surface (SPR), une méthode de mesure des interactions moléculaires, n’a pas révélé de différence significative entre les groupes dans la distribution des affinités de liaison.

Un résultat dépend toutefois du seuil retenu : pour KD ≤ 10⁻⁶, le taux de réussite était supérieur chez les protéines non marquées par rapport au réglage de filigrane non distorsionnel 0,5. L’absence de différence significative dans la distribution des affinités ne résume donc pas à elle seule tous les résultats de ces essais.

Après filtrage des séquences selon un seuil calibré pour un taux de faux positifs de 0,1 %, l’étude rapporte un taux de vrais positifs de 100 % pour les séquences testées in vitro. Ce filtrage peut réduire la proportion de séquences retenues et augmenter les calculs nécessaires.

Pour SynthIDBio-structure, le taux de vrais positifs dépassait 99,8 % à un taux de faux positifs de 0,1 % sur les modèles testés. Pour le modèle réglé à s = 0,001, il atteignait 98,99 % à un taux de faux positifs de 0,01 %. La détection résistait aux transformations rigides et à un bruit léger sur les coordonnées ; une relaxation structurelle contrainte avec OpenMM et le champ de force Amber99sb a détruit le filigrane.

Un signal de provenance, pas une évaluation de sûreté

Dans le cas de SynthIDBio-sequence, une attaque de re-séquençage menée avec ProteinMPNN a efficacement supprimé le filigrane. Ce résultat concerne cette méthode de re-séquençage.

Le filigrane indique la présence d’un signal, sans encoder une identité détaillée ou un message. L’évaluation de la sûreté d’une protéine est une question distincte de sa provenance. L’étude envisage le marquage comme une aide possible au filtrage et à l’intégrité des données scientifiques ; son usage opérationnel en biosécurité demanderait davantage de travaux et de coordination.

Code, données et usages envisagés

Google DeepMind a annoncé l’ouverture du code et des données de validation in vitro, ainsi que la mise à disposition des poids des modèles de structure pour les chercheurs.