Il 30 settembre 2026 Google DeepMind ha annunciato SynthID Bio, una prova di concetto con due metodi per inserire watermark nelle sequenze di proteine generate dall’IA e nelle strutture proteiche predette. L’obiettivo è aiutare a riconoscere la provenienza di progetti biologici; i risultati sperimentali, però, valgono per le condizioni testate.

Due metodi per sequenze e strutture

SynthIDBio-sequence interviene sulla sequenza degli amminoacidi: usa ProteinMPNN, un modello che genera sequenze proteiche, e ne orienta il campionamento con una chiave. Un filtro basato sul punteggio del watermark seleziona poi le sequenze da tenere. Il rilevamento usa la chiave per calcolare il punteggio. Questo watermark a zero bit segnala la presenza di una marcatura, senza codificare un’identità o un messaggio dettagliato.

SynthIDBio-structure segue una strada diversa. Adatta i moduli di diffusione e di confidenza di AlphaFold 3 affinché le coordinate delle strutture predette contengano un segnale rilevabile; il rilevamento si basa su un modello separato.

Il post incorporato accompagna l’annuncio del progetto, presentato come un metodo per marcare e rilevare proteine progettate con l’IA.

Che cosa hanno misurato i test sui binder

I test in vitro sulle sequenze hanno riguardato binder progettati per tre bersagli: SC2RBD, il dominio di legame del recettore di SARS-CoV-2, VEGF-A e PD-L1. La risonanza plasmonica di superficie (SPR), una tecnica usata per misurare l’affinità di legame, non ha mostrato differenze significative nelle distribuzioni delle affinità tra i gruppi watermarkati e quelli non watermarkati.

Il risultato non è identico per ogni misura: alla soglia KD ≤ 10⁻⁶, i binder non watermarkati hanno avuto un tasso di hit più alto rispetto a quelli prodotti con l’impostazione non distorsiva 0,5. Alla soglia KD ≤ 10⁻⁷, invece, non è stata riportata una differenza significativa nei tassi di hit. Sono risultati circoscritti ai binder e ai bersagli esaminati.

Per le sequenze filtrate, lo studio ha riportato un tasso di veri positivi (TPR) del 100% con un tasso di falsi positivi (FPR) calibrato allo 0,1%. In questo caso, il filtraggio dei punteggi fa parte della condizione del risultato.

Per i modelli di struttura testati, il TPR ha superato il 99,8% con FPR dello 0,1%. Nel modello con parametro s = 0,001, il TPR è stato del 98,99% con FPR dello 0,01%. Sono misure ottenute con specifiche configurazioni e soglie, non prestazioni garantite per qualsiasi proteina o applicazione.

Un watermark indica la provenienza, non la sicurezza

Lo studio riferisce che un attacco di resequenziamento con ProteinMPNN può rimuovere efficacemente il watermark di SynthIDBio-sequence. Per SynthIDBio-structure, il segnale ha resistito a trasformazioni rigide e a un lieve rumore nelle coordinate, mentre una procedura di rilassamento strutturale vincolato con OpenMM e il campo di forza Amber99sb lo ha distrutto.

Un watermark può fornire un indizio sulla provenienza di una proteina, ma non è una valutazione della sua sicurezza. L’impiego in procedure di screening o per tutelare l’integrità dei dati scientifici resta una possibile applicazione, che richiede ulteriore sviluppo e coordinamento.

Codice, dati e possibili applicazioni

Google DeepMind ha annunciato l’apertura del codice di SynthIDBio-sequence e dei dati di validazione in vitro. Ha inoltre dichiarato che i pesi del modello di struttura sarebbero stati messi a disposizione dei ricercatori. Il progetto mira a offrire un segnale utile per valutare la provenienza di progetti biologici; la sua eventuale integrazione nello screening non equivale, da sola, a un controllo di sicurezza.