Il 30 settembre 2026 Google DeepMind ha annunciato SynthID Bio, una prova di concetto con due metodi per inserire watermark nelle sequenze di proteine generate dall’IA e nelle strutture proteiche predette. L’obiettivo è aiutare a riconoscere la provenienza di progetti biologici; i risultati sperimentali, però, valgono per le condizioni testate.
Due metodi per sequenze e strutture
SynthIDBio-sequence interviene sulla sequenza degli amminoacidi: usa ProteinMPNN, un modello che genera sequenze proteiche, e ne orienta il campionamento con una chiave. Un filtro basato sul punteggio del watermark seleziona poi le sequenze da tenere. Il rilevamento usa la chiave per calcolare il punteggio. Questo watermark a zero bit segnala la presenza di una marcatura, senza codificare un’identità o un messaggio dettagliato.
SynthIDBio-structure segue una strada diversa. Adatta i moduli di diffusione e di confidenza di AlphaFold 3 affinché le coordinate delle strutture predette contengano un segnale rilevabile; il rilevamento si basa su un modello separato.
Il post incorporato accompagna l’annuncio del progetto, presentato come un metodo per marcare e rilevare proteine progettate con l’IA.
Che cosa hanno misurato i test sui binder
I test in vitro sulle sequenze hanno riguardato binder progettati per tre bersagli: SC2RBD, il dominio di legame del recettore di SARS-CoV-2, VEGF-A e PD-L1. La risonanza plasmonica di superficie (SPR), una tecnica usata per misurare l’affinità di legame, non ha mostrato differenze significative nelle distribuzioni delle affinità tra i gruppi watermarkati e quelli non watermarkati.
Il risultato non è identico per ogni misura: alla soglia KD ≤ 10⁻⁶, i binder non watermarkati hanno avuto un tasso di hit più alto rispetto a quelli prodotti con l’impostazione non distorsiva 0,5. Alla soglia KD ≤ 10⁻⁷, invece, non è stata riportata una differenza significativa nei tassi di hit. Sono risultati circoscritti ai binder e ai bersagli esaminati.
Per le sequenze filtrate, lo studio ha riportato un tasso di veri positivi (TPR) del 100% con un tasso di falsi positivi (FPR) calibrato allo 0,1%. In questo caso, il filtraggio dei punteggi fa parte della condizione del risultato.
Per i modelli di struttura testati, il TPR ha superato il 99,8% con FPR dello 0,1%. Nel modello con parametro s = 0,001, il TPR è stato del 98,99% con FPR dello 0,01%. Sono misure ottenute con specifiche configurazioni e soglie, non prestazioni garantite per qualsiasi proteina o applicazione.
Un watermark indica la provenienza, non la sicurezza
Lo studio riferisce che un attacco di resequenziamento con ProteinMPNN può rimuovere efficacemente il watermark di SynthIDBio-sequence. Per SynthIDBio-structure, il segnale ha resistito a trasformazioni rigide e a un lieve rumore nelle coordinate, mentre una procedura di rilassamento strutturale vincolato con OpenMM e il campo di forza Amber99sb lo ha distrutto.
Un watermark può fornire un indizio sulla provenienza di una proteina, ma non è una valutazione della sua sicurezza. L’impiego in procedure di screening o per tutelare l’integrità dei dati scientifici resta una possibile applicazione, che richiede ulteriore sviluppo e coordinamento.
Codice, dati e possibili applicazioni
Google DeepMind ha annunciato l’apertura del codice di SynthIDBio-sequence e dei dati di validazione in vitro. Ha inoltre dichiarato che i pesi del modello di struttura sarebbero stati messi a disposizione dei ricercatori. Il progetto mira a offrire un segnale utile per valutare la provenienza di progetti biologici; la sua eventuale integrazione nello screening non equivale, da sola, a un controllo di sicurezza.