Google DeepMind descrive SynthID Bio come una famiglia di metodi pensata per inserire segnali rilevabili nelle sequenze di proteine progettate con IA e nelle strutture tridimensionali previste. L’obiettivo è rendere riconoscibile la presenza di una filigrana: il contrassegno, però, non certifica che una proteina sia sicura.
Che cosa filigrana SynthID Bio
I due approcci riguardano rappresentazioni diverse della proteina. SynthIDBio-sequence interviene sulla sequenza degli amminoacidi; SynthIDBio-structure agisce sulle coordinate atomiche di una struttura prevista al computer.
La differenza conta anche per leggere i risultati: una filigrana di sequenza viene cercata nella sequenza amminoacidica, mentre quella strutturale viene rilevata nella rappresentazione tridimensionale. Entrambe sono filigrane «zero-bit»: indicano la presenza del segnale, ma non codificano un registro dettagliato della provenienza o l’identità di più utenti.
Due metodi per due rappresentazioni
SynthIDBio-sequence integra in ProteinMPNN un campionamento a torneo, cioè una selezione di sequenze guidata dal metodo, e applica un filtro basato sul punteggio della filigrana. Per rilevare il segnale, il sistema ricalcola i punteggi usando una chiave segreta.
SynthIDBio-structure modifica invece, tramite fine-tuning, il modulo di diffusione e quello di confidenza di AlphaFold 3, così da incorporare il segnale nelle coordinate atomiche previste. Il rilevatore strutturale è separato dal modello e, secondo Google DeepMind, non viene condiviso con chi usa il modello fine-tuned.
| Metodo | Oggetto marcato e funzionamento | Valutazione riportata | Attacco documentato ed esito |
| SynthIDBio-sequence | Sequenza amminoacidica; campionamento a torneo con ProteinMPNN e filtro basato sul punteggio. Il rilevamento usa una chiave segreta. | Test in vitro su design per SC2RBD, VEGF-A e PD-L1; 100% di veri positivi sui design filtrati, con soglia calibrata su uno 0,1% di falsi positivi. | La risequenziatura con ProteinMPNN senza filigrana ha rimosso efficacemente il segnale. |
| SynthIDBio-structure | Coordinate della struttura prevista; fine-tuning dei moduli di diffusione e confidenza di AlphaFold 3. | Oltre il 99,8% di veri positivi, con uno 0,1% di falsi positivi, sul set valutato per s = 0,001, 0,01 e 0,1 Å. | Il rilassamento strutturale vincolato con OpenMM e Amber99sb ha distrutto il segnale. |
Che cosa hanno misurato i test
Il tasso di veri positivi (TPR) indica la quota di filigrane rilevate correttamente; il tasso di falsi positivi (FPR) la quota di sequenze o strutture senza filigrana classificate erroneamente come marcate. Le percentuali riportate dipendono dalle soglie e dai set di valutazione usati nei test.
Per le sequenze, gli esperimenti in vitro hanno riutilizzato 15 strutture di partenza per ciascuno dei tre bersagli, selezionate da precedenti campagne di design AlphaProteo. Si trattava quindi di risequenziare design già esistenti. Nei design filtrati, il rilevamento ha raggiunto il 100% di TPR con una soglia calibrata per un FPR dello 0,1%. Le distribuzioni dell’affinità di legame non hanno mostrato differenze significative a livello di popolazione tra gruppi con e senza filigrana; i confronti del tasso di successo, invece, variavano in base alla soglia di affinità e all’impostazione della filigrana.
Per le strutture, il TPR ha superato il 99,8% con FPR dello 0,1% sul set valutato, per i tre valori di rumore di coordinate indicati nella tabella. Con s = 0,001 Å, i punteggi LDDT e di template modelling non risultavano inferiori al riferimento di AlphaFold 3; impostazioni di s maggiori hanno prodotto un lieve calo. Il rilevamento era più basso per strutture molto brevi, sotto i 16 residui, e superava rapidamente il 99% per quelle più lunghe.
Gli attacchi documentati e i limiti
La risequenziatura di design marcati con ProteinMPNN senza filigrana ha rimosso efficacemente il segnale di sequenza nei test riportati. Per le strutture, la filigrana è rimasta rilevabile dopo trasformazioni rigide e piccole quantità di rumore sulle coordinate; il rilassamento vincolato eseguito con OpenMM e il campo di forze Amber99sb l’ha invece distrutta.
Questi risultati riguardano le manipolazioni provate. Non trasformano il contrassegno in una certificazione di sicurezza: una filigrana può segnalare la presenza del marcatore, non stabilire che una proteina sia innocua. Le applicazioni nello screening delle sequenze e nella cura dei database sono prospettate come possibili e richiedono ulteriore ricerca, coordinamento e standardizzazione.