Google DeepMind beschrijft SynthID Bio als twee methoden om eiwitsequenties die met AI zijn ontworpen en voorspelde eiwitstructuren van een detecteerbaar watermerk te voorzien. De ene markeert de aminozuurvolgorde; de andere markeert de voorspelde 3D-coördinaten.

Zo’n merkteken kan helpen de herkomst van een eiwitontwerp te herkennen. De beschreven methoden zijn een technisch proof of concept, geen operationeel screeningssysteem.

Wat SynthID Bio markeert

Een eiwit bestaat uit een keten aminozuren die zich vouwt tot een ruimtelijke structuur. SynthID Bio beschrijft een aparte markeermethode voor elk van die twee representaties: de sequentie en de voorspelde structuur.

Bij SynthIDBio-sequence gebruikt ProteinMPNN een aangepaste steekproefmethode om de sequentie te markeren. Een scorefilter helpt vervolgens ontwerpen met een voldoende sterk signaal te selecteren. De detector berekent scores met een geheime sleutel.

SynthIDBio-structure past de diffusie- en betrouwbaarheidsmodules van AlphaFold 3 aan, zodat de voorspelde coördinaten een signaal dragen. Een afzonderlijk getrainde detector herkent dat signaal; die detector wordt niet gedeeld met gebruikers van het aangepaste model.

Wat de gerapporteerde tests maten

De sequentietests onderzochten in het laboratorium binders voor SC2RBD, VEGF-A en PD-L1. Per doelwit gebruikten ze 15 bestaande ontwerp-ruggengraten uit AlphaProteo-projecten. De tests markeerden dus geen eiwitten via een volledig nieuw ontwerptraject.

Bij de gefilterde sequentieontwerpen rapporteerden de tests een true-positive rate (TPR) van 100%: alle gemarkeerde ontwerpen in de evaluatie werden gedetecteerd. De drempel was afgestemd op een false-positive rate (FPR) van 0,1%, het aandeel niet-gemarkeerde ontwerpen dat ten onrechte als gemarkeerd wordt aangemerkt. Dit zijn resultaten voor deze ontwerpen en testopzet.

Voor de structuurmethode lag de TPR in de evaluatieset boven 99,8% bij een FPR van 0,1%. Dat gold voor modellen die waren getraind met coördinatenruisinstellingen van 0,001, 0,01 en 0,1 Å. Bij de instelling van 0,001 Å waren de gerapporteerde LDDT- en template-modellingscores niet lager dan die van de AlphaFold 3-basislijn.

MethodeWat krijgt een watermerk?Gerapporteerde evaluatieGeteste aanval en uitkomst
SynthIDBio-sequenceDe aminozuursequentie, via aangepaste sampling met ProteinMPNN en een scorefilterTPR van 100% voor gefilterde in-vitro-ontwerpen; drempel afgestemd op 0,1% FPRHersampling met niet-watermerkende ProteinMPNN verwijderde het sequentiewatermerk effectief
SynthIDBio-structureDe voorspelde 3D-coördinaten, via aanpassing van onderdelen van AlphaFold 3TPR boven 99,8% bij 0,1% FPR op de evaluatieset, voor drie instellingen voor coördinatenruisConstrained relaxation met OpenMM en Amber99sb vernietigde het structuurwatermerk

In de sequentietests was er geen significant verschil op populatieniveau tussen de verdelingen van bindingsaffiniteit van gemarkeerde en ongemarkeerde groepen. De uitkomsten voor het aandeel geslaagde binders hingen wel af van de gekozen affiniteitsdrempel en watermerkinstelling. Dat resultaat geldt voor de geteste binders en omstandigheden.

Waar de markering kan verdwijnen

De gerapporteerde kwetsbaarheden verschillen per methode. Niet-watermerkende hersampling met ProteinMPNN verwijderde het sequentiewatermerk effectief. Het structuurwatermerk bleef herkenbaar na rigide transformaties en kleine hoeveelheden coördinatenruis, maar constrained relaxation met OpenMM en Amber99sb vernietigde het in de geteste procedure.

Een watermerk bewijst niet dat een eiwit veilig is: het signaleert de aanwezigheid van een markering. De methoden zijn zogeheten zero-bit-watermerken. Ze geven aan dat een watermerk aanwezig is, maar leggen geen uitgebreide herkomstgeschiedenis of identiteit van meerdere gebruikers vast. Toepassingen voor screening door DNA-synthesebedrijven of voor het beheren van databanken zijn mogelijke vervolgstappen; daarvoor zijn verder onderzoek, samenwerking en standaardisatie nodig.