SynthID Bio bezeichnet eine von Google DeepMind beschriebene Methodenfamilie, die Wasserzeichen in KI-entworfene Proteinsequenzen und vorhergesagte Proteinstrukturen einbetten soll. Ein solches Signal könnte helfen, die Herkunft eines biologischen Designs nachzuverfolgen.

Die Markierung ist jedoch kein Sicherheitsurteil: Sie weist auf ein Wasserzeichen hin, nicht darauf, ob ein Protein harmlos ist.

Zwei Verfahren markieren unterschiedliche Ebenen

SynthIDBio-sequence versieht die Aminosäuresequenz mit einem Signal. Das Verfahren integriert Tournament-Sampling aus SynthID-text in ProteinMPNN und filtert Sequenzen anhand eines Wasserzeichen-Scores. Zur Erkennung wird der Score mit einem geheimen Schlüssel neu berechnet.

SynthIDBio-structure setzt dagegen bei vorhergesagten 3D-Koordinaten an – also den Positionen der Atome im Strukturmodell. Dafür werden das Diffusions- und das Konfidenzmodul von AlphaFold 3 feinabgestimmt. Ein separat trainierter Detektor erkennt das Signal; er wird den Nutzern des feinabgestimmten Modells nicht mitgegeben.

AnsatzMarkierung und VerfahrenBerichtete ErkennungGezielter Eingriff
SynthIDBio-sequenceAminosäuresequenz; ProteinMPNN mit Tournament-Sampling und Wasserzeichen-Filter. Die Erkennung benötigt einen geheimen Schlüssel.Gefilterte In-vitro-Designs: 100 % TPR bei einer auf 0,1 % FPR kalibrierten Schwelle.Eine erneute Sequenzgestaltung mit ProteinMPNN ohne Wasserzeichen entfernte das Signal im getesteten Angriff effektiv.
SynthIDBio-structureVorhergesagte 3D-Koordinaten; Feinabstimmung der Diffusions- und Konfidenzmodule von AlphaFold 3, mit separatem Detektor.Im Evaluationssatz mehr als 99,8 % TPR bei 0,1 % FPR für die Rauschwerte s = 0,001, 0,01 und 0,1 Å.Eine eingeschränkte Strukturrelaxation mit OpenMM und Amber99sb zerstörte das Wasserzeichen im Versuch.

Was die Tests gemessen haben

TPR bezeichnet den Anteil markierter Designs, die als markiert erkannt werden. FPR gibt den Anteil unmarkierter Designs an, die fälschlich als markiert gelten. Die beiden Raten beziehen sich auf unterschiedliche Prüfgruppen; die Prozentwerte der Sequenz- und Strukturtests sind deshalb nicht ohne ihre jeweiligen Bedingungen zu vergleichen.

Die In-vitro-Tests mit SynthIDBio-sequence nutzten bereits vorhandene Designgerüste aus AlphaProteo-Kampagnen: 15 je Zielprotein. Geprüft wurden Binder gegen SC2RBD, VEGF-A und PD-L1. Zwischen den markierten und unmarkierten Gruppen gab es auf Populationsebene keinen signifikanten Unterschied in den Verteilungen der Bindungsaffinität. Die Ergebnisse zu den Trefferquoten hingen jedoch vom verwendeten Affinitätsgrenzwert und der jeweiligen Wasserzeicheneinstellung ab.

Bei SynthIDBio-structure lagen die LDDT- und Template-Modelling-Werte für die kleinste Rauscheinstellung, s = 0,001 Å, nicht unter dem AlphaFold-3-Basiswert. Bei den höheren Einstellungen wurde ein kleiner Rückgang dieser Werte berichtet.

Herkunftssignal, keine Sicherheitsbescheinigung

Beide Verfahren sind Null-Bit-Wasserzeichen: Sie signalisieren, ob ein Wasserzeichen vorhanden ist, speichern aber weder eine Nutzeridentität noch eine detaillierte Herkunftsgeschichte. Die Erkennungswerte gelten für die jeweiligen Tests und Bedingungen; die beschriebenen Eingriffe zeigen zugleich, dass sich die Signale mit bestimmten Änderungen entfernen oder zerstören lassen.

Als mögliche spätere Einsatzfelder kommen die Prüfung von Sequenzen bei DNA-Syntheseunternehmen und die Pflege wissenschaftlicher Datenbanken infrage. Dafür sind weitere Forschung, Abstimmung und Standardisierung nötig.