Google DeepMind opisuje SynthID Bio jako rodzinę metod znakowania sekwencji białek projektowanych przez AI oraz ich przewidywanych struktur. To dwa odrębne podejścia: jedno zapisuje sygnał w sekwencji aminokwasów, drugie — we współrzędnych modelu 3D.

Taki znak może sygnalizować pochodzenie projektu, ale nie ocenia, czy białko jest bezpieczne. Wyniki testów dotyczą konkretnych zestawów i warunków, a opisane operacje potrafiły usunąć oba rodzaje oznaczeń.

Co znakują metody SynthID Bio?

SynthIDBio-sequence oznacza sekwencję aminokwasów, czyli kolejność jej elementów. SynthIDBio-structure umieszcza sygnał w przewidywanych współrzędnych przestrzennych białka. W pierwszym przypadku wykrywacz analizuje sekwencję z użyciem tajnego klucza; w drugim osobny detektor rozpoznaje znak w strukturze.

Obie metody są tak zwanymi znakami zerobitowymi: wskazują obecność znaku, ale nie zapisują rozbudowanej historii pochodzenia ani nie rozróżniają wielu użytkowników.

Dwie metody dla dwóch reprezentacji

SynthIDBio-sequence łączy próbkowanie turniejowe z ProteinMPNN — modelem używanym do projektowania sekwencji białek — i filtrowaniem wyników według oceny znaku. Detektor oblicza wynik dla sekwencji, korzystając z tajnego klucza.

SynthIDBio-structure dostosowuje moduł dyfuzji i moduł oceny pewności modelu AlphaFold 3, tak aby przewidywane współrzędne zawierały wykrywalny sygnał. Detektor jest trenowany osobno i, według opisu tej metody, nie jest udostępniany użytkownikom dostrojonego modelu.

MetodaZnakowany obiekt i sposób działaniaOpisana ewaluacjaUdokumentowany atak i wynik
SynthIDBio-sequenceSekwencja aminokwasów; próbkowanie turniejowe z ProteinMPNN, filtrowanie według oceny znaku i wykrywanie z użyciem tajnego klucza.W testach in vitro użyto istniejących szkieletów projektowych binderów dla SC2RBD, VEGF-A i PD-L1. Dla przefiltrowanych projektów raportowano 100% TPR przy progu skalibrowanym do FPR 0,1%.Ponowne projektowanie sekwencji przez ProteinMPNN bez znaku skutecznie usuwało znak w opisanym teście.
SynthIDBio-structurePrzewidywane współrzędne 3D; dostrojenie modułów dyfuzji i oceny pewności AlphaFold 3 oraz osobny detektor.W zbiorze ewaluacyjnym raportowano ponad 99,8% TPR przy FPR 0,1% dla ustawień szumu współrzędnych s = 0,001, 0,01 i 0,1 Å.Ograniczona relaksacja struktury z użyciem OpenMM i Amber99sb niszczyła znak w opisanym eksperymencie.

TPR to odsetek prawidłowo wykrytych oznaczonych próbek, a FPR — odsetek nieoznaczonych próbek błędnie uznanych za oznaczone. Wyniki dla obu metod odnoszą się do ich własnych testów i progów, dlatego nie stanowią bezpośredniego rankingu.

Co wykazały testy?

Testy sekwencji obejmowały 15 istniejących szkieletów projektowych na każdy z trzech celów. Były to projekty z wcześniejszych kampanii AlphaProteo, których sekwencje ponownie zaprojektowano z użyciem znakowania. Nie był to pełny eksperyment projektowania białek od zera.

W tych testach nie stwierdzono istotnej różnicy na poziomie całych grup w rozkładzie powinowactwa wiązania między projektami oznaczonymi i nieoznaczonymi. Porównanie odsetka trafień zależało jednak od przyjętego progu powinowactwa i ustawienia znaku. Wynik dotyczy badanych binderów i warunków eksperymentu.

Dla znakowania struktur wysoka wykrywalność odnosiła się do zbioru ewaluacyjnego i trzech wymienionych ustawień szumu. Przy s = 0,001 raportowane wyniki LDDT i oceny dopasowania do szablonu nie były niższe niż dla bazowego AlphaFold 3. Wykrywalność była niższa dla bardzo krótkich struktur, poniżej 16 reszt; dla dłuższych szybko przekraczała 99%.

Jak znak może zostać usunięty?

Opisane ataki dotyczyły konkretnych zmian. Ponowne projektowanie oznaczonej sekwencji za pomocą nieoznaczonego ProteinMPNN skutecznie usuwało znak sekwencji. W przypadku struktur znak pozostawał wykrywalny po obrotach i przesunięciach oraz przy niewielkim szumie współrzędnych, ale niszczyła go ograniczona relaksacja wykonana z użyciem OpenMM i Amber99sb.

Znak wodny nie jest certyfikatem bezpieczeństwa: sygnalizuje obecność oznaczenia, a nie to, czy białko może wyrządzić szkodę. Możliwe zastosowania w kontroli syntezy DNA i porządkowaniu baz danych pozostają propozycją wymagającą dalszych badań, koordynacji i standaryzacji.