Google DeepMind opisuje SynthID Bio jako rodzinę metod znakowania sekwencji białek projektowanych przez AI oraz ich przewidywanych struktur. To dwa odrębne podejścia: jedno zapisuje sygnał w sekwencji aminokwasów, drugie — we współrzędnych modelu 3D.
Taki znak może sygnalizować pochodzenie projektu, ale nie ocenia, czy białko jest bezpieczne. Wyniki testów dotyczą konkretnych zestawów i warunków, a opisane operacje potrafiły usunąć oba rodzaje oznaczeń.
Co znakują metody SynthID Bio?
SynthIDBio-sequence oznacza sekwencję aminokwasów, czyli kolejność jej elementów. SynthIDBio-structure umieszcza sygnał w przewidywanych współrzędnych przestrzennych białka. W pierwszym przypadku wykrywacz analizuje sekwencję z użyciem tajnego klucza; w drugim osobny detektor rozpoznaje znak w strukturze.
Obie metody są tak zwanymi znakami zerobitowymi: wskazują obecność znaku, ale nie zapisują rozbudowanej historii pochodzenia ani nie rozróżniają wielu użytkowników.
Dwie metody dla dwóch reprezentacji
SynthIDBio-sequence łączy próbkowanie turniejowe z ProteinMPNN — modelem używanym do projektowania sekwencji białek — i filtrowaniem wyników według oceny znaku. Detektor oblicza wynik dla sekwencji, korzystając z tajnego klucza.
SynthIDBio-structure dostosowuje moduł dyfuzji i moduł oceny pewności modelu AlphaFold 3, tak aby przewidywane współrzędne zawierały wykrywalny sygnał. Detektor jest trenowany osobno i, według opisu tej metody, nie jest udostępniany użytkownikom dostrojonego modelu.
| Metoda | Znakowany obiekt i sposób działania | Opisana ewaluacja | Udokumentowany atak i wynik |
| SynthIDBio-sequence | Sekwencja aminokwasów; próbkowanie turniejowe z ProteinMPNN, filtrowanie według oceny znaku i wykrywanie z użyciem tajnego klucza. | W testach in vitro użyto istniejących szkieletów projektowych binderów dla SC2RBD, VEGF-A i PD-L1. Dla przefiltrowanych projektów raportowano 100% TPR przy progu skalibrowanym do FPR 0,1%. | Ponowne projektowanie sekwencji przez ProteinMPNN bez znaku skutecznie usuwało znak w opisanym teście. |
| SynthIDBio-structure | Przewidywane współrzędne 3D; dostrojenie modułów dyfuzji i oceny pewności AlphaFold 3 oraz osobny detektor. | W zbiorze ewaluacyjnym raportowano ponad 99,8% TPR przy FPR 0,1% dla ustawień szumu współrzędnych s = 0,001, 0,01 i 0,1 Å. | Ograniczona relaksacja struktury z użyciem OpenMM i Amber99sb niszczyła znak w opisanym eksperymencie. |
TPR to odsetek prawidłowo wykrytych oznaczonych próbek, a FPR — odsetek nieoznaczonych próbek błędnie uznanych za oznaczone. Wyniki dla obu metod odnoszą się do ich własnych testów i progów, dlatego nie stanowią bezpośredniego rankingu.
Co wykazały testy?
Testy sekwencji obejmowały 15 istniejących szkieletów projektowych na każdy z trzech celów. Były to projekty z wcześniejszych kampanii AlphaProteo, których sekwencje ponownie zaprojektowano z użyciem znakowania. Nie był to pełny eksperyment projektowania białek od zera.
W tych testach nie stwierdzono istotnej różnicy na poziomie całych grup w rozkładzie powinowactwa wiązania między projektami oznaczonymi i nieoznaczonymi. Porównanie odsetka trafień zależało jednak od przyjętego progu powinowactwa i ustawienia znaku. Wynik dotyczy badanych binderów i warunków eksperymentu.
Dla znakowania struktur wysoka wykrywalność odnosiła się do zbioru ewaluacyjnego i trzech wymienionych ustawień szumu. Przy s = 0,001 raportowane wyniki LDDT i oceny dopasowania do szablonu nie były niższe niż dla bazowego AlphaFold 3. Wykrywalność była niższa dla bardzo krótkich struktur, poniżej 16 reszt; dla dłuższych szybko przekraczała 99%.
Jak znak może zostać usunięty?
Opisane ataki dotyczyły konkretnych zmian. Ponowne projektowanie oznaczonej sekwencji za pomocą nieoznaczonego ProteinMPNN skutecznie usuwało znak sekwencji. W przypadku struktur znak pozostawał wykrywalny po obrotach i przesunięciach oraz przy niewielkim szumie współrzędnych, ale niszczyła go ograniczona relaksacja wykonana z użyciem OpenMM i Amber99sb.
Znak wodny nie jest certyfikatem bezpieczeństwa: sygnalizuje obecność oznaczenia, a nie to, czy białko może wyrządzić szkodę. Możliwe zastosowania w kontroli syntezy DNA i porządkowaniu baz danych pozostają propozycją wymagającą dalszych badań, koordynacji i standaryzacji.