30 września 2026 r. Google DeepMind ogłosiło SynthID Bio — koncepcję dwóch metod znakowania sekwencji białek zaprojektowanych przez AI lub ich przewidywanych struktur. Opisane badanie obejmuje testy laboratoryjne binderów dla trzech celów oraz pomiary wykrywalności przy określonych progach. Wyniki nie oznaczają, że znak wodny ocenia bezpieczeństwo białka.

Google DeepMind przedstawia SynthID Bio

SynthID Bio ma pomóc rozpoznawać, czy sekwencja lub przewidywana struktura białka została oznaczona podczas projektowania z użyciem AI. Praca opisująca metody ukazała się tego samego dnia co ogłoszenie. To dowód koncepcji, a nie gotowy system kontroli stosowany w laboratoriach czy firmach zajmujących się syntezą.

Ogłoszeniu towarzyszył wpis przedstawiający metodę jako sposób znakowania i wykrywania białek zaprojektowanych przez AI.

Dwie metody: sekwencja i struktura

SynthIDBio-sequence umieszcza sygnał w sekwencji aminokwasów, czyli w kolejności elementów budujących białko. Metoda wykorzystuje model ProteinMPNN: steruje doborem aminokwasów za pomocą klucza i filtra oceniającego siłę znaku wodnego. Do wykrywania sygnału służy ten klucz.

SynthIDBio-structure działa na przewidywanej strukturze białka. Dostraja moduły dyfuzyjny i oceny pewności w AlphaFold 3 tak, by w przewidywanych współrzędnych pojawił się wykrywalny sygnał. Wykrywa go osobno wytrenowany detektor.

Obie metody mają charakter „zero-bitowy”: wskazują obecność znaku, a nie zapisują szczegółowej informacji o autorze, pochodzeniu czy samym projekcie. Podobna idea znakowania statystycznego pojawia się też w tekstach generowanych przez AI, ale mechanizm Claude opisany w osobnym artykule NeoTeo dotyczy tekstu, nie białek.

Co wykazały testy binderów

Testy in vitro objęły bindery — białka zaprojektowane tak, by wiązały się z określonym celem — dla SC2RBD, VEGF-A i PD-L1. W pomiarach metodą rezonansu plazmonów powierzchniowych (SPR) nie stwierdzono istotnych różnic między grupami w rozkładzie powinowactwa wiązania. Wynik dotyczy badanych projektów i tych trzech celów.

Jest też ważny szczegół: przy progu powinowactwa Kᴅ ≤ 10⁻⁶ nieznakowane bindery miały wyższy odsetek trafień niż bindery ze znakiem w ustawieniu „non-distortionary 0.5”. Przy bardziej rygorystycznym progu Kᴅ ≤ 10⁻⁷ nie odnotowano istotnej różnicy w odsetku trafień. To rozróżnienie ma znaczenie: podobny rozkład powinowactwa w całej badanej populacji nie oznacza identycznego wyniku przy każdym progu.

Badanie podało także wyniki detekcji, ale ich wartości zależą od metody i ustawień. Dla filtrowanych projektów sekwencji testowanych in vitro SynthIDBio-sequence osiągnął 100% czułości przy odsetku wyników fałszywie dodatnich wynoszącym 0,1%. Filtr ogranicza pulę projektów przechodzących dalej i wymaga dodatkowych obliczeń.

W testowanych modelach struktur SynthIDBio-structure osiągnął czułość powyżej 99,8% przy 0,1% wyników fałszywie dodatnich. Dla modelu z parametrem s = 0,001 czułość wyniosła 98,99% przy niższym progu wyników fałszywie dodatnich, wynoszącym 0,01%. Są to wyniki konkretnych testów, a nie uniwersalna gwarancja wykrywania każdego oznaczonego białka.

Znak pochodzenia nie jest oceną bezpieczeństwa

W opisanym badaniu ponowne zaprojektowanie sekwencji za pomocą ProteinMPNN skutecznie usuwało znak SynthIDBio-sequence. Ten wynik dotyczy konkretnego sposobu resekwencjonowania; nie przesądza o skutkach każdej pojedynczej zmiany w sekwencji.

Znak może wskazywać pochodzenie projektu, ale sam nie mówi, czy białko jest bezpieczne. Praca przedstawia wykorzystanie takich sygnałów w przyszłym screeningu bioasekuracyjnym i kontroli rzetelności danych naukowych jako możliwe zastosowania, które wymagają dalszych prac i koordynacji. Opisane testy nie są wdrożonym systemem kontroli syntezy.

Również znak w przewidywanej strukturze ma swoje ograniczenia: w badaniu wymuszona relaksacja struktury z użyciem OpenMM i pola siłowego Amber99sb niszczyła sygnał. Z kolei dla sekwencji skuteczność usunięcia zależała od konkretnego ataku resekwencjonującego.

Kod, dane i wagi modeli

Google DeepMind zapowiedziało udostępnienie kodu SynthIDBio-sequence i danych z walidacji in vitro, a także wag modeli badaczom. Potencjalne zastosowania obejmują oznaczanie pochodzenia białek i wsparcie przyszłych procesów kontroli; sam znak pozostaje jednak sygnałem pochodzenia, nie werdyktem o bezpieczeństwie.