Em 30 de setembro de 2026, o Google DeepMind anuncia a SynthID Bio, um conjunto de métodos experimentais que insere sinais detectáveis de procedência em sequências de proteínas projetadas por IA e em estruturas proteicas previstas. A ideia é ajudar a identificar a origem de um projeto biológico; para isso, a tecnologia usa abordagens diferentes para sequências e estruturas.
Uma marca de procedência não é uma avaliação de segurança biológica. O sinal pode ajudar a rastrear a origem de um projeto, mas não certifica que uma proteína seja segura.
O que a SynthID Bio marca
A SynthID Bio se destina a dois objetos: a sequência de aminoácidos de uma proteína e sua estrutura tridimensional prevista por um modelo. A sequência descreve a ordem dos aminoácidos; a estrutura prevista representa como a proteína pode se dobrar no espaço.
Como funcionam os dois métodos
O SynthIDBio-sequence insere o sinal durante a escolha dos aminoácidos com o modelo ProteinMPNN. A detecção usa uma chave secreta e uma pontuação de marca-d’água, que é filtrada segundo uma taxa de falsos positivos definida.
O SynthIDBio-structure ajusta módulos de difusão e de confiança do AlphaFold 3, além de treinar um detector. Nesse caso, o sinal é incorporado às coordenadas durante a previsão da estrutura.
| Método | Objeto marcado | Abordagem técnica | Efeito da alteração testada |
| SynthIDBio-sequence | Sequência de aminoácidos | Inserção do sinal durante a amostragem do ProteinMPNN; detecção com chave secreta e filtragem por pontuação | O resequenciamento com ProteinMPNN removeu efetivamente a marca no ataque testado |
| SynthIDBio-structure | Estrutura biomolecular prevista | Ajuste de módulos do AlphaFold 3 e de um detector, com o sinal incorporado durante a previsão | A relaxação restrita com OpenMM e Amber99sb destruiu a marca no teste relatado |
O que os testes com proteínas mostraram
Os ensaios com ligantes proteicos partiram de estruturas-base previamente validadas: foram selecionadas 15 para cada um dos três alvos, VEGF-A, SC2RBD e PD-L1. Portanto, os resultados dizem respeito a essas sequências e condições de teste.
As distribuições de afinidade de ligação, medidas por ressonância plasmônica de superfície (SPR), não apresentaram diferença significativa em nível populacional entre os grupos com e sem marca-d’água. Já no limiar KD ≤ 10⁻⁶, os ligantes sem marca tiveram uma taxa de acerto maior que o grupo marcado na configuração não distorciva de temperatura 0,5.
Na detecção das sequências selecionadas e filtradas para os ensaios in vitro, a taxa de verdadeiros positivos (TPR) foi de 100% quando a taxa de falsos positivos (FPR) foi ajustada para 0,1%. Esse resultado se aplica ao conjunto e às condições avaliados.
Para as estruturas, a TPR superou 99,8% a uma FPR de 0,1% no conjunto de avaliação do AlphaFold 3. A marca resistiu a transformações rígidas e a pequenas perturbações de coordenadas nos testes relatados, mas não à relaxação restrita com OpenMM e Amber99sb. No método de sequência, o resequenciamento com ProteinMPNN removeu efetivamente o sinal no ataque testado.
Usos possíveis e uma frente separada com Evo 2
O Google DeepMind apresenta a triagem de síntese de DNA e a identificação de procedência em bancos de dados biológicos como aplicações possíveis, que ainda exigem pesquisa, coordenação e padronização.
Em uma linha de trabalho separada, o Google DeepMind, a Stanford University e o Arc Institute colaboram para aplicar a SynthID Bio a um genoma de bacteriófago projetado com o Evo 2. O Google DeepMind relata que testes iniciais em culturas bacterianas encontraram bacteriófagos com marca-d’água funcionais.