Em 30 de setembro de 2026, o Google DeepMind anuncia a SynthID Bio, um conjunto de métodos experimentais que insere sinais detectáveis de procedência em sequências de proteínas projetadas por IA e em estruturas proteicas previstas. A ideia é ajudar a identificar a origem de um projeto biológico; para isso, a tecnologia usa abordagens diferentes para sequências e estruturas.

Uma marca de procedência não é uma avaliação de segurança biológica. O sinal pode ajudar a rastrear a origem de um projeto, mas não certifica que uma proteína seja segura.

O que a SynthID Bio marca

A SynthID Bio se destina a dois objetos: a sequência de aminoácidos de uma proteína e sua estrutura tridimensional prevista por um modelo. A sequência descreve a ordem dos aminoácidos; a estrutura prevista representa como a proteína pode se dobrar no espaço.

Como funcionam os dois métodos

O SynthIDBio-sequence insere o sinal durante a escolha dos aminoácidos com o modelo ProteinMPNN. A detecção usa uma chave secreta e uma pontuação de marca-d’água, que é filtrada segundo uma taxa de falsos positivos definida.

O SynthIDBio-structure ajusta módulos de difusão e de confiança do AlphaFold 3, além de treinar um detector. Nesse caso, o sinal é incorporado às coordenadas durante a previsão da estrutura.

MétodoObjeto marcadoAbordagem técnicaEfeito da alteração testada
SynthIDBio-sequenceSequência de aminoácidosInserção do sinal durante a amostragem do ProteinMPNN; detecção com chave secreta e filtragem por pontuaçãoO resequenciamento com ProteinMPNN removeu efetivamente a marca no ataque testado
SynthIDBio-structureEstrutura biomolecular previstaAjuste de módulos do AlphaFold 3 e de um detector, com o sinal incorporado durante a previsãoA relaxação restrita com OpenMM e Amber99sb destruiu a marca no teste relatado

O que os testes com proteínas mostraram

Os ensaios com ligantes proteicos partiram de estruturas-base previamente validadas: foram selecionadas 15 para cada um dos três alvos, VEGF-A, SC2RBD e PD-L1. Portanto, os resultados dizem respeito a essas sequências e condições de teste.

As distribuições de afinidade de ligação, medidas por ressonância plasmônica de superfície (SPR), não apresentaram diferença significativa em nível populacional entre os grupos com e sem marca-d’água. Já no limiar KD ≤ 10⁻⁶, os ligantes sem marca tiveram uma taxa de acerto maior que o grupo marcado na configuração não distorciva de temperatura 0,5.

Na detecção das sequências selecionadas e filtradas para os ensaios in vitro, a taxa de verdadeiros positivos (TPR) foi de 100% quando a taxa de falsos positivos (FPR) foi ajustada para 0,1%. Esse resultado se aplica ao conjunto e às condições avaliados.

Para as estruturas, a TPR superou 99,8% a uma FPR de 0,1% no conjunto de avaliação do AlphaFold 3. A marca resistiu a transformações rígidas e a pequenas perturbações de coordenadas nos testes relatados, mas não à relaxação restrita com OpenMM e Amber99sb. No método de sequência, o resequenciamento com ProteinMPNN removeu efetivamente o sinal no ataque testado.

Usos possíveis e uma frente separada com Evo 2

O Google DeepMind apresenta a triagem de síntese de DNA e a identificação de procedência em bancos de dados biológicos como aplicações possíveis, que ainda exigem pesquisa, coordenação e padronização.

Em uma linha de trabalho separada, o Google DeepMind, a Stanford University e o Arc Institute colaboram para aplicar a SynthID Bio a um genoma de bacteriófago projetado com o Evo 2. O Google DeepMind relata que testes iniciais em culturas bacterianas encontraram bacteriófagos com marca-d’água funcionais.