Em 30 de setembro de 2026, a Google DeepMind apresentou o SynthID Bio, uma prova de conceito com métodos para marcar sequências e estruturas previstas de proteínas geradas por inteligência artificial. A proposta é ajudar a identificar a procedência desses projetos; os resultados relatados, porém, são condicionais aos métodos e limiares testados.
Google DeepMind apresenta o SynthID Bio
O SynthID Bio reúne duas abordagens para inserir sinais detectáveis em proteínas projetadas com IA. Uma atua na sequência de aminoácidos; a outra, na estrutura tridimensional prevista. A Google DeepMind anunciou o projeto na mesma data em que o estudo metodológico foi publicado na Nature.
A marca é um sinal de procedência: os métodos descritos indicam sua presença, mas não codificam uma identidade ou uma mensagem detalhada. Por isso, detectar uma marca não é uma avaliação de segurança da proteína.
Dois métodos para sequências e estruturas
O SynthIDBio-sequence modifica a seleção de aminoácidos durante a geração de sequências com o ProteinMPNN. Ele combina amostragem por torneio com chave secreta e um filtro baseado em uma pontuação de marca d’água. A detecção usa essa chave para calcular a pontuação da sequência.
O SynthIDBio-structure segue outro caminho: ajusta módulos de difusão e de confiança do AlphaFold 3 para inserir um sinal nas coordenadas das estruturas previstas. Um detector treinado separadamente procura esse sinal.
O anúncio do projeto também foi registrado em uma publicação na rede social X.
O que os testes com proteínas ligantes mostraram
Os testes in vitro do método de sequência avaliaram ligantes projetados para três alvos: SC2RBD, VEGF-A e PD-L1. A análise incluiu 222 sequências sem marca e 267 sequências marcadas em cada uma das duas configurações de marcação, sem contar os controles.
As medições por ressonância plasmônica de superfície não encontraram diferença significativa, entre os grupos, na distribuição das afinidades de ligação. O resultado foi mais específico quando o estudo avaliou a proporção de ligantes que atingia determinados limiares: em KD ≤ 10⁻⁷, não houve diferença significativa; em KD ≤ 10⁻⁶, os ligantes sem marca tiveram uma taxa de acerto maior que os da configuração não distorciva 0,5.
A detecção de sequências marcou 100% dos projetos in vitro filtrados como positivos, com um limiar calibrado para uma taxa de falsos positivos de 0,1%. O filtro melhora a detectabilidade, mas reduz a proporção de projetos que passa e exige computação adicional.
Para os modelos de estrutura testados, a taxa de verdadeiros positivos superou 99,8% com taxa de falsos positivos de 0,1%. No modelo com s = 0,001, a taxa de verdadeiros positivos foi de 98,99% com taxa de falsos positivos de 0,01%. Esses números pertencem aos modelos e às condições avaliados.
A marca pode ser removida — e não mede segurança
O estudo relata que uma tentativa de reescrever sequências com ProteinMPNN removeu efetivamente a marca do SynthIDBio-sequence. Na abordagem estrutural, transformações rígidas e ruído leve nas coordenadas não eliminaram a detecção; já um relaxamento estrutural com restrições destruiu a marca.
O uso em triagem de biosegurança e em bases de dados científicas é uma possibilidade, não um sistema de triagem já implantado. O estudo trata a marca como uma camada potencial de procedência, cujo uso operacional exigiria mais desenvolvimento e coordenação.
Acesso à pesquisa e possíveis usos
A Google DeepMind informou que o código do SynthIDBio-sequence e os dados de validação in vitro estão disponíveis no repositório do projeto e que os pesos dos modelos de estrutura seriam disponibilizados a pesquisadores.