Google DeepMind presentó SynthID Bio el 30 de septiembre de 2026: una familia de métodos de prueba de concepto para marcar secuencias de proteínas generadas con IA y estructuras predichas. El estudio metodológico se publicó ese mismo día. La marca aporta una señal de procedencia —una pista sobre cómo se generó un diseño—, no una evaluación de seguridad.

Dos métodos para secuencias y estructuras

SynthIDBio-sequence modifica la selección de aminoácidos durante la generación de secuencias con ProteinMPNN. Combina un muestreo guiado por una clave con un filtro basado en una puntuación de marca, llamada valor g; la detección utiliza esa clave para calcular las puntuaciones de la secuencia.

SynthIDBio-structure sigue otra ruta: ajusta los módulos de difusión y de confianza de AlphaFold 3 para que las coordenadas de las estructuras predichas lleven una señal detectable. Un detector entrenado por separado busca esa señal. En ambos casos, la marca es de «cero bits»: señala su presencia, pero no codifica una identidad detallada ni un mensaje.

La comunicación pública del proyecto resume su propósito: marcar y detectar proteínas diseñadas con IA.

Qué midieron las pruebas con aglutinantes

Las pruebas in vitro evaluaron aglutinantes para tres dianas: el dominio de unión al receptor del SARS-CoV-2 (SC2RBD), VEGF-A y PD-L1. En cada diana, se resecuenciaron 15 esqueletos de aglutinante diseñados previamente. En el conjunto de pruebas, se analizaron 222 secuencias sin marca y 267 secuencias con marca para cada uno de los dos ajustes, sin contar los controles.

Las mediciones de afinidad de unión, obtenidas mediante resonancia de plasmones superficiales (SPR), no mostraron diferencias significativas entre las distribuciones poblacionales de diseños marcados y sin marcar. Pero el resultado tiene un matiz: con el umbral KD ≤ 10⁻⁶, los aglutinantes sin marca tuvieron una tasa de aciertos superior a los del ajuste no distorsionador 0,5. Los resultados describen esos diseños y condiciones, no todos los tipos de proteínas.

En los diseños in vitro filtrados, el método de secuencia alcanzó una tasa de verdaderos positivos (TPR) del 100 % con un umbral calibrado para una tasa de falsos positivos (FPR) del 0,1 %. El filtro reduce cuántos diseños superan el proceso y exige más cálculo.

Para los modelos de estructura probados, la TPR superó el 99,8 % con una FPR del 0,1 %. En el modelo con s = 0,001, la TPR fue del 98,99 % con una FPR del 0,01 %. Son resultados ligados a esos modelos y umbrales, no una garantía para cualquier proteína o ajuste.

Una señal de procedencia no certifica seguridad

La detección de la marca no evalúa si una proteína es segura. El estudio plantea el cribado de bioseguridad y la integridad de los datos científicos como posibles usos, que requerirían más desarrollo y coordinación para llevarse a la práctica.

También informa de una vulnerabilidad concreta en la vía de secuencias: una resecuenciación con ProteinMPNN eliminó eficazmente la marca en el ataque probado. En la vía estructural, la detección resistió transformaciones rígidas y ruido leve en las coordenadas; una relajación estructural restringida con OpenMM y el campo de fuerza Amber99sb destruyó la marca.

Código, datos y posibles usos

El código de SynthIDBio-sequence y los datos de validación in vitro están disponibles en el repositorio del proyecto. Google DeepMind anunció que pondría los pesos del modelo estructural a disposición de investigadores. La procedencia podría ayudar a identificar diseños generados con IA en futuros procesos de cribado y en bases de datos científicas, siempre como una señal dentro de un sistema más amplio.