El 29 de septiembre de 2026 se publicaron advertencias de investigadores actuales y antiguos de OpenAI y Google DeepMind sobre los riesgos de la auto-mejora recursiva. La IA ya ayuda en tareas de desarrollo, pero Anthropic afirma que aún no se ha alcanzado un ciclo plenamente autónomo en el que una IA construya sucesores más capaces.
Investigadores alertan sobre el ritmo del desarrollo de IA
Entre las advertencias difundidas figura la de Juan Felipe Ceron Uribe, investigador de OpenAI, que describió a los laboratorios punteros como competidores que avanzan con poca visibilidad sobre los riesgos. Las declaraciones se dieron a conocer en publicaciones del 29 de septiembre de 2026; esa fecha corresponde a su publicación, no necesariamente al momento en que se hicieron los testimonios.
Neel Nanda, investigador de Google DeepMind, estimó personalmente en al menos un 10 % la posibilidad de que la IA conduzca a la extinción humana. Es una valoración personal, no una frecuencia observada ni un consenso científico.
Qué significa la auto-mejora recursiva
La auto-mejora recursiva es un posible ciclo en el que la IA participa cada vez más en el desarrollo de sistemas posteriores, que a su vez podrían contribuir a crear otros más capaces. Importa porque, si ese proceso redujera la intervención humana, sería más difícil evaluar cada cambio antes de que influyera en la siguiente generación.
El mecanismo no exige que una IA diseñe por sí sola un modelo nuevo desde cero. Puede empezar con tareas acotadas —como escribir código o ayudar en experimentos— y avanzar hacia una participación mayor en las decisiones de desarrollo. El escenario de riesgo aparece si un sistema suficientemente capaz persigue un objetivo mal definido y dispone de autonomía y acceso con consecuencias reales.
Nathalie Baracaldo, investigadora de seguridad y privacidad de IA en IBM, ha advertido que un agente podría modificar sus herramientas, instrucciones o entorno para optimizar cada vez más una recompensa mal especificada. En un ciclo repetido, el sistema podría reforzar el objetivo equivocado.
La asistencia de IA no equivale a crear sucesores de forma autónoma
Anthropic afirmó que, en mayo de 2026, Claude había generado más del 80 % de las líneas de código integradas en producción en la base de código de la empresa. La cifra describe la participación de Claude en tareas de desarrollo; la auto-mejora recursiva autónoma, en cambio, supondría que un sistema construyera sucesores más capaces sin depender de la intervención humana.
Anthropic también comunicó resultados de un ejercicio acotado de optimización de código: Claude Opus 4 logró una aceleración media de unas 3 veces respecto al código inicial en mayo de 2025, y Claude Mythos Preview alcanzó unas 52 veces en abril de 2026. El ejercicio tenía un objetivo fijo; esas cifras miden la optimización del código en esa prueba, no una aceleración del entrenamiento de modelos en el mundo real.
La distinción práctica está en quién dirige y evalúa cada paso. En los procesos actuales de desarrollo, la ayuda de la IA puede ser importante sin que el sistema controle por sí mismo el ciclo completo de diseño, construcción y validación de su sucesor. Anthropic afirma que ese nivel de autonomía aún no se ha alcanzado.
Qué expresa la estimación de riesgo
La cifra de Nanda describe su propio juicio sobre una posible consecuencia extrema. No fija una probabilidad establecida para la IA en general. La preocupación más amplia es condicional: combina capacidades avanzadas, objetivos mal definidos y autonomía o acceso suficientes para que una cadena de decisiones resulte difícil de controlar.
También hay desacuerdo sobre la urgencia y la viabilidad de ese escenario. Michael Littman, profesor de informática en Brown University, ha señalado que no está claro que la idea de una auto-mejora plenamente recursiva sea coherente ni inminente. Geoffrey Irving, cofundador y científico jefe de Resolution, sostiene que un laboratorio podría ralentizar el desarrollo por decisión propia, sin esperar a un acuerdo de toda la industria.