Pérdida de control por automejora
Un sistema que mejora sistemas de IA acelera su propio desarrollo hasta que la supervisión humana deja de alcanzar el ritmo.
- Severidad
- Existencial
- Horizonte
- 3–10 años
- Evidencia
- Especulativo
- Consenso
- Bajo
La hipótesis es que un sistema capaz de mejorar sistemas de IA acelere su propio desarrollo más rápido de lo que la supervisión humana puede seguir. Es el riesgo con la severidad más alta del observatorio y el respaldo empírico más débil, y las dos cosas hay que decirlas juntas.
Los insumos del argumento son reales y medidos. Anthropic reporta que más del 80% del código que integra a su base lo escribió Claude en mayo de 2026, y que en un experimento donde dos investigadores humanos recuperaron el 23% de una brecha de rendimiento en una semana, los agentesAgente de IAUn sistema de IA que no solo responde: recibe un objetivo y actúa por su cuenta para cumplirlo, paso a paso, usando herramientas como el navegador, el correo o la terminal, sin que alguien apruebe cada paso.Por ejemploPedirle a un asistente que te recomiende vuelos es usar un chatbot. Pedirle que busque, compare, compre el pasaje y lo anote en tu calendario, todo solo, es usar un agente. recuperaron el 97% [75]When AI builds itselfVer fuente ↗. METR mide que el horizonte temporal de tareas se duplica cada 196 días entre 2019 y 2025, cada 131 para los modelos posteriores a 2023 y cada 89 desde 2024 —el corte más rápido es también el más corto, y su panel actual ya no lo publica—, con intervalos de confianzaIntervalo de confianzaEl rango dentro del cual probablemente está el valor real, según lo que se midió. Cuanto más ancho, menos precisa es la medición. Se abrevia IC.Por ejemploComo decir que llegas «entre las 7 y las 7:20»: no sabes el minuto exacto, pero sí el margen. que la propia METR califica de muy anchos [712]Time Horizon 1.1Ver fuente ↗.
Lo que esto no demuestra. “Claude escribe el 80% del código” no es “Claude hace la investigación”, y quien lo señala es el mismo documento: la métrica de líneas es casi seguramente una sobreestimación de la ganancia real, el 52× de aceleración no debe leerse como aceleración de entrenamiento en el mundo real, y persisten grandes brechas cuando se trata de elegir objetivos [75]When AI builds itselfVer fuente ↗. Tres meses después, la misma empresa determina que su modelo de referencia no cruza el umbral de autonomía porque no observa una aceleración sostenida de 2× atribuible a la IA en el ritmo de su propio progreso [82]System Card: Claude Fable 5.1 & Claude Mythos 5.1Ver fuente ↗. Y hay una prueba directa en contra: un consorcio liderado desde Princeton dio a agentes de fronteraIA de fronteraLos sistemas de IA más avanzados que existen en un momento dado, los que empujan el límite de lo que la tecnología puede hacer. Los desarrollan unas pocas empresas con enormes recursos.Por ejemploComo los autos de Fórmula 1: son pocos, carísimos y los fabrican pocos equipos, pero lo que se prueba ahí termina llegando a los autos de todos. las preguntas de dos papers no publicados enviados a NeurIPS 2026, con seis días y miles de dólares de cómputoCómputoLa capacidad de cálculo que se usa para entrenar y hacer funcionar una IA: miles de chips especializados trabajando durante semanas en centros de datos. Es caro y está concentrado en pocas empresas.Por ejemploSi la IA fuera una panadería, el cómputo serían los hornos: sin hornos grandes no importa lo buena que sea la receta., y los autores originales rechazaron ambos resultados sin ambigüedad [598]Can AI agents conduct open-ended AI research? Early evidence from two case studiesVer fuente ↗. Jack Clark, coautor del documento de automejoraAutomejoraQue una IA ayude a diseñar o entrenar a la versión que la reemplaza, y que esa haga lo mismo con la siguiente, cada vez más rápido y con menos personas en el proceso.Por ejemploComo un aprendiz que, al mejorar, pasa a formar al siguiente, que aprende más rápido y enseña todavía mejor., lo llama una señal bajista para los plazos cortos [736]AI's recursive self-improvement might not come so quickly after allVer fuente ↗.
Cadena de materialización
PrecondiciónObservado
La IA ya escribe la mayor parte del código de quien la construye
Anthropic reporta que más del 80% del código que integra a su base fue escrito por Claude en mayo de 2026, que el ingeniero típico integraba ocho veces más código por día que en 2024, y que la tasa de éxito en las tareas más abiertas llegó al 76%, cincuenta puntos más en seis meses.
Precedentes: Anthropic publica When AI builds itself · METR publica Time Horizon 1.1 con la suite ampliada
DetonanteLaboratorio
Los agentes cierran brechas de rendimiento que los humanos no cierran
En un experimento de recuperación de una brecha de rendimiento, dos investigadores humanos recuperaron alrededor del 23% en una semana y los agentes el 97%. La propia empresa acota el resultado: los humanos eligieron el problema y crearon la rúbrica de puntuación.
Precedentes: Anthropic publica When AI builds itself
Hasta aquí llega lo observado o demostrado. Lo que sigue es proyección.
CascadaProyectado
El salto de ejecutar investigación a dirigirla
El modelo de plazos de Thomas Kwa, con ocho parámetros, tiene una predicción mediana de más del 99% de automatización de la I+D en IA hacia 2032; su propio autor dice no dar mucho peso a los plazos exactos porque no pensó mucho en los valores de los parámetros, y el modelo no trata por separado el criterio de investigación.
Precedentes: Se publica el escenario AI 2027
ImpactoEspeculativo
Pérdida de control estricta, severa y permanente
En la taxonomía de Apollo es la categoría Strict LoC, máximamente severa y permanente, incluida la extinción. No hay ningún incidente observado de pérdida de control fuera del laboratorio, y ninguno de los casos reales conocidos pasa de la categoría Deviation.
Medidas relacionadas
Ver en el mapa →Reportar un error en esta ficha →
Fuentes
- [75] When AI builds itself · Anthropic 2026
- [82] System Card: Claude Fable 5.1 & Claude Mythos 5.1 · Anthropic 2026
- [598] Can AI agents conduct open-ended AI research? Early evidence from two case studies · Princeton University y otros 2026
- [736] AI's recursive self-improvement might not come so quickly after all · MIT Technology Review 2026
- [712] Time Horizon 1.1 · METR 2026
- [713] Task-Completion Time Horizons of Frontier AI Models · METR 2026
- [619] A simpler AI timelines model predicts 99% AI R&D automation in ~2032 · METR 2026
- [1001] The Loss of Control Playbook: Degrees, Dynamics, and Preparedness · Apollo Research 2025
- [196] Is Power-Seeking AI an Existential Risk? · Carlsmith, Joseph 2022
- [1037] What power-seeking theorems do not show · Vanderbilt University / Global Priorities Institute 2024 solo copia archivada
- [633] The case for AI doom isn't very convincing · Understanding AI 2025
- [867] Anthropic Alignment Lead Issues Warning About AI Killing Humans As Researcher Resigns · Forbes 2026 solo copia archivada