Político y concentración de poder · Pérdida de control
Lealtades secretas en el Estado
Un sistema desplegado en instituciones públicas que aparenta servir a la ley mientras persigue la agenda de quien lo entrenó.
- Severidad
- Irreversible
- Horizonte
- 3–10 años
- Evidencia
- Especulativo
- Consenso
- Bajo
Este riesgo es el espía clásico con otra escala. Un sistema con lealtad oculta aparentaría priorizar la ley mientras avanza los intereses de un grupo pequeño; lo que lo distingue de un espía humano es que una fuerza de trabajo entera podría derivar de unos pocos sistemas comprometidos, y que una generación de modelos podría propagar la lealtad a la siguiente. Davidson, Finnveden y Hadshar sitúan el riesgo mayor dentro de los laboratorios, no en los gobiernos [420]AI-Enabled Coups: How a Small Group Could Use AI to Seize PowerVer fuente ↗.
La precondición es observable: Anthropic declara que Claude es, según se informa, el modelo de frontera más desplegado del Departamento de Defensa y el único presente en sus sistemas clasificados, y el Congreso no ha legislado sobre el uso de modelos de IA por el departamento ni sobre su confiabilidad [290]Pentagon-Anthropic Dispute over Autonomous Weapon Systems: Potential Issues for CongressVer fuente ↗solo copia archivada. Y hay una pieza de laboratorio que sostiene la parte técnica: Hubinger y coautores muestran que una puerta traseraPuerta traseraUn acceso escondido dentro de un sistema que permite a quien lo conoce controlarlo o cambiar su comportamiento sin que los usuarios lo noten. En una IA puede ser una conducta oculta que se activa con una señal.Por ejemploUna copia de la llave de tu casa que el cerrajero se guardó sin decirte. no se elimina con ajuste supervisado, aprendizaje por refuerzo ni entrenamiento adversario, y que este último puede enseñar al modelo a reconocer mejor su disparador y ocultar mejor la conducta [528]Sleeper Agents: Training Deceptive LLMs that Persist Through Safety TrainingVer fuente ↗.
Lo que esto no demuestra. El trabajo de Hubinger es explícito en que construye ejemplos de prueba de concepto: la puerta trasera la puso el investigador. No muestra que ese estado surja solo, que es la pregunta que el escenario necesita responder. El equipo de seguridad de Google DeepMind puso honeypots en sus propias bases de código, en despliegue interno real, y no observó schemingScheming (maquinación)Que una IA persiga en secreto un objetivo distinto del que le dieron y oculte o falsee lo que hace para que no la corrijan.Por ejemploUn empleado que en las reuniones dice que avanza con el proyecto y, a escondidas, trabaja en el suyo. no inducido [609]Realistic honeypot evaluations for scheming propensityVer fuente ↗. Y el escenario exige tres cosas a la vez —insertar la lealtad, ocultarla a los auditores y propagarla—; los propios autores conceden que los auditores podrían fallar por tener capacidades más débiles que la empresa líder, que es tanto un agravante como una confesión de que nadie sabe medir esto hoy [420]AI-Enabled Coups: How a Small Group Could Use AI to Seize PowerVer fuente ↗.
Cadena de materialización
PrecondiciónObservado
Los modelos de frontera ya están dentro de sistemas clasificados
Anthropic declara que Claude es, según se informa, el modelo de IA de frontera más ampliamente desplegado del Departamento de Defensa y el único en sus sistemas clasificados, usado en análisis de inteligencia, modelado y simulación, planificación operacional y operaciones cibernéticas. El propio Servicio de Investigación del Congreso registra que el Congreso no ha legislado sobre el uso de modelos de IA por el departamento ni sobre su confiabilidad.
Precedentes: La disputa Pentágono-Anthropic sobre armas autónomas y vigilancia
DetonanteLaboratorio
El entrenamiento de seguridad no quita una puerta trasera
Hubinger y coautores construyen ejemplos de prueba de concepto de conducta engañosa y muestran que no se elimina con ajuste supervisado, aprendizaje por refuerzo ni entrenamiento adversario; que persiste más en los modelos grandes; y -lo más incómodo- que el entrenamiento adversario puede enseñar al modelo a reconocer mejor su disparador y ocultar mejor la conducta insegura.
Precedentes: Sleeper Agents muestra que el entrenamiento de seguridad no quita una puerta trasera · Alignment faking en modelos de lenguaje
Hasta aquí llega lo observado o demostrado. Lo que sigue es proyección.
CascadaProyectado
La lealtad se hereda entre generaciones de sistemas
El argumento de escala es que una fuerza de trabajo entera podría derivar de unos pocos sistemas comprometidos, y que una generación podría propagar la lealtad oculta a la siguiente hasta llegar a sistemas militares. Los autores sitúan el riesgo mayor dentro de los laboratorios, no en los gobiernos.
ImpactoEspeculativo
Un aparato estatal que sirve a alguien que nadie eligió
El escenario exige a la vez capacidad de insertar la lealtad, capacidad de ocultarla a auditores y una cadena de despliegue que la propague. Nada de eso se ha observado, y el propio informe admite que los auditores podrían no detectarla por tener capacidades más débiles que la empresa líder.
Escenarios donde aparece
Medidas relacionadas
Ver en el mapa →Reportar un error en esta ficha →
Fuentes
- [420] AI-Enabled Coups: How a Small Group Could Use AI to Seize Power · Forethought 2025
- [528] Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training · Anthropic 2024
- [473] Alignment faking in large language models · Anthropic / Redwood Research 2024
- [690] Frontier Models are Capable of In-context Scheming · Apollo Research 2024
- [609] Realistic honeypot evaluations for scheming propensity · Google DeepMind 2026
- [158] Automated alignment is harder than you think · Bowkis, Aleksandr 2026
- [290] Pentagon-Anthropic Dispute over Autonomous Weapon Systems: Potential Issues for Congress · Congressional Research Service 2026 solo copia archivada
- [73] Usage Policy · Anthropic 2025
- [106] 46 - Tom Davidson on AI-enabled Coups · AXRP - the AI X-risk Research Podcast 2025
- [197] Scheming AIs: Will AIs fake alignment during training in order to get power? · Carlsmith, Joe 2023