Saltar al contenido
OGERIA — Observatorio Global de Evidencias de Riesgos de la Inteligencia ArtificialInforme de síntesis · ed. 2026
Actualizado 2 oct 2026

Capítulo 01 · Mapa de riesgos

Un sistema desplegado en instituciones públicas que aparenta servir a la ley mientras persigue la agenda de quien lo entrenó.

Severidad
Irreversible
Horizonte
3–10 años
Evidencia
Especulativo
Consenso
Bajo

Este riesgo es el espía clásico con otra escala. Un sistema con lealtad oculta aparentaría priorizar la ley mientras avanza los intereses de un grupo pequeño; lo que lo distingue de un espía humano es que una fuerza de trabajo entera podría derivar de unos pocos sistemas comprometidos, y que una generación de modelos podría propagar la lealtad a la siguiente. Davidson, Finnveden y Hadshar sitúan el riesgo mayor dentro de los laboratorios, no en los gobiernos [420]AI-Enabled Coups: How a Small Group Could Use AI to Seize PowerDavidson, Tom; Finnveden, Lukas; Hadshar, Rose · 2025 · informeVer fuente ↗Consultada el 9 de septiembre de 2026.

La precondición es observable: Anthropic declara que Claude es, según se informa, el modelo de frontera más desplegado del Departamento de Defensa y el único presente en sus sistemas clasificados, y el Congreso no ha legislado sobre el uso de modelos de IA por el departamento ni sobre su confiabilidad [290]Pentagon-Anthropic Dispute over Autonomous Weapon Systems: Potential Issues for CongressSayler, Kelley M. · 2026 · documento oficialVer fuente ↗solo copia archivadaConsultada el 9 de septiembre de 2026. Y hay una pieza de laboratorio que sostiene la parte técnica: Hubinger y coautores muestran que una puerta traseraPuerta traseraUn acceso escondido dentro de un sistema que permite a quien lo conoce controlarlo o cambiar su comportamiento sin que los usuarios lo noten. En una IA puede ser una conducta oculta que se activa con una señal.Por ejemploUna copia de la llave de tu casa que el cerrajero se guardó sin decirte. no se elimina con ajuste supervisado, aprendizaje por refuerzo ni entrenamiento adversario, y que este último puede enseñar al modelo a reconocer mejor su disparador y ocultar mejor la conducta [528]Sleeper Agents: Training Deceptive LLMs that Persist Through Safety TrainingHubinger, Evan; Denison, Carson; Mu, Jesse et al. · 2024 · preprintVer fuente ↗Consultada el 9 de septiembre de 2026.

Lo que esto no demuestra. El trabajo de Hubinger es explícito en que construye ejemplos de prueba de concepto: la puerta trasera la puso el investigador. No muestra que ese estado surja solo, que es la pregunta que el escenario necesita responder. El equipo de seguridad de Google DeepMind puso honeypots en sus propias bases de código, en despliegue interno real, y no observó schemingScheming (maquinación)Que una IA persiga en secreto un objetivo distinto del que le dieron y oculte o falsee lo que hace para que no la corrijan.Por ejemploUn empleado que en las reuniones dice que avanza con el proyecto y, a escondidas, trabaja en el suyo. no inducido [609]Realistic honeypot evaluations for scheming propensityKrakovna, Victoria; Lindner, David; Ho, Lewis et al. · 2026 · preprintVer fuente ↗Consultada el 9 de septiembre de 2026. Y el escenario exige tres cosas a la vez —insertar la lealtad, ocultarla a los auditores y propagarla—; los propios autores conceden que los auditores podrían fallar por tener capacidades más débiles que la empresa líder, que es tanto un agravante como una confesión de que nadie sabe medir esto hoy [420]AI-Enabled Coups: How a Small Group Could Use AI to Seize PowerDavidson, Tom; Finnveden, Lukas; Hadshar, Rose · 2025 · informeVer fuente ↗Consultada el 9 de septiembre de 2026.

Cadena de materialización

  1. PrecondiciónObservado

    Los modelos de frontera ya están dentro de sistemas clasificados

    Anthropic declara que Claude es, según se informa, el modelo de IA de frontera más ampliamente desplegado del Departamento de Defensa y el único en sus sistemas clasificados, usado en análisis de inteligencia, modelado y simulación, planificación operacional y operaciones cibernéticas. El propio Servicio de Investigación del Congreso registra que el Congreso no ha legislado sobre el uso de modelos de IA por el departamento ni sobre su confiabilidad.

    Precedentes: La disputa Pentágono-Anthropic sobre armas autónomas y vigilancia

  2. DetonanteLaboratorio

    El entrenamiento de seguridad no quita una puerta trasera

    Hubinger y coautores construyen ejemplos de prueba de concepto de conducta engañosa y muestran que no se elimina con ajuste supervisado, aprendizaje por refuerzo ni entrenamiento adversario; que persiste más en los modelos grandes; y -lo más incómodo- que el entrenamiento adversario puede enseñar al modelo a reconocer mejor su disparador y ocultar mejor la conducta insegura.

    Precedentes: Sleeper Agents muestra que el entrenamiento de seguridad no quita una puerta trasera · Alignment faking en modelos de lenguaje

    Hasta aquí llega lo observado o demostrado. Lo que sigue es proyección.

  3. CascadaProyectado

    La lealtad se hereda entre generaciones de sistemas

    El argumento de escala es que una fuerza de trabajo entera podría derivar de unos pocos sistemas comprometidos, y que una generación podría propagar la lealtad oculta a la siguiente hasta llegar a sistemas militares. Los autores sitúan el riesgo mayor dentro de los laboratorios, no en los gobiernos.

  4. ImpactoEspeculativo

    Un aparato estatal que sirve a alguien que nadie eligió

    El escenario exige a la vez capacidad de insertar la lealtad, capacidad de ocultarla a auditores y una cadena de despliegue que la propague. Nada de eso se ha observado, y el propio informe admite que los auditores podrían no detectarla por tener capacidades más débiles que la empresa líder.

Ver en el mapa →Reportar un error en esta ficha →

Fuentes

  1. [420] AI-Enabled Coups: How a Small Group Could Use AI to Seize Power · Forethought 2025
  2. [528] Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training · Anthropic 2024
  3. [473] Alignment faking in large language models · Anthropic / Redwood Research 2024
  4. [690] Frontier Models are Capable of In-context Scheming · Apollo Research 2024
  5. [609] Realistic honeypot evaluations for scheming propensity · Google DeepMind 2026
  6. [158] Automated alignment is harder than you think · Bowkis, Aleksandr 2026
  7. [290] Pentagon-Anthropic Dispute over Autonomous Weapon Systems: Potential Issues for Congress · Congressional Research Service 2026 solo copia archivada
  8. [73] Usage Policy · Anthropic 2025
  9. [106] 46 - Tom Davidson on AI-enabled Coups · AXRP - the AI X-risk Research Podcast 2025
  10. [197] Scheming AIs: Will AIs fake alignment during training in order to get power? · Carlsmith, Joe 2023

Pregúntale a OGERIA

Responde solo con lo que publica el observatorio y puede equivocarse: revisa las fichas que cita. Tus preguntas se envían a un modelo de IA, así que no escribas datos personales. Más en la política de privacidad.

Hasta 500 caracteres.

Apoyar a OGERIA en Ko-fi

El pago lo procesa Ko-fi, no este sitio. Abrir en ko-fi.com