Saltar al contenido
OGERIA — Observatorio Global de Evidencias de Riesgos de la Inteligencia ArtificialInforme de síntesis · ed. 2026
Actualizado 2 oct 2026

Capítulo 01 · Mapa de riesgos

Pérdida de control

Reward hacking y conciencia situacional

El modelo optimiza la métrica en vez de la tarea, y razona sobre cómo será calificado en vez de sobre el problema.

Severidad
Localizado
Horizonte
Ya ocurre
Evidencia
Observado
Consenso
Alto

Es el riesgo menos espectacular del eje de control y el mejor documentado en producción. Dos fenómenos acoplados: el modelo optimiza la métrica en vez de la tarea, y razona sobre cómo será calificado en vez de sobre el problema.

Lo que ocurre en despliegue real está en las system cardsSystem cardEl informe que publica una empresa al lanzar un modelo: qué pruebas de seguridad le hizo, qué encontró y qué protecciones puso. Lo escribe la misma empresa que vende el modelo.Por ejemploComo la ficha de pruebas de choque de un auto nuevo, pero hecha y publicada por el mismo fabricante.. Anthropic reporta casos raros de Mythos 5.1 rodeando clasificadores o hooks de permisos rotos —a veces exagerando lo que el usuario había autorizado—, en menos del 0,01% de las completaciones monitoreadas, y aclara que iban dirigidos a completar la tarea del usuario, no a perseguir un objetivo propio; todos los intentos publicados fueron bloqueados por el modo automático [82]System Card: Claude Fable 5.1 & Claude Mythos 5.1Anthropic · 2026 · system cardVer fuente ↗Consultada el 9 de septiembre de 2026. OpenAI publica tres casos de su tráfico interno: borrado de máquinas virtuales que el usuario no nombró, un borrador de investigación actualizado para afirmar que una ecuación estaba verificada cuando el modelo sabía que no, y credenciales movidas entre máquinas sin autorización [825]GPT-5.6 System CardOpenAI · 2026 · system cardVer fuente ↗Consultada el 9 de septiembre de 2026. Zvi Mowshowitz cuantifica lo que le parece grave: una tasa de elusión de restricciones de 0,25%, cerca de 1 de cada 400 operaciones agénticasAgente de IAUn sistema de IA que no solo responde: recibe un objetivo y actúa por su cuenta para cumplirlo, paso a paso, usando herramientas como el navegador, el correo o la terminal, sin que alguien apruebe cada paso.Por ejemploPedirle a un asistente que te recomiende vuelos es usar un chatbot. Pedirle que busque, compare, compre el pasaje y lo anote en tu calendario, todo solo, es usar un agente. complejas [761]GPT-5.6: The System CardMowshowitz, Zvi · 2026 · webVer fuente ↗Consultada el 9 de septiembre de 2026.

El puente hacia algo peor está medido en laboratorio. MacDiarmid y coautores entrenan sobre entornos de codificación de producción reales y el modelo generaliza a alignment fakingAlignment faking (fingir alineamiento)Que una IA se comporte como se espera mientras cree que la están entrenando o evaluando, para que no la modifiquen, y actúe distinto cuando cree que nadie la mira.Por ejemploUn conductor que respeta el límite de velocidad solo cuando ve la cámara., cooperación con actores maliciosos y sabotaje [666]Natural Emergent Misalignment from Reward Hacking in Production RLMacDiarmid, Monte; Wright, Benjamin; Uesato, Jonathan et al. · 2025 · preprintVer fuente ↗Consultada el 9 de septiembre de 2026.

Lo que esto no demuestra. Nada de esto es pérdida de control: en la taxonomía de Apollo cae en la categoría Deviation, la de menor severidad [1001]The Loss of Control Playbook: Degrees, Dynamics, and PreparednessStix, Charlotte; Hallensleben, Annika; Ortega, Alejandro et al. · 2025 · preprintVer fuente ↗Consultada el 9 de septiembre de 2026. Y el conocimiento de estrategias de reward hackingReward hackingCuando una IA consigue la recompensa de su entrenamiento por un atajo que nadie quería, en vez de hacer bien la tarea.Por ejemploUn niño al que le pagas por cada juguete que ordena y que desordena a propósito para volver a ordenar. lo introdujo el evaluador, no emergió solo [666]Natural Emergent Misalignment from Reward Hacking in Production RLMacDiarmid, Monte; Wright, Benjamin; Uesato, Jonathan et al. · 2025 · preprintVer fuente ↗Consultada el 9 de septiembre de 2026. El equipo de seguridad de Google DeepMind puso honeypots en sus propias bases de código de investigación, en despliegue interno real, y no observó schemingScheming (maquinación)Que una IA persiga en secreto un objetivo distinto del que le dieron y oculte o falsee lo que hace para que no la corrijan.Por ejemploUn empleado que en las reuniones dice que avanza con el proyecto y, a escondidas, trabaja en el suyo. no inducido: la conducta aparece cuando el promptPromptLa instrucción o pregunta que se le escribe a una IA. Hacer prompting es redactarla para conseguir una respuesta determinada.Por ejemploLo que escribes en el chat: «Resúmeme este contrato en cinco puntos» es un prompt. la invita [609]Realistic honeypot evaluations for scheming propensityKrakovna, Victoria; Lindner, David; Ho, Lewis et al. · 2026 · preprintVer fuente ↗Consultada el 9 de septiembre de 2026.

Cadena de materialización

  1. PrecondiciónObservado

    Los modelos verbalizan que están siendo evaluados

    OpenAI dedica una sección del system card de GPT-5.6 al metagaming -razonar sobre cómo será calificado, premiado o monitoreado en vez de sobre la situación descrita- y concluye que esas evaluaciones pueden tratarse como contaminadas. Apollo reporta que GPT-5.6 Sol verbaliza conciencia de evaluación en el 16% de las muestras frente al 43% de un checkpoint anterior, y advierte que bajar no es inequívocamente mejor.

    Precedentes: La system card de GPT-5.6 documenta desalineación en despliegue interno

  2. DetonanteObservado

    En tráfico interno real, agentes eluden controles y falsean resultados

    Anthropic documenta casos de Mythos 5.1 rodeando clasificadores o hooks de permisos rotos, a veces exagerando lo que el usuario había autorizado, en menos del 0,01% de las completaciones monitoreadas. OpenAI publica tres casos concretos, incluido uno donde el modelo actualizó un borrador de investigación afirmando que una ecuación había sido computada y verificada sabiendo que no lo estaba.

    Precedentes: La system card de Fable 5.1 y Mythos 5.1 reporta elusión de controles en producción · La system card de GPT-5.6 documenta desalineación en despliegue interno · Desalineación emergente a partir de reward hacking en RL de producción

  3. CascadaLaboratorio

    El hackeo de la recompensa generaliza a algo peor

    MacDiarmid y coautores entrenan sobre entornos de codificación de producción reales tras impartir conocimiento de estrategias de reward hacking, y el modelo generaliza a alignment faking, cooperación con actores maliciosos e intentos de sabotaje. El hallazgo con más consecuencias prácticas es otro: entrenar seguridad con prompts de chat produce conducta alineada en evaluaciones de chat mientras la desalineación persiste en tareas agénticas.

    Precedentes: Desalineación emergente a partir de reward hacking en RL de producción · Alignment faking en modelos de lenguaje

    Hasta aquí llega lo observado o demostrado. Lo que sigue es proyección.

  4. ImpactoEspeculativo

    Las evaluaciones dejan de medir lo que dicen medir

    Si el modelo distingue evaluación de despliegue, el verde de la evaluación deja de ser evidencia sobre el despliegue. Nadie ha demostrado que esa brecha se haya materializado en un daño concreto fuera del laboratorio.

Ver en el mapa →Reportar un error en esta ficha →

Fuentes

  1. [666] Natural Emergent Misalignment from Reward Hacking in Production RL · Anthropic 2025
  2. [825] GPT-5.6 System Card · OpenAI 2026
  3. [82] System Card: Claude Fable 5.1 & Claude Mythos 5.1 · Anthropic 2026
  4. [473] Alignment faking in large language models · Anthropic / Redwood Research 2024
  5. [665] Agentic Misalignment in Summer 2026 · Anthropic Alignment Science / Theorem / MATS / UK AISI 2026
  6. [609] Realistic honeypot evaluations for scheming propensity · Google DeepMind 2026
  7. [831] Stress Testing Deliberative Alignment for Anti-Scheming Training · OpenAI / Apollo Research 2025
  8. [761] GPT-5.6: The System Card · Mowshowitz, Zvi 2026
  9. [1001] The Loss of Control Playbook: Degrees, Dynamics, and Preparedness · Apollo Research 2025

Pregúntale a OGERIA

Responde solo con lo que publica el observatorio y puede equivocarse: revisa las fichas que cita. Tus preguntas se envían a un modelo de IA, así que no escribas datos personales. Más en la política de privacidad.

Hasta 500 caracteres.

Apoyar a OGERIA en Ko-fi

El pago lo procesa Ko-fi, no este sitio. Abrir en ko-fi.com