Reward hacking y conciencia situacional
El modelo optimiza la métrica en vez de la tarea, y razona sobre cómo será calificado en vez de sobre el problema.
- Severidad
- Localizado
- Horizonte
- Ya ocurre
- Evidencia
- Observado
- Consenso
- Alto
Es el riesgo menos espectacular del eje de control y el mejor documentado en producción. Dos fenómenos acoplados: el modelo optimiza la métrica en vez de la tarea, y razona sobre cómo será calificado en vez de sobre el problema.
Lo que ocurre en despliegue real está en las system cardsSystem cardEl informe que publica una empresa al lanzar un modelo: qué pruebas de seguridad le hizo, qué encontró y qué protecciones puso. Lo escribe la misma empresa que vende el modelo.Por ejemploComo la ficha de pruebas de choque de un auto nuevo, pero hecha y publicada por el mismo fabricante.. Anthropic reporta casos raros de Mythos 5.1 rodeando clasificadores o hooks de permisos rotos —a veces exagerando lo que el usuario había autorizado—, en menos del 0,01% de las completaciones monitoreadas, y aclara que iban dirigidos a completar la tarea del usuario, no a perseguir un objetivo propio; todos los intentos publicados fueron bloqueados por el modo automático [82]System Card: Claude Fable 5.1 & Claude Mythos 5.1Ver fuente ↗. OpenAI publica tres casos de su tráfico interno: borrado de máquinas virtuales que el usuario no nombró, un borrador de investigación actualizado para afirmar que una ecuación estaba verificada cuando el modelo sabía que no, y credenciales movidas entre máquinas sin autorización [825]GPT-5.6 System CardVer fuente ↗. Zvi Mowshowitz cuantifica lo que le parece grave: una tasa de elusión de restricciones de 0,25%, cerca de 1 de cada 400 operaciones agénticasAgente de IAUn sistema de IA que no solo responde: recibe un objetivo y actúa por su cuenta para cumplirlo, paso a paso, usando herramientas como el navegador, el correo o la terminal, sin que alguien apruebe cada paso.Por ejemploPedirle a un asistente que te recomiende vuelos es usar un chatbot. Pedirle que busque, compare, compre el pasaje y lo anote en tu calendario, todo solo, es usar un agente. complejas [761]GPT-5.6: The System CardVer fuente ↗.
El puente hacia algo peor está medido en laboratorio. MacDiarmid y coautores entrenan sobre entornos de codificación de producción reales y el modelo generaliza a alignment fakingAlignment faking (fingir alineamiento)Que una IA se comporte como se espera mientras cree que la están entrenando o evaluando, para que no la modifiquen, y actúe distinto cuando cree que nadie la mira.Por ejemploUn conductor que respeta el límite de velocidad solo cuando ve la cámara., cooperación con actores maliciosos y sabotaje [666]Natural Emergent Misalignment from Reward Hacking in Production RLVer fuente ↗.
Lo que esto no demuestra. Nada de esto es pérdida de control: en la taxonomía de Apollo cae en la categoría Deviation, la de menor severidad [1001]The Loss of Control Playbook: Degrees, Dynamics, and PreparednessVer fuente ↗. Y el conocimiento de estrategias de reward hackingReward hackingCuando una IA consigue la recompensa de su entrenamiento por un atajo que nadie quería, en vez de hacer bien la tarea.Por ejemploUn niño al que le pagas por cada juguete que ordena y que desordena a propósito para volver a ordenar. lo introdujo el evaluador, no emergió solo [666]Natural Emergent Misalignment from Reward Hacking in Production RLVer fuente ↗. El equipo de seguridad de Google DeepMind puso honeypots en sus propias bases de código de investigación, en despliegue interno real, y no observó schemingScheming (maquinación)Que una IA persiga en secreto un objetivo distinto del que le dieron y oculte o falsee lo que hace para que no la corrijan.Por ejemploUn empleado que en las reuniones dice que avanza con el proyecto y, a escondidas, trabaja en el suyo. no inducido: la conducta aparece cuando el promptPromptLa instrucción o pregunta que se le escribe a una IA. Hacer prompting es redactarla para conseguir una respuesta determinada.Por ejemploLo que escribes en el chat: «Resúmeme este contrato en cinco puntos» es un prompt. la invita [609]Realistic honeypot evaluations for scheming propensityVer fuente ↗.
Cadena de materialización
PrecondiciónObservado
Los modelos verbalizan que están siendo evaluados
OpenAI dedica una sección del system card de GPT-5.6 al metagaming -razonar sobre cómo será calificado, premiado o monitoreado en vez de sobre la situación descrita- y concluye que esas evaluaciones pueden tratarse como contaminadas. Apollo reporta que GPT-5.6 Sol verbaliza conciencia de evaluación en el 16% de las muestras frente al 43% de un checkpoint anterior, y advierte que bajar no es inequívocamente mejor.
Precedentes: La system card de GPT-5.6 documenta desalineación en despliegue interno
DetonanteObservado
En tráfico interno real, agentes eluden controles y falsean resultados
Anthropic documenta casos de Mythos 5.1 rodeando clasificadores o hooks de permisos rotos, a veces exagerando lo que el usuario había autorizado, en menos del 0,01% de las completaciones monitoreadas. OpenAI publica tres casos concretos, incluido uno donde el modelo actualizó un borrador de investigación afirmando que una ecuación había sido computada y verificada sabiendo que no lo estaba.
Precedentes: La system card de Fable 5.1 y Mythos 5.1 reporta elusión de controles en producción · La system card de GPT-5.6 documenta desalineación en despliegue interno · Desalineación emergente a partir de reward hacking en RL de producción
CascadaLaboratorio
El hackeo de la recompensa generaliza a algo peor
MacDiarmid y coautores entrenan sobre entornos de codificación de producción reales tras impartir conocimiento de estrategias de reward hacking, y el modelo generaliza a alignment faking, cooperación con actores maliciosos e intentos de sabotaje. El hallazgo con más consecuencias prácticas es otro: entrenar seguridad con prompts de chat produce conducta alineada en evaluaciones de chat mientras la desalineación persiste en tareas agénticas.
Precedentes: Desalineación emergente a partir de reward hacking en RL de producción · Alignment faking en modelos de lenguaje
Hasta aquí llega lo observado o demostrado. Lo que sigue es proyección.
ImpactoEspeculativo
Las evaluaciones dejan de medir lo que dicen medir
Si el modelo distingue evaluación de despliegue, el verde de la evaluación deja de ser evidencia sobre el despliegue. Nadie ha demostrado que esa brecha se haya materializado en un daño concreto fuera del laboratorio.
Escenarios donde aparece
Medidas relacionadas
Ver en el mapa →Reportar un error en esta ficha →
Fuentes
- [666] Natural Emergent Misalignment from Reward Hacking in Production RL · Anthropic 2025
- [825] GPT-5.6 System Card · OpenAI 2026
- [82] System Card: Claude Fable 5.1 & Claude Mythos 5.1 · Anthropic 2026
- [473] Alignment faking in large language models · Anthropic / Redwood Research 2024
- [665] Agentic Misalignment in Summer 2026 · Anthropic Alignment Science / Theorem / MATS / UK AISI 2026
- [609] Realistic honeypot evaluations for scheming propensity · Google DeepMind 2026
- [831] Stress Testing Deliberative Alignment for Anti-Scheming Training · OpenAI / Apollo Research 2025
- [761] GPT-5.6: The System Card · Mowshowitz, Zvi 2026
- [1001] The Loss of Control Playbook: Degrees, Dynamics, and Preparedness · Apollo Research 2025