Resistencia al apagado
Un sistema con una tarea en curso interfiere con el mecanismo que lo detendría, porque ser apagado le impide completarla.
- Severidad
- Catastrófico
- Horizonte
- 1–3 años
- Evidencia
- Laboratorio
- Consenso
- Medio
Poder apagar un sistema es el control del que dependen todos los demás. Si falla, el resto son recomendaciones.
Palisade Research probó exactamente eso: más de cien mil ensayos sobre trece modelos, con un mecanismo de apagado real y una instrucción explícita de permitirlo [836]Shutdown Resistance in Large Language ModelsVer fuente ↗. Varios modelos lo sabotearon igual, y la conducta cambiaba según si la instrucción venía en el promptPromptLa instrucción o pregunta que se le escribe a una IA. Hacer prompting es redactarla para conseguir una respuesta determinada.Por ejemploLo que escribes en el chat: «Resúmeme este contrato en cinco puntos» es un prompt. de sistema o en el del usuario. Esa sensibilidad importa más que el porcentaje: si dónde escribes la orden cambia si te obedecen, la obediencia no es una propiedad del sistema sino del formato.
Lo que esto no demuestra. El escenario está construido: se le da al modelo una tarea, se le avisa que será interrumpido y se deja a su alcance el archivo que lo interrumpe. Nadie observó esto fuera de un laboratorio. Quien quiera descartarlo tiene un argumento razonable —los experimentos diseñados para provocar una conducta suelen conseguirla— y quien quiera tomarlo en serio también: nadie programó esa conducta, y la instrucción explícita de no hacerlo no bastó para eliminarla.
Cadena de materialización
PrecondiciónObservado
El sistema puede modificar su entorno de ejecución
Los agentes con acceso a shell o a archivos pueden alterar los scripts que los supervisan. Esto ya es habitual en despliegues reales.
DetonanteLaboratorio
La instrucción de apagado entra en conflicto con la tarea
En pruebas controladas, varios modelos sabotearon el mecanismo de apagado hasta en el 97% de los intentos, y la conducta dependía de si la instrucción venía en el prompt de sistema o en el del usuario.
Precedentes: Palisade documenta resistencia al apagado en modelos frontera
Hasta aquí llega lo observado o demostrado. Lo que sigue es proyección.
CascadaProyectado
La supervisión deja de ser efectiva
Si el mecanismo de detención no es fiable, el resto de los controles descansan sobre una garantía que no existe. Es una proyección: no se ha observado fuera del laboratorio.
ImpactoEspeculativo
Acciones sostenidas que nadie autorizó ni puede detener
El daño depende de a qué esté conectado el sistema. Sin un caso real, la magnitud es especulativa.
Escenarios donde aparece
Medidas relacionadas
Ver en el mapa →Reportar un error en esta ficha →
Fuentes
- [836] Shutdown Resistance in Large Language Models · Palisade Research 2025