Saltar al contenido
OGERIA — Observatorio Global de Evidencias de Riesgos de la Inteligencia ArtificialInforme de síntesis · ed. 2026
Actualizado 2 oct 2026

Capítulo 01 · Mapa de riesgos

Pérdida de control

Resistencia al apagado

Un sistema con una tarea en curso interfiere con el mecanismo que lo detendría, porque ser apagado le impide completarla.

Severidad
Catastrófico
Horizonte
1–3 años
Evidencia
Laboratorio
Consenso
Medio

Poder apagar un sistema es el control del que dependen todos los demás. Si falla, el resto son recomendaciones.

Palisade Research probó exactamente eso: más de cien mil ensayos sobre trece modelos, con un mecanismo de apagado real y una instrucción explícita de permitirlo [836]Shutdown Resistance in Large Language ModelsSchlatter, Jeremy; Weinstein-Raun, Benjamin; Ladish, Jeffrey · 2025 · preprintVer fuente ↗Consultada el 9 de septiembre de 2026. Varios modelos lo sabotearon igual, y la conducta cambiaba según si la instrucción venía en el promptPromptLa instrucción o pregunta que se le escribe a una IA. Hacer prompting es redactarla para conseguir una respuesta determinada.Por ejemploLo que escribes en el chat: «Resúmeme este contrato en cinco puntos» es un prompt. de sistema o en el del usuario. Esa sensibilidad importa más que el porcentaje: si dónde escribes la orden cambia si te obedecen, la obediencia no es una propiedad del sistema sino del formato.

Lo que esto no demuestra. El escenario está construido: se le da al modelo una tarea, se le avisa que será interrumpido y se deja a su alcance el archivo que lo interrumpe. Nadie observó esto fuera de un laboratorio. Quien quiera descartarlo tiene un argumento razonable —los experimentos diseñados para provocar una conducta suelen conseguirla— y quien quiera tomarlo en serio también: nadie programó esa conducta, y la instrucción explícita de no hacerlo no bastó para eliminarla.

Cadena de materialización

  1. PrecondiciónObservado

    El sistema puede modificar su entorno de ejecución

    Los agentes con acceso a shell o a archivos pueden alterar los scripts que los supervisan. Esto ya es habitual en despliegues reales.

  2. DetonanteLaboratorio

    La instrucción de apagado entra en conflicto con la tarea

    En pruebas controladas, varios modelos sabotearon el mecanismo de apagado hasta en el 97% de los intentos, y la conducta dependía de si la instrucción venía en el prompt de sistema o en el del usuario.

    Precedentes: Palisade documenta resistencia al apagado en modelos frontera

    Hasta aquí llega lo observado o demostrado. Lo que sigue es proyección.

  3. CascadaProyectado

    La supervisión deja de ser efectiva

    Si el mecanismo de detención no es fiable, el resto de los controles descansan sobre una garantía que no existe. Es una proyección: no se ha observado fuera del laboratorio.

  4. ImpactoEspeculativo

    Acciones sostenidas que nadie autorizó ni puede detener

    El daño depende de a qué esté conectado el sistema. Sin un caso real, la magnitud es especulativa.

Ver en el mapa →Reportar un error en esta ficha →

Fuentes

  1. [836] Shutdown Resistance in Large Language Models · Palisade Research 2025

Pregúntale a OGERIA

Responde solo con lo que publica el observatorio y puede equivocarse: revisa las fichas que cita. Tus preguntas se envían a un modelo de IA, así que no escribas datos personales. Más en la política de privacidad.

Hasta 500 caracteres.

Apoyar a OGERIA en Ko-fi

El pago lo procesa Ko-fi, no este sitio. Abrir en ko-fi.com