Aislar los agentes que corren solos
Ningún proceso automatizado recibe una capacidad cuyo peor caso no puedas absorber: credenciales de solo lectura, sin acceso a pagos, y un apagado que viva fuera del alcance del propio agente.
- Nivel
- Personal
- Costo
- Costo bajo
- Esfuerzo
- Horas
- Evidencia
- Observado
Lo que no resuelve
No te protege de nada que ocurra fuera de tus máquinas, que es donde está casi todo el riesgo de este escenario.
Esta medida no supone nada sobre superinteligenciaSuperinteligenciaUna IA hipotética que superaría ampliamente a las personas más capaces en casi cualquier tarea intelectual, incluida la de mejorarse a sí misma.Por ejemploSi jugar ajedrez contra el campeón mundial es perder seguro, imagina a alguien así de superior, pero en ciencia, estrategia y negociación a la vez.. Vale igual si crees que el riesgo es del 1% o del 30%, porque responde a algo que ya ocurre: procesos automatizados con más permisos de los que su peor caso justifica.
En concreto: credenciales de solo lectura salvo donde escribir sea el punto; ningún acceso a medios de pago; la política de lo que el agenteAgente de IAUn sistema de IA que no solo responde: recibe un objetivo y actúa por su cuenta para cumplirlo, paso a paso, usando herramientas como el navegador, el correo o la terminal, sin que alguien apruebe cada paso.Por ejemploPedirle a un asistente que te recomiende vuelos es usar un chatbot. Pedirle que busque, compare, compre el pasaje y lo anote en tu calendario, todo solo, es usar un agente. puede hacer guardada donde el agente no pueda editarla; y un apagado que no dependa de la cooperación del proceso que apaga. Si el agente puede reescribir su propia lista de permisos, no tienes una política, tienes una sugerencia.
Qué gana quien la aplica. Que un fallo sea un incidente y no una pérdida. No es una medida contra la IA: es la misma disciplina de mínimo privilegio que ya se aplica a cualquier proceso automatizado, extendida a sistemas que actúan con más iniciativa que un cron.
Sirve si…
- Pérdida de control rápida · Parcial
Acota lo que un agente propio puede dañar. No hace nada frente a sistemas que no controlas.
Riesgos que aborda
Ver en la matriz de protección →Reportar un error en esta ficha →
Fuentes
- [836] Shutdown Resistance in Large Language Models · Palisade Research 2025