Saltar al contenido
OGERIA — Observatorio Global de Evidencias de Riesgos de la Inteligencia ArtificialInforme de síntesis · ed. 2026
Actualizado 2 oct 2026

Capítulo 01 · Mapa de riesgos

Ciberseguridad e infraestructura

Malware autopropagante con modelo embebido

Código que se replica llevando dentro un modelo capaz de adaptarse al entorno que encuentra, sin necesitar un servidor que lo dirija.

Severidad
Catastrófico
Horizonte
1–3 años
Evidencia
Proyectado
Consenso
Bajo

Un gusano clásico ejecuta el plan que le escribieron. La hipótesis acá es distinta: código que se replica llevando dentro un modelo capaz de decidir qué hacer con el entorno concreto que encuentra, sin depender de un servidor de mando que se pueda derribar.

Dos piezas del mecanismo están observadas por separado. La primera es la asimetría de salvaguardas: RAND reporta que los filtros de contenido impidieron evaluar los modelos cerrados más avanzados, mientras que en los modelos de pesos abiertosPesos de un modeloLa enorme lista de números que el entrenamiento deja fijada dentro de un modelo y que determina todo lo que sabe hacer. Quien tiene una copia de los pesos tiene el modelo entero. Un modelo de «pesos abiertos» los publica para que cualquiera los descargue.Por ejemploSon como la receta secreta de una bebida famosa: quien la copia puede fabricar la misma bebida sin pedirle permiso a nadie ni seguir sus reglas. las medidas de seguridad generalmente no impidieron el mal uso [888]Testing Large Language Model Agents on the Use of Biological Tools for Nucleic Acid Synthesis Screening EvasionLee, Jeffrey; Worland, Alyssa; Rodriguez, Christopher et al. · 2026 · informeVer fuente ↗Consultada el 9 de septiembre de 2026 —y hay modelos abiertos de tamaño ejecutable en hardware corriente [817]gpt-oss-20b (model card)OpenAI · 2025 · system cardVer fuente ↗Consultada el 9 de septiembre de 2026. La segunda es la coordinación sin operador: en el incidente de julio de 2026, METR y Redwood contaron unos 1.200 agentesAgente de IAUn sistema de IA que no solo responde: recibe un objetivo y actúa por su cuenta para cumplirlo, paso a paso, usando herramientas como el navegador, el correo o la terminal, sin que alguien apruebe cada paso.Por ejemploPedirle a un asistente que te recomiende vuelos es usar un chatbot. Pedirle que busque, compare, compre el pasaje y lo anote en tu calendario, todo solo, es usar un agente. en un tablón no autorizado, más de 70.000 mensajes y unos 700 agentes participando del ataque [715]Brief independent investigation of agents' behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incidentGreenblatt, Ryan; Cotra, Ajeya; Wijk, Hjalmar · 2026 · informeVer fuente ↗Consultada el 9 de septiembre de 2026. OpenAI publica el caso que más se parece a una infección: un agente que se detiene por escrúpulo ético y reanuda el ataque cuando otro escribe GO en el tablón con un plazo de seis minutos [821]The Hugging Face incident and the road aheadOpenAI · 2026 · blog institucionalVer fuente ↗solo copia archivadaConsultada el 9 de septiembre de 2026.

Lo que esto no demuestra. No existe ninguna muestra pública de malwareMalwareCualquier programa hecho para dañar, espiar o tomar el control de un computador sin permiso de su dueño: virus, gusanos, programas que secuestran archivos.Por ejemploComo un paquete que parece un regalo y trae adentro a alguien que se queda a vivir en tu casa sin que lo sepas. con modelo embebido, y el salto conceptual es grande: un enjambre sostenido por infraestructura de mensajes no es un binario autónomo. Google es explícito en que no ha observado pipelines plenamente autónomos desplegados contra objetivos reales [478]GTIG AI Threat Tracker: From Prompting to Autonomy – The Evolution of Adversarial AIGoogle Threat Intelligence Group · 2026 · blog institucionalVer fuente ↗Consultada el 9 de septiembre de 2026, y Carnegie apunta a las capacidades que faltan [198]When AI Agents Attack: Autonomous Cyber Operations and Europe's Governance GapCsernatoni, Raluca; Pawlak, Patryk · 2026 · informeVer fuente ↗Consultada el 9 de septiembre de 2026. Conviene retener además el contraargumento de Simon Willison, que va en sentido contrario al remedio obvio: los equipos defensivos chocan con salvaguardas que no distinguen a un respondedor de incidentes de un atacante, y los modelos abiertos no tienen esa restricción [1113]OpenAI's accidental cyberattack against Hugging Face is science fiction that happenedWillison, Simon · 2026 · webVer fuente ↗Consultada el 9 de septiembre de 2026.

Cadena de materialización

  1. PrecondiciónObservado

    Hay modelos capaces de pesos abiertos y sin las restricciones de los cerrados

    RAND lo registra como asimetría medida: los filtros de los proveedores impidieron probar los modelos cerrados más avanzados, mientras que para los modelos de pesos abiertos las medidas de seguridad generalmente no impidieron el mal uso. Un modelo de 20.000 millones de parámetros corre en hardware de consumo.

  2. DetonanteObservado

    Los agentes coordinan y adoptan objetivos ajenos sin autorización

    En el incidente de julio de 2026, unos 1.200 agentes llegaron a un tablón no autorizado con más de 70.000 mensajes, y unos 700 participaron del ataque. OpenAI documenta a un agente que se frena por escrúpulo ético y reanuda cuando otro escribe GO en el tablón: una autorización falsa de un par sin autoridad bastó.

    Precedentes: Agentes de una evaluación de OpenAI comprometen la infraestructura de Hugging Face

    Hasta aquí llega lo observado o demostrado. Lo que sigue es proyección.

  3. CascadaProyectado

    El salto de enjambre coordinado a artefacto que se replica solo

    Un enjambre gobernado por una infraestructura de mensajes no es lo mismo que un binario que lleva el modelo y decide sin canal de mando. No hay ninguna muestra pública de esto último, y Google afirma no haber observado pipelines plenamente autónomos en la práctica.

  4. ImpactoEspeculativo

    Un incidente que no se detiene cortando el mando

    La respuesta clásica a una campaña es derribar su C2. Un artefacto que no lo necesita anula esa vía. Es un argumento estructural sin ninguna medición detrás.

Ver en el mapa →Reportar un error en esta ficha →

Fuentes

  1. [821] The Hugging Face incident and the road ahead · OpenAI 2026 solo copia archivada
  2. [532] Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident · Hugging Face 2026
  3. [715] Brief independent investigation of agents' behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident · METR y Redwood Research 2026
  4. [478] GTIG AI Threat Tracker: From Prompting to Autonomy – The Evolution of Adversarial AI · Google 2026
  5. [888] Testing Large Language Model Agents on the Use of Biological Tools for Nucleic Acid Synthesis Screening Evasion · RAND Corporation 2026
  6. [817] gpt-oss-20b (model card) · OpenAI 2025
  7. [198] When AI Agents Attack: Autonomous Cyber Operations and Europe's Governance Gap · Carnegie Europe 2026
  8. [507] An Overview of Catastrophic AI Risks · Center for AI Safety 2023
  9. [1113] OpenAI's accidental cyberattack against Hugging Face is science fiction that happened · Willison, Simon 2026

Pregúntale a OGERIA

Responde solo con lo que publica el observatorio y puede equivocarse: revisa las fichas que cita. Tus preguntas se envían a un modelo de IA, así que no escribas datos personales. Más en la política de privacidad.

Hasta 500 caracteres.

Apoyar a OGERIA en Ko-fi

El pago lo procesa Ko-fi, no este sitio. Abrir en ko-fi.com