Contaminación del registro público
El material sintético entra al archivo común -web, enciclopedias, literatura- y deja de poder distinguirse del original.
- Severidad
- Grave
- Horizonte
- 1–3 años
- Evidencia
- Proyectado
- Consenso
- Medio
El daño no sería creer algo falso, sino perder el procedimiento con el que se comprobaba cualquier cosa. La única serie temporal con método público la produce Graphite —una empresa de SEO, es decir parte interesada—: sobre 55.400 URLs de Common Crawl y con tres detectores promediados, los artículos mayoritariamente generados por IA superaron a los escritos por humanos en el cuarto trimestre de 2025 con 50,9%, y volvieron a 49,9% en el primero de 2026 [472]AI Now Writes as Many Online Articles as Humans DoVer fuente ↗. “Alrededor de la mitad de los artículos nuevos indexables en inglés” es defendible; “la mitad de internet” no lo es.
La defensa que funcionó es instructiva. Wikipedia creó el criterio de borrado rápido WP:G15 para eliminar sin discusión páginas claramente generadas por un modelo sin revisión humana, y lo que sirvió como firma no fue un detector estadístico sino dos rastros conductuales: el residuo conversacional pegado en el texto y las referencias inventadas [1104]Wikipedia:WikiProject AI CleanupVer fuente ↗. La detección automática envejece rápido: un método con 99,8% de AUROC sobre deepfakesDeepfakeUn video, audio o imagen falso hecho con IA, que muestra a una persona real diciendo o haciendo algo que nunca pasó.Por ejemploUn audio con la voz de tu jefe pidiendo una transferencia urgente, que tu jefe nunca grabó. contemporáneos pierde más de 30% de recall frente a técnicas de seis meses después [912]Performance Decay in Deepfake Detection: The Limitations of Training on Outdated DataVer fuente ↗.
Lo que esto no demuestra. La medición hereda el error de la herramienta con que se mide: el propio Graphite corrigió a la baja unos 3,3 puntos porcentuales al pasar de un detector a tres [472]AI Now Writes as Many Online Articles as Humans DoVer fuente ↗, y la curva se aplanó desde 2024 en vez de dispararse. El resultado que se cita como mecanismo de colapso también tiene refutación: Shumailov y coautores muestran defectos irreversibles al entrenar recursivamente con datos sintéticos [967]AI models collapse when trained on recursively generated dataVer fuente ↗, pero eso depende de que los datos nuevos reemplacen a los viejos; al acumularlos —que es lo que hace la web— el colapso no ocurre [450]Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic DataVer fuente ↗. Y el análisis de seguridad más completo de C2PA concluye que sus especificaciones actuales no alcanzan sus propios objetivos declarados [459]Verifying Provenance of Digital Media: Why the C2PA Specifications Fall ShortVer fuente ↗.
Cadena de materialización
PrecondiciónObservado
Alrededor de la mitad de los artículos nuevos indexables ya son sintéticos
Con 55.400 URLs de Common Crawl y tres detectores promediados, los artículos mayoritariamente generados por IA superaron a los escritos por humanos en el cuarto trimestre de 2025 con 50,9%, y volvieron a 49,9% en el primero de 2026. La muestra son artículos en inglés con schema markup y al menos cien palabras: no es la mitad de internet.
DetonanteObservado
Las instituciones que curan el registro ya tuvieron que defenderse
Wikipedia creó un criterio de borrado rápido, WP:G15, que permite eliminar sin discusión páginas claramente generadas por un modelo sin revisión humana. Lo interesante es qué funcionó como firma: no un detector estadístico sino dos rastros conductuales -el residuo conversacional pegado en el texto y las referencias inventadas.
Hasta aquí llega lo observado o demostrado. Lo que sigue es proyección.
CascadaProyectado
La detección se degrada más rápido de lo que se reconstruye
Un método que alcanza más de 99,8% de AUROC sobre deepfakes contemporáneos pierde más de 30% de recall al evaluarse contra técnicas de generación de apenas seis meses después. Y un detector con 5% de falsos positivos aplicado a millones de piezas produce más acusaciones falsas que detecciones correctas cuando la prevalencia real es baja.
ImpactoEspeculativo
Un archivo común que ya no se puede auditar
El daño no sería creer algo falso sino perder el procedimiento con el que se comprobaba cualquier cosa. No hay ninguna medición de ese estado, y la propia estimación de cuánto material sintético hay hereda la tasa de error del detector con que se hizo.
Medidas relacionadas
Ver en el mapa →Reportar un error en esta ficha →
Fuentes
- [472] AI Now Writes as Many Online Articles as Humans Do · Graphite 2026
- [471] More Articles Are Now Created by AI Than Humans · Graphite 2025
- [1104] Wikipedia:WikiProject AI Cleanup · Wikimedia Foundation 2026
- [912] Performance Decay in Deepfake Detection: The Limitations of Training on Outdated Data · The Alan Turing Institute 2025
- [815] Beyond benchmark accuracy: Evaluating deepfake detection tools for digital forensic admissibility through a systematic review · Onyekwere, Chukwudi George-Linus 2026
- [967] AI models collapse when trained on recursively generated data · University of Oxford / University of Cambridge / Imperial College London / University of Toronto 2024
- [450] Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data · Stanford University / Harvard University / MIT 2024
- [459] Verifying Provenance of Digital Media: Why the C2PA Specifications Fall Short · University of Maryland Baltimore County 2026
- [1140] Invisible Image Watermarks Are Provably Removable Using Generative AI · UC Santa Barbara / Carnegie Mellon University 2023
- [1060] Reglamento (UE) 2024/1689 (Reglamento de Inteligencia Artificial), Artículo 50 — Obligaciones de transparencia · Unión Europea 2024
- [213] Code of Practice on Transparency of AI-generated Content · European Commission — Shaping Europe's digital future 2026