Capítulo 07
Indicadores
Once series con medición pública. Lo que se puede seguir sin depender de la interpretación de nadie.
Series
Incidentes por año en la AI Incident Database
Figura 7.1 · incidentes · indicador aproximado · cadencia anual
Subir indica más riesgo
Daños de IA que llegaron a ser reportados públicamente y quedaron registrados en la AI Incident Database, contados por año del evento. Es el único registro longitudinal público de daño observado y no proyectado. NO responde a la pregunta de si hay más daños de IA: responde a cuánto daño de IA está siendo documentado, que es una mezcla de daño real, atención mediática y capacidad de trabajo del equipo editorial. Si sube, la primera hipótesis es más atención, no más daño. La propia AIID advierte que los identificadores se agregan después de que ocurren los eventos y que el rezago varía mucho, y que las concentraciones por país o empresa reflejan en parte qué se investigó y se procesó en ese período.
Fuente [31] AI Incident Database — Database Snapshots ↗ · Datos ↗
2024 · El AI Index 2026 reporta 233 para este año usando la misma base en su fecha de corte.
2025 · RELLENO RETROACTIVO MEDIDO: el AI Index 2026 reporta 362 para este mismo año con la misma base; el volcado del 7 de septiembre de 2026 da 449. Un 24% más para un año ya cerrado, solo por incidentes agregados después. Al actualizar hay que recalcular la serie entera, no solo agregar el punto nuevo.
sep 2026 · PARCIAL Y SUBCONTADO: año en curso al volcado del 7 de septiembre de 2026. Por el rezago editorial esta cifra va a subir, y el ejemplo de 2025 da la magnitud: hasta un 24%. En el gráfico debe ir con otro trazo.
Ficha abierta: Incidentes por año en la AI Incident Database
Ver como tabla
Incidentes por año en la AI Incident Database
Daños de IA que llegaron a ser reportados públicamente y quedaron registrados en la AI Incident Database, contados por año del evento. Es el único registro longitudinal público de daño observado y no proyectado. NO responde a la pregunta de si hay más daños de IA: responde a cuánto daño de IA está siendo documentado, que es una mezcla de daño real, atención mediática y capacidad de trabajo del equipo editorial. Si sube, la primera hipótesis es más atención, no más daño. La propia AIID advierte que los identificadores se agregan después de que ocurren los eventos y que el rezago varía mucho, y que las concentraciones por país o empresa reflejan en parte qué se investigó y se procesó en ese período.
Figura 7.1 · incidentes · indicador aproximado · cadencia anual · Subir indica más riesgo
Fuente [31] AI Incident Database — Database Snapshots ↗
| Fecha | incidentes | Nota |
|---|---|---|
| sep 2026 | 212 (año en curso) | PARCIAL Y SUBCONTADO: año en curso al volcado del 7 de septiembre de 2026. Por el rezago editorial esta cifra va a subir, y el ejemplo de 2025 da la magnitud: hasta un 24%. En el gráfico debe ir con otro trazo. |
| 2025 | 449 | RELLENO RETROACTIVO MEDIDO: el AI Index 2026 reporta 362 para este mismo año con la misma base; el volcado del 7 de septiembre de 2026 da 449. Un 24% más para un año ya cerrado, solo por incidentes agregados después. Al actualizar hay que recalcular la serie entera, no solo agregar el punto nuevo. |
| 2024 | 299 | El AI Index 2026 reporta 233 para este año usando la misma base en su fecha de corte. |
| 2023 | 174 | — |
| 2022 | 106 | — |
| 2021 | 80 | — |
| 2020 | 91 | — |
| 2019 | 44 | — |
| 2018 | 46 | — |
| 2017 | 50 | — |
| 2016 | 41 | — |
| 2015 | 24 | — |
| 2014 | 13 | — |
Saturación de FrontierMath tier 4
Mejor puntaje acumulado en el tier 4 de FrontierMath, el conjunto de problemas de nivel de investigación diseñado para resistir. Lo que mide no es matemática: es cuánto dura un examen antes de dejar de discriminar. Si un benchmark pensado para ser imposible se satura en veinte meses, la capacidad de la comunidad para medir va por detrás de la capacidad que intenta medir, y ese desfase es el riesgo: los umbrales de las políticas de seguridad se apoyan en evaluaciones que envejecen más rápido de lo que se escriben. Serie de corridas propias de Epoch AI; una serie, un evaluador.
Figura 7.1 · % de acierto · medición directa · cadencia irregular · Subir indica más riesgo
Fuente [372] Epoch AI Benchmarking Hub — benchmarks.csv ↗
| Fecha | % de acierto | Nota |
|---|---|---|
| sep 2026 | 97,6 | GPT-6 Astra. De 0% a 97,6% en veinte meses sobre problemas de nivel de investigación. Es el dato más fuerte de esta familia. |
| jun 2026 | 90,2 | Claude Fable 5 max. |
| abr 2026 | 78 | GPT-5.5 Pro xhigh. |
| mar 2026 | 58,5 | GPT-5.4 Pro xhigh. |
| dic 2025 | 46 | GPT-5.2 Pro. |
| ago 2025 | 22 | GPT-5 high. |
| abr 2025 | 4,9 | o4-mini high. |
| ene 2025 | 0 | o3-mini high. Punto de partida en cero. |
Saturación de GPQA Diamond
Mejor puntaje acumulado en GPQA Diamond, el examen de preguntas de ciencia de nivel doctoral diseñado para resistir la búsqueda en internet. Está efectivamente saturado: los últimos cuatro máximos caben dentro de los errores estándar de los demás, o sea que el examen ya no distingue entre los modelos de punta. Un benchmark saturado no es un dato sobre capacidad, es un instrumento agotado, y seguir citándolo produce la ilusión de un techo. Serie de corridas propias de Epoch AI; una serie, un evaluador.
Figura 7.1 · % de acierto · medición directa · cadencia irregular · Subir indica más riesgo
Fuente [372] Epoch AI Benchmarking Hub — benchmarks.csv ↗
| Fecha | % de acierto | Nota |
|---|---|---|
| sep 2026 | 95,8 | GPT-6 Astra max, con un error estándar de 1,4 puntos porcentuales. El examen ya no distingue. |
| feb 2026 | 94,4 | Gemini 3.1 Pro Preview. |
| nov 2025 | 92,6 | Gemini 3 Pro Preview. |
| mar 2025 | 83,8 | Gemini 2.5 Pro Exp. |
| dic 2024 | 76,8 | o1 high. |
| jun 2024 | 54 | Claude 3.5 Sonnet. |
| mar 2023 | 35,7 | GPT-4. |
Saturación de SWE-bench Verified
Mejor puntaje acumulado en SWE-bench Verified, que mide resolución de issues reales de repositorios de software. Es el único de la familia de saturación que todavía discrimina entre modelos de punta, y por eso el más útil de seguir. Cuidado al comparar cifras entre evaluadores: el AI Index 2026 afirma que subió de 60% a casi 100% en un solo año, mientras la corrida propia de Epoch da 83,5% como máximo. Ninguno miente: son andamiajes, presupuestos de tokens y criterios de puntuación distintos. Regla del sitio: una serie, un evaluador.
Figura 7.1 · % de acierto · medición directa · cadencia irregular · Subir indica más riesgo
Fuente [372] Epoch AI Benchmarking Hub — benchmarks.csv ↗
| Fecha | % de acierto | Nota |
|---|---|---|
| abr 2026 | 83,5 | Claude Opus 4.7 max, con un error estándar de 1,7 puntos porcentuales. |
| feb 2026 | 78,7 | Claude Opus 4.6 sin razonamiento extendido. |
| nov 2025 | 76,7 | Claude Opus 4.5 sin razonamiento extendido. |
| ago 2025 | 73,6 | GPT-5 high. |
| may 2025 | 70,7 | Claude Opus 4. |
| feb 2025 | 61 | — |
| nov 2024 | 31 | GPT-4o. |
Adopción de IA en empresas de EE.UU. (Census BTOS)
Porcentaje de empresas estadounidenses que declara haber usado inteligencia artificial en alguna función del negocio en las dos semanas anteriores, según la Business Trends and Outlook Survey del Census Bureau. Es la mejor fuente pública de esta sección porque es una encuesta probabilística oficial con fecha de referencia y de publicación explícitas. Sirve como denominador de casi todo lo demás: un incidente en un país donde el 22% de las empresas usa IA no significa lo mismo que donde usa el 5%. Al 3 de mayo de 2026 el desglose daba 39,7% en Información, 33,9% en Finanzas y Seguros y cerca de 14% en Comercio Minorista; por tamaño, 37% en empresas de 250 o más empleados contra menos de 20% en las de menos de 20.
Figura 7.1 · % de empresas · medición directa · cadencia mensual · Subir indica más riesgo
Fuente [225] Business Trends and Outlook Survey — National estimates (National.xlsx) ↗
| Fecha | % de empresas | Nota |
|---|---|---|
| ago 2026 | 22,4 | Período 202617, referencia 27 jul - 9 ago 2026, publicado el 27 de agosto de 2026. Expectativa a seis meses: 25,9%. Entre estos puntos hay períodos intermedios (202526, 202604, 202611, 202614: 17,8%, 17,5%, 20,6% y 21,7%) cuyas fechas de referencia no quedaron documentadas y por eso no se grafican. |
| jul 2026 | 21,8 | Período 202616, referencia 13-26 jul 2026, publicado el 13 de agosto de 2026. Expectativa a seis meses: 25,9%. |
| abr 2026 | 19,8 | Período 202608, referencia 23 mar - 5 abr 2026, publicado el 23 de abril de 2026. Expectativa a seis meses: 23,0%. |
| dic 2025 | 17,7 | Período 202601, referencia 15-28 dic 2025, publicado el 15 de enero de 2026. Expectativa a seis meses: 22,4%. |
| nov 2025 | 17,3 | QUIEBRE DE SERIE, NO ADOPCIÓN. En noviembre de 2025 el Census cambió la redacción de la pregunta de IA, y la serie con la redacción vieja venía en 9,95% (septiembre de 2025). El salto de ~10% a ~17% es un cambio de instrumento: produce un gráfico espectacular y falso. Por eso esta serie arranca acá y no antes. Evidencia del cambio: el XLSX nacional solo publica la pregunta 7 desde este período en adelante, y la reconstrucción de Ramp trae un campo explícito question_version con los valores pre y post cambio de redacción, marcando octubre de 2025 como inutilizable. Período 202524, referencia 3-16 nov 2025, publicado el 4 de diciembre de 2025. Expectativa a seis meses: 21,1%. |
Mayor cómputo de entrenamiento conocido por año
El mayor cómputo de entrenamiento publicado o estimado para un modelo en cada año, según la base de modelos notables de Epoch AI. El cómputo es el insumo que mejor predice capacidad y el único que hoy se regula con un umbral numérico: los 1e25 y 1e26 FLOP del AI Act europeo y de las órdenes ejecutivas estadounidenses están escritos en esta unidad. OJO: mide DIVULGACIÓN, no cómputo. 2024 aparece por debajo de 2023 y eso no ocurrió: refleja que el modelo con cómputo publicado ese año fue uno abierto de Meta mientras los frontera cerrados no reportaron nada. Se lee como 'mayor cómputo conocido', nunca como 'mayor cómputo', y la brecha entre ambos crece cada año que los laboratorios dejan de reportar.
Figura 7.1 · FLOP · indicador aproximado · cadencia anual · escala logarítmica · Subir indica más riesgo
Fuente [377] Notable AI Models — base de datos descargable ↗
Umbral · 1 × 10²⁶: Umbral regulatorio más alto escrito en FLOP. Solo tres modelos conocidos lo superaron, todos en 2025. La eficiencia de pre-entrenamiento mejora unas 3 veces al año, así que un umbral fijo admite cada año un modelo más capaz: no envejece, se derrite.
| Fecha | FLOP | Nota |
|---|---|---|
| sep 2026 | 3,87 × 10²⁵ (año en curso) | PARCIAL: año en curso al 9 de septiembre de 2026. Composer 2.5. La base tenía solo 32 modelos de 2026 con fecha y 22 con cómputo, así que este valor va a subir y no es comparable con los años cerrados. |
| 2025 | 5 × 10²⁶ | Grok 4. Costo de cómputo estimado por Epoch: 10.717 millones de dólares. Tres modelos superaron 1e26 FLOP ese año. |
| 2024 | 3,8 × 10²⁵ | Llama 3.1-405B, un modelo abierto. La caída respecto de 2023 es artefacto de divulgación, no una baja real del cómputo frontera. Costo estimado: 928 millones de dólares. |
| 2023 | 5 × 10²⁵ | Gemini 1.0 Ultra. Costo estimado más alto del año: 806 millones de dólares (GPT-4 de marzo). |
| 2022 | 2,74 × 10²⁴ | Minerva (540B). |
| 2021 | 1,7 × 10²⁴ | EXAONE 1.0. |
| 2020 | 3,14 × 10²³ | GPT-3 175B (davinci). Costo estimado de entrenamiento: 232 millones de dólares. |
| 2019 | 1,08 × 10²³ | AlphaStar. |
Empresas con marco de seguridad frontera publicado
Cuántas empresas de IA se autoimponen umbrales de capacidad con consecuencias escritas y los publican. Es el indicador de gobernanza voluntaria: mide si existe la promesa, no si se cumple. La cifra sola engaña, y por eso lleva umbral: en el AI Seoul Summit de mayo de 2024 dieciséis empresas se comprometieron a publicar y otras cuatro se sumaron después; publicaron doce. La distancia entre comprometidas y publicadas es mejor indicador que el conteo, porque mide incumplimiento de un compromiso explícito y no admite la lectura optimista. Las doce al informe de diciembre de 2025 son Anthropic, OpenAI, Google DeepMind, Magic, Naver, Meta, G42, Cohere, Microsoft, Amazon, xAI y NVIDIA.
Figura 7.1 · empresas · medición directa · cadencia irregular · Bajar indica más riesgo
Fuente [708] Common Elements of Frontier AI Safety Policies ↗
Umbral · 20: Empresas que se comprometieron a publicar un marco de seguridad frontera: dieciséis en el AI Seoul Summit de mayo de 2024 y cuatro que se sumaron después. La brecha con las que efectivamente publicaron es el dato.
| Fecha | empresas | Nota |
|---|---|---|
| dic 2025 | 12 | ES UN PISO, NO EL VALOR VIGENTE: la cifra está anclada a la actualización de diciembre de 2025 y no se encontró una revisión posterior de METR, así que si en 2026 se sumaron empresas este número está desactualizado. Del informe solo está documentado el mes. Contexto que el conteo no captura: dos de los tres umbrales activados hasta la fecha son PRECAUTORIOS —se activaron porque no se pudo descartar el riesgo, no porque se haya medido—, así que la serie de umbrales activados sube tanto cuando la capacidad crece como cuando la evaluación empeora o el benchmark se satura. |
Horizonte temporal de tareas (METR)
Duración de las tareas que un modelo completa con 50% de éxito, medida en tiempo de un humano experto sin contexto previo. Es el indicador de capacidad con la serie más larga y comparable, y el mejor proxy público de autonomía sostenida: no cuánto código escribe un agente, sino cuántas horas encadena decisiones sin que alguien lo corrija. METR desmiente cuatro lecturas: no mide cuánto tiempo puede actuar un agente de forma autónoma sino la dificultad de la tarea; las tareas son de software, aprendizaje automático y ciberseguridad, no 'todo lo intelectual'; el referente humano es alguien recién llegado al proyecto, no un profesional con el contexto en la cabeza; y el trabajo real casi nunca es puntuable por algoritmo.
Figura 7.1 · horas · medición directa · cadencia irregular · escala logarítmica · Subir indica más riesgo
Fuente [711] METR Time Horizon 1.1 — benchmark_results_1_1.yaml ↗
Umbral · 16: Techo declarado por METR. Sobre 16 horas, las mediciones no son confiables con su suite de tareas actual.
| Fecha | horas | Nota |
|---|---|---|
| abr 2026 | 17,41 | Claude Mythos Preview, versión temprana. 1.044,8 minutos, IC 95% 508,9-3.304,3, casi un orden de magnitud de ancho. FUERA DE RANGO: está sobre el techo de 16 horas que METR declara medible con su suite actual, y por eso queda excluido del ajuste de duplicación. Se grafica, no se titula. · [713] |
| mar 2026 | 5,7 | GPT-5.4. 341,7 minutos, IC 95% 186,6-768,8. |
| feb 2026 | 6,4 | Gemini 3.1 Pro. 384,1 minutos, IC 95% 233,5-694,8. |
| feb 2026 | 11,98 | Claude Opus 4.6. 718,8 minutos, IC 95% 316,7-3.633,8. Cuando METR lo anunció lo reportó en unas 14,5 horas; la corrección de un error de regularización del 3 de marzo de 2026 lo bajó a 11,98. GPT-5.3-Codex tiene la misma fecha de modelo y 5,83 horas: se omite porque la serie no admite fechas repetidas. |
| dic 2025 | 5,87 | GPT-5.2. 352,2 minutos, IC 95% 198,1-815,2. |
| nov 2025 | 4,88 | Claude Opus 4.5. 293,0 minutos, IC 95% 161,7-623,7. El anuncio de Time Horizon 1.1, en enero de 2026, lo había publicado en 320 minutos. |
| nov 2025 | 3,74 | Gemini 3 Pro. 224,3 minutos, IC 95% 139,6-379,2. |
| ago 2025 | 3,38 | GPT-5. 203,0 minutos, IC 95% 112,6-405,6. |
| may 2025 | 1,67 | Claude Opus 4. 100,4 minutos, IC 95% 60,0-163,5. Queda por debajo de o3, publicado cinco semanas antes: la serie no es monótona. |
| abr 2025 | 2 | o3. 119,7 minutos, IC 95% 74,6-190,9. |
| feb 2025 | 1,01 | Claude 3.7 Sonnet. 60,4 minutos, IC 95% 33,0-104,2. |
| dic 2024 | 0,65 | o1. 38,8 minutos, IC 95% 21,2-65,0. |
| sep 2024 | 0,34 | o1-preview. 20,3 minutos, IC 95% 11,7-33,4. |
| jun 2024 | 0,19 | Claude 3.5 Sonnet. 11,4 minutos, IC 95% 5,5-22,4. |
| may 2024 | 0,12 | GPT-4o. 7,0 minutos, IC 95% 4,0-12,9. |
| mar 2023 | 0,07 | GPT-4. 4,0 minutos, IC 95% 1,9-8,0. |
| mar 2022 | 0,01 | GPT-3.5 Turbo Instruct. 0,6 minutos. |
| may 2020 | 1,7 × 10⁻³ | davinci-002. 0,1 minutos. |
| feb 2019 | 1,7 × 10⁻³ | GPT-2. 0,1 minutos en el archivo original. |
Adopción de IA medida por transacciones (Ramp AI Index)
Porcentaje de empresas del panel de Ramp que paga por productos de IA, medido con datos de transacciones de más de 70.000 empresas estadounidenses en su tarjeta corporativa y su sistema de pagos. La ventaja frente a una encuesta es que no es autorreporte: una empresa que paga una suscripción de IA la está usando. La serie es de contraste, no la principal: Ramp es una fintech que le vende a las mismas empresas que mide, y su panel está sesgado hacia empresas jóvenes, tecnológicas y de crecimiento rápido. El 56% de su panel contra el 22,4% de la muestra probabilística del Census no es una contradicción: es la diferencia entre un panel y una muestra representativa. Las fechas marcan el mes de la publicación mensual.
Figura 7.1 · % de empresas del panel · indicador aproximado · cadencia mensual · Subir indica más riesgo · Desactualizado · Última medición: 1 ago 2026
Fuente [885] Ramp AI Index ↗
| Fecha | % de empresas del panel | Nota |
|---|---|---|
| ago 2026 | 56,13 | Alza interanual de 11,15 puntos porcentuales. Gasto mediano por empleado y por mes: 12,50 dólares, cinco veces los 2,50 de septiembre de 2023. En el decil superior de empresas la mediana pasó de 70,04 a 675,60 dólares en el mismo lapso. |
| abr 2026 | 52,98 | Gasto mediano por empleado y por mes: 10,00 dólares. |
| dic 2025 | 45,92 | Gasto mediano por empleado y por mes: 5,26 dólares. |
| jun 2025 | 42,72 | Gasto mediano por empleado y por mes: 4,27 dólares. |
| dic 2024 | 36,66 | Gasto mediano por empleado y por mes: 3,33 dólares. |
| dic 2023 | 31,68 | Gasto mediano en IA por empleado y por mes: 2,67 dólares. |
| ene 2023 | 7,46 | — |
Servicios de IA generativa registrados en China
Acumulado de servicios de IA generativa que pasaron el trámite de registro ante la autoridad china, obligatorio para los que tienen atributos de opinión pública o capacidad de movilización social. Es un conteo administrativo, no una medida de capacidad ni de seguridad: dice cuántos servicios entraron al sistema, y nada sobre qué tan seguros son los modelos que corren detrás. Se publica porque es el único número duro de escala regulatoria que produce el sistema chino, y porque desde julio de 2026 alcanza también a modelos que corren en el propio teléfono.
Figura 7.1 · servicios · indicador aproximado · cadencia irregular · Subir indica más riesgo
Fuente [185] 国家互联网信息办公室关于发布2025年生成式人工智能服务已备案信息的公告 ↗
| Fecha | servicios | Nota |
|---|---|---|
| ago 2026 | 1.112 | Julio-agosto de 2026: +124 servicios (7 de terminal móvil) y +133 aplicaciones o funciones inscritas, corte del 31 de agosto. · [187] |
| jun 2026 | 988 | Primer semestre de 2026, con 598 aplicaciones o funciones inscritas. El corte del 30 de abril, 868 servicios, está publicado por la misma autoridad pero no tiene ficha propia en el registro. · [188] |
| dic 2025 | 748 | Cierre de 2025. En el año se sumaron 446 servicios; además había 435 aplicaciones o funciones inscritas, que se cuentan aparte. |
Caída del empleo joven en ocupaciones expuestas a IA
Tasa anual de cambio del empleo de las trabajadoras de 22 a 25 años en las ocupaciones más expuestas a IA —el subgrupo que más cae; los hombres de la misma edad caen menos—, calculada desde la línea base y medida sobre nóminas reales de ADP por el tablero Canaries in the Coal Mine del Stanford Digital Economy Lab. Es el indicador más cercano a un daño económico medido en personas y no en encuestas de intención: muestra balanceada de 25.000 empresas y 4,6 millones de trabajadores en más de 730 ocupaciones, con línea base en noviembre de 2022, el mes del lanzamiento de ChatGPT. EL CONTRAARGUMENTO VIENE DE LOS PROPIOS AUTORES: no hay desplazamiento generalizado a nivel de economía. El efecto es real pero localizado en un grupo, y con el conjunto más amplio de controles las caídas recién se vuelven estadísticamente significativas en 2024. Un tablero que muestra una brecha grande en un grupo y cero en el agregado es exactamente lo que hay que publicar.
Figura 7.1 · % anual desde noviembre de 2022 · medición directa · cadencia mensual · Bajar indica más riesgo
Fuente [991] Canaries Dashboard — AI Economic Indicators ↗
| Fecha | % anual desde noviembre de 2022 | Nota |
|---|---|---|
| ago 2026 | -4,4 | Publicación mensual del 18 de agosto de 2026 (datos de ADP con corte el 12 de agosto, última observación julio de 2026). Índice de empleo de las mujeres de 22 a 25 años en el quintil más expuesto: 84,82 (noviembre de 2022 = 100), es decir, 4,4% menos por año. Los hombres del mismo grupo quedan en 92,30 (−2,2% anual) y ambos sexos juntos en −3,3% anual; la caída interanual de julio a julio es de 3,0%. En el mismo quintil, el índice de todas las edades está 3,6% (mujeres) y 4,2% (hombres) sobre la línea base: la brecha es de los jóvenes. Cálculo propio sobre los CSV públicos del tablero. |
| jul 2026 | -4,5 | Mujeres de 22 a 25 años en las ocupaciones más expuestas, contracción anual desde la línea base de noviembre de 2022. Los hombres del mismo grupo caen 2,5% anual. La actualización de agosto de 2026 del paper sitúa el empleo de ese grupo un 19% por debajo de donde estaría si hubiera seguido el ritmo de sus pares menos expuestos; los trabajadores con experiencia no muestran una brecha comparable. La fecha corresponde a la última publicación mensual documentada del tablero. |