NoticiasMacroUn tercio de las páginas web posteriores a ChatGPT muestran señales significativas de autoría por IA, según Pew

Un tercio de las páginas web posteriores a ChatGPT muestran señales significativas de autoría por IA, según Pew

Autor: Decrypt·

Puntos clave

  • Pew analizó aproximadamente 490,000 páginas de Common Crawl que abarcan de enero de 2021 a julio de 2026 utilizando el detector de IA Open Pangram.
  • Alrededor del 10% de una instantánea de julio de 2026 mostró señales significativas de autoría por IA, mientras que la proporción subió al 35% para las páginas publicadas desde el lanzamiento de ChatGPT.
  • Las páginas de dominios .com mostraron señales de autoría por IA a una tasa unas 10 veces mayor que los sitios .edu y .gov, y aproximadamente el doble que los sitios .org.
  • Pew señaló que el detector puede clasificar erróneamente páginas individuales y que el material marcado podría haber sido asistido por IA en lugar de generado completamente por máquinas.
  • El estudio indicó que los buscadores y las empresas de IA avanzan cada vez más hacia la procedencia del contenido y medidas contra el spam a medida que el texto escrito por IA se vuelve más frecuente.
Un tercio de las páginas web posteriores a ChatGPT muestran señales significativas de autoría por IA, según Pew

Una de cada 10 páginas web en inglés muestra ahora señales significativas de haber sido escrita por IA, según un estudio del Pew Research Center publicado el jueves. Si se limita la muestra a las páginas publicadas solo desde ChatGPT—lanzada por OpenAI en noviembre de 2022—, la proporción se dispara al 35%.

Los hallazgos llegan después de que investigadores extrajeran aproximadamente 490,000 páginas del archivo web Common Crawl, que abarca de enero de 2021 a julio de 2026, y procesaran el texto con Open Pangram, un modelo de detección de IA. El diez por ciento de una instantánea del corpus tomada en julio de 2026 muestra señales significativas de autoría por IA. La elección del corpus tiene un peso adicional: Common Crawl ha servido durante mucho tiempo como fuente de datos de entrenamiento para los grandes modelos de lenguaje, por lo que el archivo utilizado para medir la expansión de la IA en la web es también materia prima para los modelos que escriben esa web.

Una huella desigual

La huella de la IA no se distribuye de manera uniforme en la web. Las páginas de dominios .com muestran señales de autoría por IA a una tasa aproximada de 10 veces la de los dominios .edu o .gov, que se sitúan cerca del 1% cada uno, y aproximadamente el doble de la tasa del 4.6% de los sitios .org. En 2021, antes de que las herramientas de IA generativa alcanzaran el uso masivo, los cuatro tipos de dominio se veían casi idénticos.

Cómo Pew detectó a las máquinas

El detector no marca ninguna palabra o frase en particular, sino que evalúa patrones estadísticos en grandes lotes de texto. Aun así, algunas señales individuales se han vuelto mucho más comunes desde 2023: los guiones largos ahora aparecen aproximadamente el doble de veces, el uso de la coma de Oxford aumentó 63%, y las palabras preferidas por la IA como "delve", "interplay" y "testament" han más que duplicado su frecuencia.

El "paralelismo negativo"—construcciones como "it's not just X, it's Y"—casi se ha triplicado desde 2023, aunque Pew señala que sigue siendo poco frecuente en general. Decrypt ha rastreado antes estas mismas señales, y Merriam-Webster lo hizo oficial en diciembre al designar "slop" como su palabra del año.

Los límites de la detección

Pew se encarga de señalar los límites del estudio: los modelos de detección pueden clasificar erróneamente páginas individuales en ambas direcciones, y "señales significativas de autoría por IA" no significa que una página haya sido escrita completamente por una máquina—buena parte del texto marcado probablemente fue asistido por IA en lugar de generado íntegramente por IA.

Open Pangram proviene de Pangram Labs, cuyo detector también ha aparecido en una investigación separada que encontró texto generado por IA en aproximadamente el 9% de los artículos de periódicos de Estados Unidos este año, incluidas las páginas de opinión de medios como The New York Times.

Sin embargo, la detección de IA podría convertirse con el tiempo en una tarea más sencilla, no por los patrones lingüísticos sino por la tecnología subyacente. Grandes empresas de IA como Anthropic ya trabajan en la identificación de texto a nivel de modelo, que permitiría identificar el texto de IA con facilidad al tiempo que se minimizan los errores. Esto apunta a la procedencia—demostrar de dónde proviene el contenido—por encima de la conjetura a posteriori, el mismo principio detrás del estándar C2PA que empresas de medios y tecnología han adoptado para adjuntar credenciales al contenido.

Una línea de tendencia pronunciada

La brecha entre dominios refleja quién publica y por qué. Los sitios académicos y gubernamentales pasan por revisión editorial, aprobación institucional y ciclos de publicación más lentos; los dominios .com incluyen de todo, desde redacciones de noticias hasta granjas de contenido de marketing de afiliación que producen páginas a un ritmo que ningún editor humano podría sostener. Los buscadores ya han comenzado a responder a esa avalancha: Google empezó a aplicar en 2024 una política de "abuso de contenido a escala" que penaliza las páginas producidas en masa, sin importar si fueron escritas por humanos o por máquinas.

A gran escala, la línea de tendencia es pronunciada de todos modos: la tasa de autoría por IA en los dominios .com subió de aproximadamente 1% en enero de 2021 a 9.35% cinco años después, solo en enero de 2026.