新闻宏观经济皮尤研究发现:ChatGPT发布后的网页中三分之一显示出明显的AI创作迹象

皮尤研究发现:ChatGPT发布后的网页中三分之一显示出明显的AI创作迹象

作者: Decrypt·

要点速览

  • 皮尤使用Open Pangram AI检测器,分析了Common Crawl中2021年1月至2026年7月期间的约49万个页面。
  • 2026年7月的快照中约10%的页面显示出明显的AI创作迹象,而ChatGPT发布以来发布的网页中这一比例升至35%。
  • .com域名页面显示出AI创作信号的比例约为.edu和.gov网站的10倍,约为.org网站的两倍。
  • 皮尤表示,该检测器可能会对单个页面做出错误分类,被标记的内容可能是AI辅助创作而非完全由机器生成。
  • 研究指出,随着AI撰写文本日益普遍,搜索引擎和AI公司正日益转向内容溯源和反垃圾措施。
皮尤研究发现:ChatGPT发布后的网页中三分之一显示出明显的AI创作迹象

皮尤研究中心(Pew Research Center)周四发布的一项研究显示,如今每10个英文网页中就有1个显示出由AI撰写的明显迹象。若将样本缩小至仅涵盖ChatGPT——由OpenAI于2022年11月发布——上线后发布的网页,这一比例会跃升至35%。

这一发现源于研究人员从Common Crawl网页档案中提取了约49万个页面,时间跨度为2021年1月至2026年7月,随后将文本输入AI检测模型Open Pangram进行分析。2026年7月对该语料库的一次快照显示,10%的页面具有明显的AI创作迹象。语料库的选择具有额外的意义:Common Crawl长期以来一直是大语言模型的训练数据来源,因此这个用于衡量AI在网络中扩散程度的档案,同时也是正在书写这个网络的模型的原始素材。

分布不均的AI指纹

AI指纹在网络上的分布并不均匀。.com域名页面显示出AI创作迹象的比例约为.edu或.gov域名的10倍——后两者各自接近1%——并且约为.org网站4.6%这一比例的两倍。在2021年,即生成式AI工具进入主流应用之前,这四类域名的表现几乎完全相同。

皮尤如何识别机器痕迹

该检测器并不针对任何单个词汇或短语进行标记,而是对大批量文本中的统计模式进行权衡。尽管如此,自2023年以来,一些个别特征的出现频率显著上升:破折号(em dash)的使用频率大约翻了一番,牛津逗号增加了63%,而“delve”(深入探究)、“interplay”(相互作用)和“testament”(见证)等AI偏爱的词汇出现频率增加了一倍以上。

“负向平行结构”(negative parallelism)——例如“这不仅只是X,更是Y”这类句式——自2023年以来几乎增长了两倍,不过皮尤指出,总体而言它仍然较为罕见。Decrypt此前已追踪过这些相同的特征,而Merriam-Webster则在12月正式为此定论,将“slop”(垃圾内容)评为其年度词汇

检测的局限性

皮尤谨慎地指出了该研究的局限性:检测模型可能在两个方向上对单个页面做出错误分类,而“具有明显的AI创作迹象”并不意味着页面完全由机器撰写——许多被标记的文本很可能属于AI辅助创作,而非纯粹的AI生成。

Open Pangram来自Pangram Labs,该公司的检测器还出现在另一项研究中,该研究发现今年美国报纸文章中约有9%含有AI生成的文本,其中包括《纽约时报》等媒体的评论版面。

不过,随着时间的推移,AI检测任务可能会变得更加容易——这并非源于语言模式,而是源于底层技术。Anthropic等大型AI公司已经在研究模型级文本指纹技术,该技术将使AI文本易于识别,同时将错误降至最低。这指向了内容溯源——即证明内容的来源——而非事后猜测,这与媒体和科技公司所采用的C2PA标准背后的原则相同,该标准用于为内容附加凭证。

陡峭的趋势线

域名之间的差距反映了发布者的身份及其动机。学术和政府网站需要经过编辑审核、机构批准和较慢的发布周期;而.com域名则涵盖从新闻编辑室到联盟营销内容工厂的各类主体,后者以任何人类编辑都无法维系的节奏批量产出页面。搜索引擎已经开始应对这股洪流:谷歌于2024年开始执行“规模化内容滥用”(scaled content abuse)政策,对批量生产的页面进行处罚,无论其由人类还是机器撰写。

无论如何,从整体规模来看,趋势线都十分陡峭:.com域名的AI创作率从2021年1月的约1%攀升至五年后、即2026年1月的9.35%。