皮尤研究發現:ChatGPT推出後發布的網頁有三分之一顯示AI寫作的顯著跡象
重點速覽
- •皮尤使用Open Pangram AI偵測器,分析了Common Crawl中約49萬個頁面,時間跨度為2021年1月至2026年7月。
- •2026年7月的快照中約有10%顯示AI寫作的顯著跡象,而ChatGPT推出後發布的頁面中,這一比例升至35%。
- •.com網域頁面顯示AI寫作訊號的比例約為.edu和.gov網站的10倍,約為.org網站的兩倍。
- •皮尤表示,偵測器可能會錯誤分類個別頁面,且被標記的內容可能是AI輔助寫作,而非完全由機器生成。
- •該研究指出,隨著AI撰寫文本日益普遍,搜尋引擎和AI公司正日益轉向內容來源驗證與反垃圾內容措施。

根據週四發布的一項皮尤研究中心研究,如今每10個英文網頁中,就有1個顯示出由AI撰寫的顯著跡象。若將樣本縮小至ChatGPT(由OpenAI於2022年11月推出)上線後才發布的頁面,這一比例更躍升至35%。
這項發現源自研究人員從Common Crawl網頁檔案庫提取約49萬個頁面(時間跨度為2021年1月至2026年7月),並將文本送入AI偵測模型Open Pangram進行分析。在該語料庫2026年7月的快照中,有10%顯示出AI寫作的顯著跡象。語料庫的選擇尤具意義:Common Crawl長期以來一直是大語言模型的訓練資料來源,因此這個用來衡量AI在網路上擴散程度的檔案庫,同時也是撰寫這些網頁的模型的原始素材。
分佈不均的AI指紋
AI指紋在網路上的分佈並不均勻。.com網域頁面顯示AI寫作跡象的比例,約為.edu或.gov網域(兩者各接近1%)的10倍,也約為.org網站4.6%比率的兩倍。在2021年、生成式AI工具尚未普及之前,這四種網域類型的表現幾乎完全相同。
皮尤如何辨識機器寫作
該偵測器並非標記任何單一詞彙或短語,而是權衡大批文本中的統計模式。儘管如此,自2023年以來,某些個別特徵已變得明顯更為常見:破折號的出現頻率約為以往的兩倍,牛津逗號增加了63%,而AI偏好的詞彙如「delve」、「interplay」與「testament」的出現頻率更增加超過一倍。
「負面平行結構」——如「it's not just X, it's Y」(這不只是X,更是Y)之類的句式——自2023年以來幾乎增至三倍,不過皮尤指出這種句式整體而言仍然罕見。Decrypt先前已追蹤過這些相同特徵,而Merriam-Webster於12月正式將「slop」評選為其年度詞彙。
偵測的局限
皮尤特別強調該研究的局限性:偵測模型可能雙向錯誤分類個別頁面,而「AI寫作的顯著跡象」並不代表頁面完全由機器撰寫——許多被標記的文本很可能是AI輔助,而非完全由AI生成。
Open Pangram來自Pangram Labs,該公司的偵測器也曾出現於另一項研究中;該研究發現,今年美國約9%的報紙文章含有AI生成文本,其中包括《紐約時報》等媒體的評論版面。
不過,AI偵測可能會隨時間變得更加容易——不是因為語言模式,而是因為底層技術。Anthropic等大型AI公司已在開發模型層級的文本指紋技術,這將使AI文本易於識別,同時將錯誤降至最低。這指向來源驗證——證明內容的出處——而非事後猜測,這也是媒體與科技公司為內容附加憑證所採用的C2PA標準背後的相同原則。
陡峭的趨勢線
網域之間的差距反映了發布者的身分與動機。學術與政府網站需經過編輯審核、機構批准以及較慢的發布週期;.com網域則涵蓋從新聞編輯室到聯盟行銷內容農場的各類網站,後者產出頁面的速度是任何人類編輯都無法持續維持的。搜尋引擎已開始應對這股洪流:Google於2024年開始執行「大規模內容濫用」(scaled content abuse)政策,懲罰大量生產的頁面,無論其由人類或機器撰寫。
無論如何,就整體規模而言,趨勢線都相當陡峭:.com的AI寫作率從2021年1月的約1%,攀升至五年後的9.35%,單是2026年1月便已達此水準。