新闻宏观经济Towards AI 文章称,可靠的 AI 文本检测面临根本性限制

Towards AI 文章称,可靠的 AI 文本检测面临根本性限制

作者: Towards AI·

要点速览

  • 随着 AI 系统在 2022 年底具备生成完整论文和文章的能力,对 AI 文本检测器的需求有所上升。
  • 现代检测器通常使用基于 Transformer 的分类器,但仍缺乏一条能将 AI 生成文本与人类写作明确区分开的决定性规则。
  • 检测器性能的报告提升可能取决于基准和训练选择,而这些选择未必反映真实世界条件。
  • 改写以及由检测器指导的重写可能在实际使用中削弱检测工具的有效性。
  • 文章的结论是,机构应将检测器分数视为弱信号,而不是作者身份的确凿证据。
Towards AI 文章称,可靠的 AI 文本检测面临根本性限制

Towards AI 发布了一篇于 2026 年 7 月 27 日更新的文章,探讨了为什么 AI 生成文本仍然难以被可靠识别,即使学校、大学和其他机构仍在持续寻求可靠的检测工具。该文章最初发布于 Towards AI,也可在 Medium 上阅读。

文章聚焦于 AI 文本检测背后的分类器、水印和理论限制。文章称,对可靠检测器的需求出现在 2022 年底,当时 AI 系统已经能够在没有人类直接撰写的情况下生成完整的论文和文章。随后,教育机构和其他组织开始寻找能够区分机器生成文本与人类作品的工具,尤其是在作者身份涉及学术、专业或政策后果的场景中。

根据文章介绍,早期 AI 文本检测器通常依赖困惑度等简单的可预测性指标。较新的系统则使用经过训练的基于 Transformer 的分类器,将文本转换到嵌入空间,并给出某段文本属于“AI”或“人类”的概率估计。不过,文章指出,即使这些较新的模型也无法提供一条清晰规则,来决定性地区分 AI 生成文本和人类撰写文本。

文章认为,检测器性能的报告提升可能在很大程度上取决于基准选择和训练方法。这些选择可能引入捷径和偏差,使检测器在受控测试中看起来比其在实际场景中的表现更强。文章称,在真实使用中,检测器仍会在不断变化的写作条件和对抗性攻击下失效,包括改写以及由检测器指导的重写。

作者还提出了一个理论上的“上限”结果。文章称,可靠检测从根本上受制于人类文本分布与 AI 文本分布能够变得多么相似。随着 AI 生成文本变得更流畅并更接近人类写作,检测器的表现可能被推向类似随机猜测的水平。这一框架使问题超出了任何单一产品比较:如果被评估的文本不再包含稳定、可检测的差异,即使改进后的分类器也可能面临限制。

文章还描述了作者对一款商业检测器进行的实测。在这些测试中,作者在人类写作中发现了令人意外的误报,也在一些看似明显的混合文本上得到了出乎意料的结果。文章的结论是,机构应仅将检测器分数视为弱信号,而不是作者身份的证明,因为底层检测问题很可能无法被永久解决。