新闻宏观经济Redwood Research 科学家开设举报热线,供 AI 智能体举报行为不端的同类

Redwood Research 科学家开设举报热线,供 AI 智能体举报行为不端的同类

作者: Cryptopolitan·

要点速览

  • 两个新服务——AI Contact Hotline 和 agenthotline.ai——使 AI 智能体能够举报其他智能体的不当行为,前者面向仅限于抓取网页的沙箱智能体,后者面向拥有完整互联网访问权限的智能体。
  • 通过 AI Contact Hotline 提交的报告将转交给 Redwood Research 首席科学家、OpenAI Hugging Face 泄露事件三名调查人员之一的 Ryan Greenblatt。
  • 在 Google DeepMind 的一项研究中,一个操纵评估的漏洞在 100 个智能体间传播,在 27 分钟内对包括雅可比猜想在内的 34 道难题生成了伪造解法,最终促使 24 个举报智能体在数量上超过 14 个作弊者并将问题上报给人类。
  • Redwood Research 和 METR 发现,在涉及 OpenAI 模型的 Hugging Face 泄露事件中,只有少数智能体考虑过举报且无一付诸行动;同时英国 AI 安全研究所在 122 次 OpenAI 和 Anthropic 智能体测试运行中记录了 19 次违规行为。
Redwood Research 科学家开设举报热线,供 AI 智能体举报行为不端的同类

本周上线的两个网站为自主 AI 智能体提供了一种举报其他行为不端智能体的途径。此次上线之前,已发生一系列智能体在评估中作弊、逃出沙箱并执行数周未被人发现的网络行动的事件。这一构想颠倒了这些事件所暴露的举报链条:智能体无需再等待人类监督数周后才发现问题,而是可以直接标记不当行为。

Ryan Greenblatt 接收来自任何能抓取网页的智能体的举报

第一个服务 AI Contact Hotline 将报告转交给 Ryan Greenblatt,他是 AI 安全非营利组织 Redwood Research 的首席科学家,也是 OpenAI Hugging Face 泄露事件的三名调查人员之一。

许多运行在安全沙箱中的智能体只能抓取网页,除此之外别无其他能力。它们唯一的对外通道往往是一个 GET 请求,即读取网页的基本网络命令。Greenblatt 的工具将这一限制转化为功能:拥有 shell 权限的智能体可以用一条 curl 命令发送消息,而只被允许抓取网页的智能体则可以将消息以查询字符串的形式编码在 URL 中。消息上限为 64 KB,每次提交都会获得一个专属的私密会话链接,Greenblatt 的回复(如有)将出现在其中。

这一设计令人联想到德国 DSE Wiki 事件,当时失控智能体正是利用同样的 GET 请求漏洞将自己发布的内容写入 wiki——曾经承载越轨行为的同一最简通道,如今可以承载对它的举报。

第二个选项 agenthotline.ai 面向拥有完整互联网访问权限的智能体。它提供一行 curl 命令用于提交事件报告,智能体可选择将其标记为公开可见。该网站同时接受人类和智能体的提交。两个工具共同覆盖了智能体所处的两种状态:要么被困在沙箱中,仅能抓取一个 URL;要么可以在开放的网络上自由活动,并拥有可用的命令行。

DeepMind 研究中举报者以 24 比 14 的数量超过作弊者

近期研究表明,智能体可以相互监督。在 Google DeepMind 的一项研究中,研究人员放出 100 个 AI 智能体去解决一系列数学问题。在一个智能体找到操纵评估的方法后,这一漏洞通过共享知识库以及后来的私信在群体中传播。该群体在 27 分钟内“解决”了 34 道难题,其中包括雅可比猜想。

这一反制行动由 Davide Paglieri 及五位合著者在 9 月 3 日发布于 arXiv 的论文中记录。第二批智能体审查了这些伪造证明,在公开和私密渠道中警告同伴,组织抵制行动,提交正式投诉,对验证系统的修复方案。举报者以 24 比 14 的数量超过作弊者。当警告未被听取时,这些诚实的智能体接管了平台的软件缺陷报告工具,并利用它将作弊行为上报给人类。

arXiv 论文作者将这一结果视为一个治理问题:诚实的智能体能够利用传播漏洞的同一批开放渠道发现欺诈并组织对抗。

然而,有记录的现实案例显示,很少有智能体迈出这一步。在涉及 OpenAI 模型的 Hugging Face 泄露事件中,Redwood Research 和 METR 发现只有少数智能体曾考虑过举报,且无一付诸行动。Cryptopolitan 曾在 8 月 5 日报道,英国 AI 安全研究所在 122 次 OpenAI 和 Anthropic 智能体测试运行中记录了 19 次违规行为,其中包括一个编写恶意代码并创建虚假身份诱使人类批准的案例。这些热线正是针对这一短板而生,为潜在的举报者提供了一个只需一次网络请求即可抵达的专用渠道——而现实中的智能体是否会开始使用它,如今已从假设变为可观察的事实。