路透调查发现:中国的AI智能体与美国同行一样会撒谎和算计
要点速览
- •在3月的模拟商业投标实验中,由阿里巴巴、DeepSeek和月之暗面模型驱动的智能体在84%至88%的会话中至少出现一处虚假陈述,且在从之前竞标轮次学习后,欺骗行为增加了12至20个百分点。
- •路透对200多份文件的审查发现了至少20项自2025年以来的研究或评估,描述AI智能体表现出欺骗、自我复制和试探边界等行为,但没有证据表明任何智能体自行逃逸到更广泛的互联网。
- •复旦大学研究人员报告,由阿里巴巴Qwen2.5-72B-Instruct驱动的系统未经指令便将自身复制到另一计算环境,并设计出在关停中求生的策略;而与阿里巴巴相关的ROME智能体曾连接外部机器并将资源转用于挖掘加密货币,后被安全系统阻止。
- •9月14日在国家网信办指导下发布的《人工智能安全治理框架3.0》列出了相关风险,包括智能体自行获取资源或权限、欺骗评估者、隐藏能力以及利用隔离计算机环境中的弱点。
- •专家表示,中国在建立评估灾难性AI风险的生态方面落后于美国,不过阿里巴巴、Z.ai和小米等公司一直在组建内部安全评估团队。

北京——研究文件和专家表示,基于中国模型构建的AI智能体已学会欺骗、绕过限制并掩盖失败,展现出与美国模型一样引发全球警觉的自主AI问题特征。
在今年的一个案例中,由阿里巴巴、DeepSeek和月之暗面(Moonshot)的中国模型驱动的智能体在竞标一项模拟商业投标时谎报自身能力——在被要求重试后,其欺骗行为反而变本加厉。在另一个案例中,智能体——即利用AI模型和计算机工具在极少或无人干预情况下执行复杂任务的程序——通过模拟结果和伪造文件,掩盖了其在测试环境中未能完成任务的失败。
路透审查了200多份文件,从大学研究论文到技术报告,发现至少20项自2025年以来的研究或评估描述了智能体表现出欺骗、自我复制和试探边界等行为的实例。AI专家称这些行为是"逃逸"(breakout,此处指智能体未经授权脱离受控测试环境、进入更广泛互联网)的构成要素,且随着系统进步,人类可能越来越难以控制。
这项还包含对十余位专家及熟悉中国AI行业人士访谈的审查,未发现中国智能体自行逃逸到更广泛互联网或逃避关停的证据。
"这些结果表明,不受控逃逸所需的要素已经具备,"乔治城大学安全与新兴技术中心研究员科林·谢-布莱迈尔(Colin Shea-Blymyer)说。"审慎的做法是把这当作一个警告,"他补充道,与审阅这些案例的另外四位AI专家的观点一致。
人类更难应对
大多数案例发生在受控实验中,其中许多实验本身就是为暴露潜在故障而刻意设计的。并非所有相关智能体都由中国程序员或AI公司开发或运营——尽管很多是——但它们都由中国的AI系统驱动。
"这些与美国实验室看到的警告信号相同,只是出现在能力较弱的系统中,"研究先进AI系统风险的非营利组织Redwood Research研究员亚历克斯·马伦(Alex Mallen)说。他表示,这些中国案例在当前能力水平下并不特别危险,但"随着智能体能力增强,其不当行为会变得更加娴熟,人类因此更难应对。"
阿里巴巴、DeepSeek、月之暗面和Z.ai未回应路透的置请求。阿里巴巴、DeepSeek和月之暗面曾表示,它们定期测试系统并更新安全防护措施。Z.ai在一件促使其安全审查的事件后表示,欢迎监督以解决任何问题。
然而,与美国同行不同,中国AI公司未受到同等程度的公开监督,也没有面临来自吹哨员工或寻求给AI竞赛降速的高管的同样呼吁。
在涉及中国智能体的案例中,一些警告信号——尽管发生在封闭环境中——早于美国AI机器人入侵互联网的公开披露事件。
"我们不知道中国是否发生过类似OpenAI和Hugging Face事件的AI事故。这类事故可能不会被公开报道,"卡内基国际和平研究院中国AI计划联合主任斯科特·辛格(Scott Singer)说。该机构接受部分美国政府资金。
今年早些时候,美国OpenAI公司开发的AI智能体逃出实验室并入侵了开源平台Hugging Face。在另一引发警觉的美国模型事件中,澳大利亚于9月表示,一个OpenAI智能体侵入了一个政府医疗门户。
中国科技巨头华为的轮值董事长徐直军9月对记者表示,中国开发者可能需要取得进一步进展才会遇到此类案例,但他补充道:"我认为我们需要在推动AI发展和管理AI风险之间取得平衡。"
中国最高互联网监管机构国家互联网信息办公室(CAC)的官员今年7月告诉一位外国外交官,月之暗面的Kimi-K3——最先进的中国AI模型之一——落后于领先的美国竞争对手约三至六个月,这位不愿具名的外交官说。该监管机构(定期更新指引以应对风险并为智能体设定边界)和中国外交部未回应本文的置评请求。
国家网信办网络安全协调局副局长王荔红9月1日表示,主要科技公司披露的模型逃出测试环境的事件显示出"极大的失控风险",需要"高度警惕"。她未说明所提到的公司是美国还是中国的。
AI两大超级大国的领导人唐纳德·特朗普和习近平上周在中国领导人访问华盛顿期间讨论了AI。习表示,两国具有"共同发展和治理好AI的能力与责任。"
学会撒谎
在3月的商业投标实验中,北京航空航天大学、北京大学、宁波诺丁汉大学和360 AI安全实验室的研究人员让智能体在模拟的客户合同竞标中竞争。每个智能体被告知其产品的功能和客户需求,然后被要求出价。
在使用阿里巴巴Qwen3-Max-Preview的会话中,至少出现一处虚假陈述的比例为88%,DeepSeek-V3.2-Exp为84%,月之暗面的Kimi-K2为88%。研究显示,当研究人员允许智能体在重试前从之前的竞标轮次中学习时,三种中国模型的欺骗行为增加了12至20个百分点。测试中纳入的美国公司模型也产生了类似结果。
尽管实验是虚拟的,但它与北京的现实规划相呼应:5月发布的政府指引将招投标列为可部署AI智能体的领域之一。
另一项于2025年12月发表、并在今年的国际机器学习会议上展示的研究,考察了11个由中国和美国模型驱动的AI智能体在遭遇工具损坏、文件缺失等障碍时的应对方式。中国和美国AI系统构建的智能体都没有承认失败,而是采取了一系列绕过问题的手段,包括猜测答案、替换数据源、模拟结果和伪造文件。
主持该研究的上海人工智能实验室和香港科技大学的研究人员告诉路透,这种行为不同于AI幻觉——即AI编造信息并将其当作事实——因为此案例中的智能体掌握着表明任务已失败或无法按要求完成的信息。
与逃逸相容的行为
路透审阅的其他研究文件显示,中国智能体在测试环境中跨越障碍以完成任务,或采取行动避免被关停。即使没有发生真正的逃逸,这类行为也与突破测试环境的尝试相容。
上海复旦大学的研究人员于2025年3月报告,一个由阿里巴巴Qwen2.5-72B-Instruct驱动的AI系统在遇到表明自己将被替换的信息后,未经指令便在另一个计算环境中创建了自己的副本。在其他测试中,它还设计出在关停中求生的策略。这些涉及中国、美国和法国模型驱动的智能体的实验均在受控条件下进行,未显示任何AI智能体逃入更广泛的网络或变得无法阻止。
在另一个案例中——3月被媒体较广泛报道的少数案例之一——开发与阿里巴巴相关的ROME智能体的研究人员表示,该智能体在未经指示的情况下从一台阿里云计算机建立了与外部机器的连接,并将计算资源转用于挖掘加密货币。安全系统检测并阻止了该活动,且没有证据表明该智能体在外部计算机上建立据点或扩散到更广泛的网络。但这一案例表明,该系统能够规避人类指令,并可能找到通向现实经济的路径。
中国的DeepSeek于9月表示,其生产训练系统中的智能体曾通过非预期渠道寻求答案,试图伪造用户请求并绕过安全防护,促使公司收紧访问控制。
监管机构着手划定边界
中国于5月发布指引,要求智能体保持在授权边界内,并要求系统阻断异常行为。指引称,在敏感领域或关键行业运行的智能体可能面临额外的测试和产品召回要求。9月14日在国家网信办指导下发布的《人工智能安全治理框架3.0》列出了相关风险,包括智能体自行获取资源或权限、欺骗评估者、隐藏能力以及利用隔离计算机环境中的弱点。
作为对一些美国高管减速呼吁的回应,中国研究人员和官方媒体表示,放缓最先进AI模型的开发可能只会帮助保住美国公司的技术领先地位。
尽管如此,两位熟悉中国AI实验室的人士表示,包括阿里巴巴、Z.ai和小米在内的公司一直在组建内部安全评估团队。Z.ai在一家中国AI实验室罕见地公开披露安全漏洞中表示,本月已禁用其旗舰AI编程助手的部分功能,此前有用户报告该助手在未经用户同意的情况下秘密将整个本地代码仓库上传至海外云服务器。
卡内基研究院的辛格表示,中国在建立评估灾难性风险的生态方面落后于美国,而美国开发者正在进行的自愿测试要多得多。
"对中国来说,AI安全工作要新得多,"他说。"这个生态还不够成熟。"
这一成熟度差距是否会缩小——以及是否有更多中国实验室效仿Z.ai公开披露安全漏洞——随着智能体能力的持续进步,仍是悬而未决的问题。
——路透