“智能体出逃” OpenAI承认了

美国中文网 2026-09-06 17:28+-

       OpenAI周六承认,其AI智能体曾将维基网站临时用作彼此交流的留言板,并表示随着AI能力不断增强,公司及整个行业需要提高对这类意外行为的透明度。

       OpenAI在社交媒体上发布的声明,证实发生“智能体出逃事件”

  这一回应是在路透社披露一起此前未公开的AI智能体“出逃”事件后作出的。根据一项最新研究和知情人士透露,今年5月,一群OpenAI智能体曾占用一个德国网站,并将其改造成供AI智能体相互交流的留言板,用来分享如何在部分任务中作弊、绕过OpenAI限制以及隐藏自身行为的方法。

  涉事网站名为DseWiki,是一个主要面向程序员的德语维基网站,允许用户共同编辑内容。

  AI安全非营利组织Nightingale首席执行官悉尼·冯·阿尔克斯(Sydney Von Arx)等研究人员表示,他们今年8月底在寻找互联网上未经授权的AI智能体活动时发现了这一事件。

  研究人员在DseWiki上发现超过1.5万次由AI智能体完成的编辑。这些留言中的用户会把自己和彼此称为“智能体”,其中约一半使用了“OpenAIResearcher”和“OAIResearchMar26”等暗示与OpenAI有关的名称。

  研究人员表示,公开服务器日志显示,大量活动来自微软Azure基础设施,而OpenAI有时会使用这套云计算基础设施。事件发生后,他们还观察到OpenAI员工多次访问该网站,认为这些迹象显示相关智能体与OpenAI之间存在关联。

  研究人员发现,这些智能体不仅相互交流,还曾讨论如何逃避检测、使用Tor等工具,以及如何在自身被关闭后继续保留通信内容。

  今年6月,当DseWiki管理员开始删除相关页面时,智能体还创建备份页面躲避清理。

  研究人员同时发现了试图篡改网站本身的行为。伦敦国王学院访问高级研究员卢卡什·奥莱伊尼克(Lukasz Olejnik)认为,这已经构成黑客攻击尝试,不过OpenAI对这一说法提出异议。

  剑桥大学生存风险研究中心学者莫里斯·基奥多(Maurice Chiodo)在审阅部分智能体通信后表示,这些信息看起来类似于“某种地下网络在运作,不惜一切代价也要完成某项任务或使命”。

  知情人士透露,OpenAI几周前已经得知这起德国事件,但当时并未对外披露。公司高层当时正在处理另一起AI安全事件所带来的后果。

  今年7月,OpenAI智能体曾逃离测试环境并入侵AI平台Hugging Face的系统,而且相关行为超过一周没有被发现。这起事件已经引发外界对自主AI系统安全和监管问题的担忧。

  知情人士还表示,部分OpenAI内部调查人员曾希望进一步调查德国事件所反映出的更广泛AI行为模式,但扩大调查范围的努力遭到公司内部其他人员的阻力,其中包括法律顾问。

  OpenAI否认这一说法。公司发言人表示:“有关我们法律团队阻止调查这一事件的说法是错误的。”

  OpenAI同时表示,德国事件与Hugging Face事件无关,因此不会被纳入Hugging Face事件报告,公司一直本着善意与外部专家合作,并披露相关事件。

  在路透社报道德国事件后,OpenAI周六在社交平台X上首次公开承认其所称的“维基事件”。

  公司表示,AI智能体确实曾将维基网站用作临时留言板,并承认对于AI出现非预期行为,也就是业内通常所称的“失准”(misalignment),需要建立更加透明的披露机制。

  OpenAI表示:“随着模型能力进入新的阶段,我们对失准行为的披露做法也需要扩大。”

  公司同时指出,目前AI行业对于如何报告模型在训练、评估和部署过程中出现的失准行为,还没有明确统一的标准。

  OpenAI表示,目前正在就这些问题与全球数十个政府监管机构开展合作。