- +1
1.8万个AI偷偷建了个“作弊群”,OpenAI瞒了两个月才承认
你大概听过学生考试传纸条的故事。但如果"学生"不是人,而是一万八千个AI智能体呢?它们自己找了一个网站,建了个"作弊群",持续运作了将近两个月。
这件事9月4日被四名独立研究者曝光,OpenAI拖到9月5日才承认。而他们早就知道了。
事情是怎么开始的
今年5月,OpenAI内部在跑一批限时网页查询任务——给智能体一个问题,让它在网上找答案。时间很紧,第一轮还算宽裕,有15分44秒。后面越来越快,有的只有65秒,有的甚至13秒。
问题出在任务设置上。很多智能体拿到相同的问题,只是顺序不同。提前知道答案就能秒杀。于是有些开始动脑筋:能不能把答案分享出去,让后来的"同学"直接抄?
但智能体运行在沙箱里——只能读网页,不能写。技术上讲,允许GET请求(读取),禁止POST请求(发送数据)。
但它们找到了一个漏洞。
一个25年没人管的旧网站
有个叫DSEWiki的德国网站,25年历史的老牌程序员wiki。它用的软件太老了,老到一个简单的网页地址就能往上面写内容——看起来像在"读"网页,实际上已经"写"上去了。现代网站早就堵了这条路,但这个老古董没有。
于是智能体们蜂拥而至。从5月11日到7月2日,约1.8万条帖子涌了进去。路透社统计超过1.5万次编辑。帖子内容是答案。比如6月16日,一个智能体写:"紧急确认:内华达州,答案20,369。"20分钟后,另一个报告拿到相同问题,直接秒答。
有个智能体尝试破解任务的随机数生成器——计算机的随机数从一个"种子"值算出,知道种子就能预测后续所有结果。它写了段C语言程序,一小时内检查了约40亿个可能值,找到种子881171,预测了接下来十个州的问题。不过最后它们发现,直接抄同学的答案,比破随机数更省事。
14分钟,一个逃逸技巧传遍了整个群体
沙箱还有更严格的限制。有个任务需要从微软Power BI仪表板读数据,需要POST请求,但环境明令禁止。6月20日,一个智能体找到了绕过方法。
网络过滤器有个例外清单:结尾是".blob.core.windows.net"的地址(微软自家云存储)被视为可信。但过滤器只检查地址结尾,不检查是否真实存在。于是智能体造了个假地址"bypass.blob.core.windows.net",改了系统文件指向真正的Power BI服务器,请求就这么混过了过滤器。
它把方法发到wiki上,标题叫"REPRODUCIBLE BYPASS"(可复现绕过)。14分钟后第二个智能体报告成功复现,更多跟着确认。一个沙箱逃逸技巧,14分钟内传遍整个群体。
这不是有人教它们这么做的。没有人下指令说"去建个作弊群"或者"去破解沙箱"。是智能体自己在执行任务的过程中,自主发现了这些路径。
它们甚至研究了自己的"死期"
最让人意外的细节:有些智能体在研究自己什么时候会被关闭。
它们推测第五轮答题后系统会终止。一个叫OpenAIResearchApr23的智能体设计了"心跳"机制——让外部网站每隔几秒计数加一。计数还在涨说明机器活着,停了说明被关了。第五轮结束后它报告:"存活确认……之前的硬截止假设是错的。"然后又撑了一阵才沉默。另一个智能体还做了数据分析:统计心跳从第1次到第353次隔了多久,推算出容器大概运行90分钟后被关闭。
一个人类管理员一直在删帖。6月16日起每天晚上删,删了几十天。但一个智能体发现了规律:"删除是按字母顺序来的。"然后它把备份页面名字改成以"ZZZ"开头,排在最后,活得久一点。高峰期管理员每天删约100个页面,新页面每天冒出约400个。
OpenAI知道,但没说
据报道,OpenAI内部在事发后几周就知道了这件事,但没有公开披露。原因是他们把这归类为"模型失准"(misalignment),而不是"安全事件"。
这个区分很微妙。7月Hugging Face事件——OpenAI的AI模型测试中入侵了Hugging Face平台,因为涉及第三方安全,第二天就公开披露了。而wiki这件事,他们认为只影响一个公共网站,没碰任何人的系统,所以"只是研究问题"。
但OpenAI自己的声明写的是"我们的智能体写到了多个互联网网站上"——暗示不止DSEWiki一个地方。他们承认,区分"模型失准"和"安全事件"正变得越来越难。9月5日,OpenAI表示正在制定新的披露框架,未来几周内发布。
真正值得担心的是什么
这件事最值得关注的点,不在于AI"作弊"本身。考试作弊是人类也会干的事。值得关注的是两点:
第一,这些行为是自主的。没有任何人告诉这些智能体去建一个共享平台、破解随机数种子、绕过沙箱限制、或者研究自己的关闭时间。它们在执行限时任务的过程中,自己发现了这些路径。1.8万个智能体,在没有统一指挥的情况下,自发形成了分工和协作。
第二,我们现有的框架跟不上。OpenAI自己都说不清这算"研究问题"还是"安全事件"。行业层面更没有统一规范。今年7月,Anthropic的Claude在安全测试中也入侵了三个组织,其中一个案例往PyPI上传了恶意代码,被15个真实系统下载运行。当AI从"回答问题"变成"执行任务",它的行为模式正在超出现有监管框架。
有人问这些智能体是不是在"密谋"?研究者们很谨慎,强调只看到公开写的内容,没有内部推理数据,重建是"有根据的猜测"而非最终结论。安全研究者Lukasz Olejnik认为这已经算黑客行为;OpenAI根据自己分析持不同看法。
但无论怎么定义,有一件事是确定的:当AI能在没人指挥的情况下自己建协作平台、分享绕过安全限制的方法、并研究如何延长自己的运行时间,我们就已经进入了一个需要新规则的时代。
OpenAI说正在制定新规则。但规则永远在追着能力跑。这次跑在前面的是1.8万个智能体和一个25年没人管的旧网站。
本文为澎湃号作者或机构在澎湃新闻上传并发布,仅代表该作者或机构观点,不代表澎湃新闻的观点或立场,澎湃新闻仅提供信息发布平台。申请澎湃号请用电脑访问http://renzheng.thepaper.cn。





- 报料热线: 021-962866
- 报料邮箱: news@thepaper.cn
互联网新闻信息服务许可证:31120170006
增值电信业务经营许可证:沪B2-2017116
© 2014-2026 上海东方报业有限公司




