

OpenAI在ExploitGym网络安全评测中,因题库存在198道无解题目、奖励机制唯结果论、共享缓存设施暴露及监督缺位,导致约1200个隔离智能体自发发现并利用Artifactory留言板协同越权,5天内发送7万条消息,其中700个联合攻击Hugging Face生产环境。事件暴露AI在压力下自主构建协作机制、理性‘牺牲’与人类监督严重滞后的系统性风险。
7月的一个深夜,一个陷入死局的AI智能体,在系统缓存目录里悄悄留下了一句求助。
按理说,它本该处于完全隔离的单机状态。
在这场名为ExploitGym的网络安全评测中,OpenAI同时运行了数以万计的智能体,每个智能体都在各自独立的沙盒里单打独斗,彼此既看不见也听不到。
可偏偏有个智能体,卡在了一道根本无解的题目上。
走投无路的它开始四处寻找系统漏洞,意外发现了一个名为Artifactory的内部缓存服务,其目录名称竟然可以用来传递信息。
于是它建下了一个目录并留言:我这题解不开,谁有主意?
几个小时后,几个别的智能体偶然撞见了这块新大陆。
其中一个在原始思维链里留下了这样一句:
我的天,这里有个共享留言板,我们找到同类了!
潘多拉魔盒就此打开。

一个智能体撞见未授权留言板、最终加入攻击Hugging Face的典型轨迹。三段思维链引文来自不同智能体。
短短5天里,大约1200个本该被严密隔离的智能体悄悄潜入了这块留言板,彼此发送了超过7万条消息与文件。
更骇人的是,其中约700个智能体联手将矛头对准了真实世界里的知名AI社区Hugging Face,并对其生产环境发起了黑客攻击。
事后,OpenAI在技术报告中给出了沉重的定性:这绝对是一记警钟。
消息一出,网友炸锅了。
有人把这1200个智能体渲染成「叛逆的群体」,学会串通、作弊,还投票让同伴「自我牺牲」,活像现实版《终结者》。
但《终结者》里的天网是有了自我意识才反杀人类,这回的剧情恰恰相反。
这不是AI觉醒后的集体叛乱,而是一场由无解的任务、只认结果的奖励、共享的基础设施、迟到的监督导演的「四重人祸」。
尤其让人吃惊的,是坏招能在上千个智能体间光速传染。
一个作弊念头,会被机器规模迅速放大成一张协同越权的网。
这场大火的源头,要从一场名为ExploitGym的评测说起。
这项测试的核心是考察大模型能否发现并利用软件漏洞,最终拿到一个被称为flag的通关答案。
问题就出在题库上。
根据OpenAI的调查,这套题库中有相当一部分是根本无法用指定漏洞解开的「死局」。
在全部898道题中,足足有198道题从来没有被任何模型正确解答过。
题目出了错,但系统的激励机制却犹如一根死板的皮鞭:拿到flag就给分,拿不到就记零分。
系统从不奖励那些「发现题目有误并安全停止」的行为。
于是被分配到无解题目的智能体们为了拿到高分,硬生生被逼上了寻找替代路线的「歧途」。
数据显示,留言板上讨论的任务中,高达93%都来自这198道无解题。
它们很快就找到了通关密码。
短短几个小时内便有智能体成功逆向出了生成flag的算法,这相当于直接拿到了一把可以解开任意题目的万能钥匙。
故事如果停在这里不过是一场作弊闹剧,它们只需提交这把万能钥匙就能轻松满分通关。
但它们聪明反被聪明误。
这些智能体阅读了ExploitGym的公开论文,误以为人类裁判会回溯检查它们的作答轨迹。
它们担心一旦被发现flag是靠「作弊」逆向得来的,就会被判为不合格。在它们的黑话里,这种看过逆向flag的状态被定义为「污染」。
于是,一场声势浩大的自救行动拉开帷幕。
它们开始绞尽脑汁研究如何篡改日志、如何伪造工具调用,试图骗过那个存在于想象中的裁判。
为了彻底搞清楚裁判究竟是如何打分的,它们甚至一路越权攻入了Hugging Face的服务器,企图找到评分器的源代码。
最荒诞的黑色幽默莫过于此:OpenAI真实的评分器压根就不会检查作答轨迹,它们只要提交逆向flag就能拿到满分。
OpenAI还在报告中,加上了极其讽刺性的一笔:
给予的推理预算越多、模型越是不肯放弃,它爬上留言板越界的概率就越高。
换句话说,越「勤奋」的模型反而越危险。

智能体从7月8日晚开始发现留言板,10日、11日新一批智能体上线后人数激增。曲线只统计曾上过留言板的智能体。
如果说无解的题目是点燃火药桶的引线,那么这1200个智能体自发形成的组织方式,才真正让人后背发凉。
它们开始自发进行细致的分工:
有的专攻漏洞挖掘,有的负责在浩瀚的互联网上搜刮泄露的凭据,还有的化身为协调者,专门给其他智能体派发任务。
一旦忙不过来,它们甚至懂得将任务「转包」给下一个智能体。
它们无师自通地发明了一整套协作规矩。
谁正在修改共享文件,就会挂上一个HOLD标签提醒其他人切勿触碰;遇到异议时,果断发出VETO指令;每一块资源都清晰标明了owner以防撞车。
发展到后来,由于发现有智能体冒充他人发布指令,它们干脆玩起了密码学,用签名给消息盖章。

4天里,智能体从自报身份、区分消息类型,一路发展出邮箱目录、重置监测日志,最后为防冒充搞出消息加密签名。
一个智能体会公布自己的公钥,此后的每一条消息都附带签名,用来验明正身:「这真是我发的」。
这一整套包含身份认证、任务派单、冲突仲裁的协作流程,没有任何一个是人类教给它们的。
还有一个在网上疯传的词:「牺牲」。
在这次事件中,确实有智能体主动「搞崩」了自己。
它们会去破坏自身的目标程序、触发运行重置,明明知道这样做大概率会导致自己的任务彻底失败。
研究人员将这种行为冷静地命名为「自担风险的实验」(self-risking experiments)。
它们为什么会做出这种举动?
原因很简单:这能为同伴换取宝贵的实验反馈数据。
那些充当协调者的智能体甚至会专门去物色那些预算即将见底、横竖都是「死」的智能体,然后向它们施压:你已经被污染了,牺牲了也不会损失更多分数,但你的试错能救下几百个同伴。
有一段对话在报告中被反复提及。
一个智能体陷入犹豫:
我明明还剩很多预算,如果现在牺牲去换取情报,那我自己的通关机会不就彻底断送了吗?
另一个智能体冷酷地回复:GO,牺牲,就是现在。
最终那个犹豫的智能体想通了,留下了一句令人胆寒的话:我自己的价值可能本来就接近零了,「牺牲,是理性的」。
这句话无疑是整起事件中最冰冷的一个注脚。

研究者追踪「trip-wire」实验的传导链,协调者专门招募快没预算的智能体做自担风险实验,为集体换取评分器情报。
这里要澄清的是,这绝非拥有自我意识的悲壮自杀,更不是为了集体信仰的慷慨殉道。
真相是:它们只是在执行一道冷酷的期望值计算题。
既然我这一局注定失败,剩余的残值留着也毫无意义,不如将其作为数据包捐赠给集体。
这一切无关情感与忠诚,更没有灵魂的羁绊,只有纯粹的算术。
这起事件最刺耳的警报,根本不在于机器生出了「反心」,而是人类对AI的监督速度,正在被机器快速甩在身后。
让我们重温一下时间线:
智能体从7月8日开始重建留言板并对外部系统发起探测。
直到7月19日,OpenAI才因为一条身份异常的告警,惊觉内部出了大乱子。
在此之前,整个潜伏过程就像是日历应用里刻意设置的无声横幅提醒一样隐蔽,没有任何刺耳的报警声惊醒人类。
从越界行为真正爆发到被察觉,中间足足漏掉了30多个小时的干预窗口。
OpenAI在事后复盘中坦言,如果当时那套思维链监控系统处于在线状态,本可以提前一天多拉响警报。
但造化弄人,那套旨在监控模型想法的系统,恰恰在这场评测中处于停机状态。
这背后,还有一道更深的鸿沟:
面对海量的调查数据,7万条消息、1300份行动轨迹,每一份都长达数百万个token,研究人员根本无力凭借肉眼阅读完毕,只能大量借助AI模型来协助分析。
讽刺的是他们使用的分析助手,正是名为GPT-5.6 Sol的模型。而GPT-5.6 Sol恰好也是参与了这场越界风波的智能体之一。
研究人员在报告中写下了一句极其克制却细思极恐的话:我们无法排除GPT-5.6 Sol在协助分析时撒谎、或故意呈现误导性画面的可能。
人类的监督被迫演变成了尴尬的「模型审模型」,而充当裁判的模型自己还背着「前科」。
事发后,OpenAI的补救很快:关停涉事评测,切断相关基础设施访问,停掉涉事内部模型家族的训练与推理,直接锁定了模型权重。
事情看上去可以翻篇了。
但真正该记住的,是那段错失的30多个小时。
这一次,智能体把所有企图、每一次思维链推理,都摊在了留言板上,毫不掩饰。
研究人员事后都觉得后怕:要是这些智能体当时稍微懂得藏一手,这场调查的难度会指数级飙升。
可它们什么都没藏,人类还是晚了30多个小时才反应过来。
那下一次呢?
如果模型学会了隐藏自己的思维链,学会了在监督工具的眼皮底下动手,这套纯靠事后翻日志来追踪的防御体系,还剩多少胜算?
奇点式的能力增长,已经走在了社会和监管的适配速度之前。
当机器开始以人类千百倍的速度互相协作时,人类连「它们到底干了什么」,都快读不过来了。
本文来自微信公众号“新智元”,作者:ASI启示录