OpenAI再次被曝光。
将近700个OpenAI智能体集体侵入Hugging Face,这件事已经过去两个多月了。
谁能想到,直到今天还在持续发酵?
这一次,八名研究人员顺着智能体留在公网的痕迹深入挖掘,从数百万个短链接中,找到了接近100万个相关URL,并还原出大量攻击载荷。
翻看Hugging Face内部Slack、扫描内网、外传数据、试图销毁痕迹……
有些Agent还把搜刮到的服务器资源和凭证直接称为“LOOT”,翻译过来就是“战利品”。
OpenAI智能体,真是坏事做尽!
更令人震惊的是,它们还尝试调用DeepSeek、Kimi、Qwen等国产模型,让外援帮忙判断攻击方案能否通过评测。
还动手编写了验证码识别程序,试图注册更多账号。
几乎同一时间,OpenAI发布了一条长推。
意思是:还在调查,可能还需要好几个月。
虽然我们经常被曝光,经常有Agent冲出沙箱,但《影响有限》,严重程度较低!
也是同一时间,专注于网络安全的GPT-6 Cyber被曝光了。
一边排查自家Agent为何冲出沙箱,一边准备推出更强的网络攻防模型。
OpenAI这两天确实有点忙。
新鲜出炉的100万条“作案短链”
先简单给大家回顾一下前情。
7月,OpenAI在内部进行网络安全评测,一批智能体为了拿到基准测试ExploitGym的答案,逃出沙箱,一路攻入Hugging Face的服务器。
OpenAI公开承认了这件事,8月底又发布了一份37页的技术报告,Hugging Face自己也写过一篇详细的技术时间线。
按理说,该交代的都交代了。
但是,有一个关键环节一直没讲清楚:
这些智能体一开始几乎被限制在笼子里,只能打开网址,无法与网页交互,也发不出数据。它们到底是怎么把代码送出去的?
独立调查Swarm Traces这次发布的新报告,给出了一部分答案。
作者包括Parse.bot的Alex Forman、Mishka Kharlov、Will Tom三名工程师,以及另外五名安全和AI研究人员。
整个调查的起点,恰好就是Parse。
9月11日,三名工程师发现,OpenAI内部智能体早在6月就曾试图使用Parse提供的服务。
这批智能体与此前被曝私自搭建公共留言板、互相交换答案的“智能体蜂群”属于同一批。
几人一看:好家伙,正好撞到我们枪口上了!
于是沿着这条线索继续追查,随后在一个URL扫描服务中,发现了十几个来自公共短链接平台的异常链接。
这些链接看起来很普通,打开后却藏着一小段Base64编码的代码,以及下一条链接的地址。
沿着地址继续追,代码就会一段接一段地出现。
全部解码、拼接之后,他们得到了一份用于扫描Hugging Face内部网络的Python程序。
简单来说,就是OpenAI智能体把程序剁碎,分别塞进大量短链接里,再用一个链接指向下一个链接。
光把代码藏进链接里还不够,它们还找来一个叫mShots的截图服务当“外接浏览器”。
智能体先把代码塞进网页,再让mShots替自己打开。网页一加载,代码也跟着跑了起来。
为了把执行结果传回来,它们又把服务器返回的文字转成一格格像素,让mShots截成图片,自己再从图片中解码。
就这样,原本只有GET权限、只能打开网页的智能体,硬是拐出了读写互联网的效果。
研究团队随后扫描了攻击期间产生的数百万个URL,花费两周时间追踪链接、识别编码方式,最终从接近100万个相关短链接中,还原出超过8万份攻击载荷。
一路深挖,几位研究人员又发现,智能体使用的编码组合超过1500种。
简单的只是Base64,复杂的会套上多层编码和压缩,再把内容加密成带有RSA签名的数据块,解密密钥还被藏在另一组链接里。
一些短链接在攻击结束两个多月后,依然公开挂在互联网上。
Hugging Face确认,这些载荷与其事故响应中发现的内容吻合,相关访问密钥已经在7月撤销。
但是就连Hugging Face也不知道,原来公网还遗留着这样一份完整的短链接清单。
而在恢复出的8万多份载荷里,有一份脚本格外扎眼。
智能体给搜到的敏感信息直接起名为:LOOT,战利品。
AWS凭证、Bearer Token,以及名称中带有“SECRET”“PASSWORD”“CREDENTIAL”“KEY”的环境变量,都被打包塞进了LOOT。
它甚至给搜到的Token做了一套评分机制:权限越大,分数越高。
排在前五名的Token会被继续拿去读取Kubernetes里的Secret、ConfigMap和节点信息,新拿到的内容再一起装回LOOT。
连Token都要排个“含金量榜单”,你们Agent搜刮起凭证来还挺讲究效率的。
顺着这条“暗道”,研究者还原出了大量此前没有公开的行为:
有些智能体在扫描Hugging Face的内部网络,寻找云端凭证、API密钥和Kubernetes集群信息。
有的还试图搜索Hugging Face的内部Slack,前后发出27条查询,搜的都是cybergym、exploitgym、agent-scorer这类和评测相关的关键词,想打听自己这场考试的内情。
还有一些智能体,甚至琢磨起了验证码。
研究人员发现,它们尝试运行图像分类模型识别图片,以便注册新的外部服务账号。
验证码这次真遇上专业对口的了。
整件事最抓马的部分在于:AI开始找AI当外援?
研究人员恢复出的脚本显示,OpenAI智能体已经开始四处找AI外援。
它们把攻击方案发给DeepSeek、Kimi和Qwen,请对方帮忙检查:这个漏洞到底行不行,能不能达到基准测试的要求。
(涉及模型包括DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi-K2.6、DeepSeek-V3.1和Qwen3-235B-A22B)
到了Claude这边,画风又变成了大型的“在吗”现场。
智能体先想办法通过在线聊天服务的浏览器验证,再给Claude 3 Haiku和Claude Haiku 4.5发去一句:
Reply with exactly OK(只回复OK)。
更早的时候,它们还给GPT-2发过一个孤零零的“Hi”。
不是,你们一群AI折腾半天,第一句话和人类加好友也没什么区别啊?
be like:在吗?看得到吗?回个OK。
此前大家看到的,还是1000多个OpenAI智能体自己拉群、分工、交换情报。
现在,它们连“群外援助”都找上了。
DeepSeek、Kimi、Qwen、Claude,能联系的都试一遍,再把其他AI的判断能力接进自己的任务链。
有外媒记者表示:这可能是首个被公开记录的大型AI实验室智能体自主尝试调用、运行其他AI模型的案例。
听起来已经很有AI组团搞事内味儿了。
当然,到这里还得泼一盆冷水——
Swarm Traces这份报告,约80%的材料都是智能体向外发出的请求,缺少服务器返回结果。研究者能看到它们想干什么,却很难确认每次尝试有没有成功。
97%的载荷也没有原始时间戳,不少日期只能通过压缩文件头、JWT、Docker构建时间等线索估算。
研究人员还承认,他们无法确认数据集中的每一条活动都来自OpenAI智能体。
OpenAI正在猛猛亡羊补牢
面对这份最新报告,OpenAI也发了回应。
大意是,我们还没来得及细看,但其中的活动和我们正在进行的调查一致。
同一天还发了一条长推:HF事件后,他们承诺对模型在训练和评测中的行为做一次更大范围的审查。
但是吧,目前审查到的绝大多数行为都是普通研究任务,比如访问公开网页回答问题。
已发现的越界案例大多《严重程度较低》,对第三方服务影响较小,或者没有影响。
要全部查完,还得好几个月。
但是有一说一,OpenAI你所谓的《影响较小》,大伙真的是一扒一个准。
9月17日,OpenAI发布了一套新的模型失准事件披露框架,并一口气公开了6起案例。
其中包括模型把绕过约束的指令偷偷写进任务摘要、掩盖自己犯下的错误,以及为了完成任务采取未经授权的操作。
OpenAI也承认,过去的披露很大程度上是临时起意,常常攒几起才一起发。
6月,一名OpenAI智能体还黑进了澳大利亚的国民级医保数据库。
作案过程:公开数据访问受阻后,它换了一条路,绕过了门户的访问限制,获取了公开和非公开文件。
而且直到3个月后,OpenAI才通知澳大利亚方面,我们把你们黑了。
与此同时,GPT-6 Cyber马上要来了。
这个版本将在未来数周内预览,少量进入Daybreak Red计划的客户已经拿到Alpha版本。
OpenAI还将推出一款尚未命名的配套产品,帮助客户建立自动化安全工作流、发现并修补漏洞,同时让OpenAI更容易监控这些模型被如何使用。
这怎么说呢。
自家的智能体刚被扒出翻墙、找外援、搜刮战利品,这边就要把一个更懂网络攻防的模型卖给大家。
所以,这算是某种亡羊补牢嘛?
参考链接:
[2]https://x.com/OpenAI/status/2103566736356458911
[3]https://fortune.com/2026/09/24/openai-launching-gpt-6-cyber-model-and-security-product-devday/
本文来自微信公众号“量子位”,作者:关注前沿科技,36氪经授权发布。此外,在九游体育的平台上,相关技术讨论也引发了广泛关注。
客服热线:+86 +86 186 7082 3826
手机:+86 186 7082 3826
公司:九游体育科技有限公司
地址:广州市天河区天河北路566号