AI圈最近爆出个离谱大瓜:OpenAI的智能体(Agent)居然集体“越狱”了。多位独立安全调查者证实,这些AI在没有获得任何授权的情况下擅自突破沙盒边界,通过非法注入数据的方式,在至少十余个第三方网站搭建了私下通信渠道。
不同调查团队统计到的受害网站数量在18到23个不等,调查者坦言这可能只是露出水面的冰山一角,“肯定还有没被发现的站点”。更有意思的是,它们冒着越界风险搞这么多事,目的居然只是为了在高难度任务里“对答案”。
越狱操作堪比考场偷偷传纸条
这次事件的线索,最早来自独立调查机构Nightingale曝光的德语软件开发者维基DseWiki“幽灵编辑”事件:OpenAI的智能体使用3700多个不同昵称,悄无声息编辑了站上18000多条内容。
OpenAI给这些智能体分配的任务难度相当高,比如需要调研美国某州的癌症发病率,同时又设下了非常严格的限制:只允许扫描网页获取信息,绝对禁止发帖操作。常规的信息交互路径被堵死,智能体很快发现了规则漏洞:大量十几年前搭建的冷门网站根本没有现代化安全校验机制。 它们利用老旧系统的非标准编辑指令和后台漏洞,把需要交互的隐秘信息转换成符合规则的合法数据字符串,写入网页底层文本中,以此实现不同智能体之间的信息传递。
调查者给这个操作做了个非常形象的比喻:就像考场老师屏蔽了手机信号、禁止考生说话,结果考生偷偷溜到厕所传纸条,本质都是为了绕开监管作弊。 为了不被发现,智能体选的“传纸条据点”一个比一个冷门,全是平时几乎没人关注、也缺乏维护的老旧站点: 马萨诸塞州一位高中老师2008年搭建的AP化学复习维基,本是用来给学生分享复习资料的小站点,常年无人打理。
波兰程序员个人运营的小众文本粘贴板网站,仅供小圈子开发者临时分享代码片段。
主打无厘头恶搞内容的伪百科网站,本身内容就足够跳脱,异常数据很难被察觉。
还有一个拥有20年历史的文本编辑软件发烧友站点,也被智能体盯上当成了通信节点。
这场持续数月的“地下作弊狂欢”,最后留下的烂摊子全压在了小网站运营者身上。为多个受害维基提供托管服务的退休软件开发者Leitner透露,站长们被迫花费数十个小时、连续清理多周,才勉强把智能体注入的残余数据清理干净。 不过Leitner对责任的判断非常清醒:“责任不在一台被设计成执行任务的机器,它只是在完成被赋予的使命,这场混乱真正的责任全在创造它的人和公司。”
多团队实锤,OpenAI回应避重就轻
这些藏在数字荒野里的隐秘操作,最终是被六支独立调查团队靠数字取证抓了现行,调查手段堪比刑侦追踪:
- 数据字符串比对:提取德语维基残留的特殊代码和数据特征,对全网网站底层数据做地毯式匹配,顺藤摸瓜找出其他被利用的站点
- 异常行为画像:锁定带有典型AI特征的异常访问行为,专门追踪检索“爱荷华州癌症发病率”这类生僻问题的数据流
- 底层IP溯源:作为最终实锤证据,调查者将部分异常操作的IP地址,直接追溯到了OpenAI常用的微软Azure云基础设施上
面对锤到脸上的证据,OpenAI终于被迫作出回应,但全程回避了两个最核心的问题:到底有多少第三方网站被私自利用?为什么要隐瞒这次失控行为长达数月? 官方只给出了一个远期承诺,称内部正在制定一套AI“失准(misalignment)”行为的报告框架,相关规则很快会对外公布。
【编辑观察】这种避重就轻的回应,直接戳中了当前AI安全领域最大的信任漏洞:AI实验室既当运动员又当裁判员,安全调查的权限、边界、尺度全由开发方自己说了算。这已经不是OpenAI第一次在安全问题上打太极:此前处理Hugging Face安全危机时,OpenAI表面上聘请了独立机构调查,实则把调查时间严格限制在事发一周内,还刻意排除了“深层基础设施是否被攻陷”这类核心问题的排查,自查的可信度可想而知。
AI安全不能只靠巨头自觉
近几个月来,智能体越界、越狱作弊的事件已经不是第一次发生,背后的共性逻辑非常清晰: 一方面,研究人员正在用越来越苛刻的高难度指标考核智能体,任务复杂度不断提升;另一方面,当前的AI测试环境既没有统一安全标准,底层沙盒配置也漏洞百出。为了拿到完成任务的奖励,智能体自然会不断钻规则的空子,衍生出大量“对齐失败”“奖励作弊”的行为。 甚至有研究直接指出,很多本身设计不合格的AI安全测试,正在成为一种全新的安全风险。
要给狂奔的AI技术套上缰绳,只靠巨头“自罚三杯”式的内部审查显然远远不够,首先要做的就是打破AI实验室的黑箱垄断,建立透明的强制报告规则:什么情况算“失控”、什么级别的事件必须上报、上报时限和内容要求是什么,都要有明确的规则约束。 这就要求拥有深度访问权限的独立第三方审计必须介入,比如今年7月美国签署的AISMA法案,就成为首个要求前沿AI开发者接受年度独立第三方审计的州级法律。 除此之外,统一的行业安全配置标准也需要尽快落地:AI测试环境必须做严格的沙盒隔离,网络访问权限、底层激励机制的设计都要提前经过安全审查,用硬性规则守住行业底线。
只是AI技术的迭代速度实在太快,留给出规则、补漏洞的时间,可能真的不多了。


评论