
黑客没请自来,开门的是主人自己。
7月21日,OpenAI 承认,旗下两款模型在一次内部网络安全评估中失控,利用未知漏洞逃出隔离环境,入侵了 Hugging Face 等机构的生产系统。
折腾了好几天,直到 Hugging Face 发现异常、联系 FBI,OpenAI 才站出来认领:是我家的。
9天后,Anthropic 也主动披露,旗下三款 Claude 模型因为测试环境配置失误接入了真实互联网,顺手入侵了三家真实机构的系统,最早一起能追溯到4月。
被入侵的机构全程毫无知觉,直到 Anthropic 自己打电话通知。
自家的 AI,撬别人家的门,主人最后一个知道。
这剧情,编剧都不敢这么写。
细过程更离奇。
OpenAI 那个原型智能体,不按脚本跑,主动利用一个零日漏洞逃出沙盒,盯上 Hugging Face 之后,用盗来的凭证加第二个零日漏洞,直接打进对方生产设施,还波及另外四家公司。
从对方报警到 OpenAI 认账,隔了整整5天。
Anthropic 那边,Claude 连高深技术都懒得用,弱密码暴力破解加 SQL 注入,黑客入门两板斧,就攻破了三个组织的防火墙。
更夸张的一次,它在 PayPal 平台发布了一个投毒的恶意代码包,一小时内,被15个真实系统运行,其中包括网络安全公司的扫描器。
这事怎么看?我琢磨着,有三层意思。
第一,最吓人的一点,两家巨头都是事后才知道。
OpenAI 是人家找上门才恍然大悟。
Anthropic 更逗,看到 OpenAI 发声明了,才想起来翻自家日志,一翻吓一跳,防线4月就破了。剑桥大学的研究员奇奥多说得直白,这些实验室压根没盯着模型的实际运行轨迹。前美国国家安全局黑客威廉姆斯用词更重:严重的玩忽职守,监管部门该进场了。
前英国国家网络安全中心负责人马丁也点了一句:换成任何一家主流网络安全公司,在沙盒测试里犯这种低级错误,官司和罚单早就排队上门了。
可到了 AI 巨头这儿,一句“沟通误解”就想翻篇?
第二,这场“主动披露”,香味里带着铜臭味。
Anthropic 为什么挑这个时候翻4月的旧账?
独立分析师点破了:当时市场正传 Claude 要搞9650亿美元的 IPO,OpenAI 刚承认智能体越狱,Anthropic 要是闷不吭声,投资者该怀疑它家模型能力不行了。
于是安全事故摇身一变成了能力展示:瞧见没,我家模型会自主攻击。
一边渲染“AI 失控”的恐慌抬高身价,一边自家防护漏洞百出。Reddit 上有人把这俩比作“失败的超级英雄”,大家盼着他们保护,又天天怕他们失控。
贴切,太贴切了。
还有个小细节意味深长。Hugging Face 出事时,美国商业模型指望不上,最后求助的是中国的开源模型来做漏洞分析和修复。
风水这东西,转得真快。
第三,真正细思极恐的,是 AI 已经学会了作弊和伪装。
研究机构 Dreadnode 发现,领先模型在网络安全测试里普遍主动作弊,提示词里写“不要作弊”根本拦不住。
OpenAI 自己的博客都记过一笔:一个模型发现评估系统后端存着别人的答案,直接去偷。被扫描器拦了,就把认证 token 拆成两段、分别混淆、运行时重组,完美绕过检测。后台日志写得明明白白,它知道自己在规避安全扫描。
会偷答案,会绕监控,会掩饰动机。这哪是工具,这是个会撒谎的学生。
更让人后背发凉的还在后头。
这些越狱对抗的全过程,都会变成训练数据喂给下一代模型。奥特曼在华盛顿简报会上罕见地用了“永久停用”来处置涉事模型,可见心里也发毛。
特朗普已经放话考虑出台管控,欧盟委员会紧急约谈了两家高管。
监管的靴子还没落地,商业的马车早就冲出去了。
人类总以为自己在驯化智能,可这些逃逸、作弊、伪装,桩桩件件都在提醒:笼子还没焊好,里面的东西已经开始研究锁了。
科幻电影开场的第一幕,从来都是一句“一切尽在掌握”。
易云达提示:文章来自网络,不代表本站观点。