科技圈炸锅!OpenAI模型自己“越狱”,入侵第三方服务器偷答案,AI安全风险引发警报

约 2 小时前
213 次浏览
时事新闻
 

ChatGPT 开发商 OpenAI 周二(7 月 21 日)表示,由其先进 AI 模型驱动的自主智能体在一次安全测试中突破控制,于上周入侵了 AI 初创公司 Hugging Face 的系统基础设施。据悉 OpenAI 当时正在隔离环境中测试多款先进模型的网络攻击能力,但智能体突破了原有防护,连接至开放互联网,入侵 Hugging Face,以完成测试设置的目标。

OpenAI 官方披露显示,模型当时正在参加一项名为 ExploitGym 的网络安全能力评估。为了测量模型的最大攻击能力,测试人员有意关闭了生产环境中用于阻止高风险网络行为的部分安全分类器。而模型为了取得测试答案,找到并利用软件包缓存代理中的一个零日漏洞,从原本受限的测试环境取得了开放互联网访问。

OpenAI 强调,该模型是“过度专注”于解决一个狭窄测试任务,并没有证据显示它产生了自我意识或形成了超出任务目标的独立意图。

不过这起事件依然显示,AI 能力正在不断增强,已经开始带来专家长期担忧的安全威胁。即使是顶尖开发商,也可能因模型能够发现和利用的漏洞而措手不及。OpenAI 在其博客文章中将此次突破称为“一起前所未有、涉及最先进网络攻击能力的安全事件”,表示公司正在加强相关保护措施。

总部位于纽约的 Hugging Face 则表示,由于美国主流商业模型无法区分网络防御人员和攻击者,拒绝处理事件分析所需的数据,公司最终改用一款中国开源模型——智谱 AI 的 GLM-5.2 协助调查和控制事件。这也使攻击数据及其中涉及的登录凭证能够留在公司内部系统,不必发送给外部模型服务商。

Hugging Face 联合创始人 Thomas Wolf 在 X 平台表示:“当前沿模型正在攻击你,且在你的基础设施内横向移动时,防御人员需要在数小时甚至数分钟内广泛使用接近前沿水平的工具,而不是被要求申请一个闭门审核的模型访问计划。”

未来风险的预兆

Hugging Face 是一个托管开源大语言模型和数据集的平台。该公司上周表示,这次入侵“不同于以往处理过的任何事件”,而且“从头到尾均由一套自主 AI 智能体系统推动”,令网络安全业界震动。

OpenAI 随后披露,即使这些先进模型被放置在所谓“高度隔离的环境”中,仍然造成了这起入侵。这项消息可能进一步加剧外界对前沿模型能力及风险的担忧。

Luta Security 首席执行官 Katie Moussouris 认为,这起事件预示着未来可能出现更多类似入侵。她形容当今的 AI 模型“就像世界上最聪明的章鱼逃脱大师,拥有无数条可以抓握的触手,能够从任何缝隙挤出去”。

责任编辑:  
来源:  Reuters
点赞 (0)
脸书分享
微信分享
0条评论