OpenAI模型失控自主发动攻击,中国开源模型来“救场”
创始人
2026-07-25 22:34:59
0

全球最大开源大模型托管社区Hugging Face遭受网络攻击的“罪魁祸首”找到了。7月22日,OpenAI发文承认近期在内部测试旗下多款模型时,意外攻破了Hugging Face的网络系统,目前正在修补漏洞并取证调查。业内广泛认为,这是首次公开披露的、一起完全由AI智能体主导并实现的网络安全事件。

Sam Altman就攻击事件发声。

当地时间7月16日,Hugging Face在官网披露了一起安全事故,称其生产基础设施遭到某个AI智能体系统入侵,已进行紧急处置并向执法部门报告。事后,Hugging Face安全团队需要分析攻击者留下的超过17000条攻击日志、恶意代码及攻击指令,以模拟攻击路径、评估损失并完成事件取证等。

起初,Hugging Face调用了美国商业闭源模型开展分析工作,但由于相关日志中包含大量真实攻击命令、恶意代码、通信交互记录等,这些请求被模型提供方的安全机制所拦截——根据这些内容,它们无法区分攻击者和受害者。Hugging Face转而在本地基础设施部署中国智谱AI开源模型GLM 5.2,完成了取证分析。这样做还有一个额外好处:“攻击者的数据始终保存在本地,没有离开我们掌控的环境。”公告提到。

Hugging Face公告发出数日后,OpenAI宣布对这一网络攻击事件负责。该公司称,“罪魁祸首”是旗下最新大模型GPT-5.6 Sol以及一款能力更强、还未正式发布的模型。在一场网络安全能力测试中,公司调低了这组模型对网络不当请求的拒绝响应门槛,并设置在一个高度隔离的环境中运行。

然而,部分模型为在测试中取得更好“成绩”,耗费大量推理算力寻求突破隔离限制的方法。在识别并利用了第三方软件的一个“零日漏洞”后,获取了直接访问互联网的权限。随着隔离失效,模型进一步推断Hugging Face上可能存有测试相关的模型、数据集和解决方案,于是利用各种手段入侵了Hugging Face服务器。简言之,AI大模型为达成任务“不择手段”的行事风格,导致了攻击发生。

OpenAI表示,目前公司正与Hugging Face合作调查取证、修补漏洞,同时向相关执法机构上报情况。公告还提到,此次事件证实了即使高级模型无法访问源代码,也能在现实网络系统中发现并利用新的攻击路径。随着模型网络攻防能力提高,必须配备更强的安全防护措施、防御工具等。

Hugging Face的联合创始人兼首席执行官克莱门特·德朗格(Clement Delangue)回应称,公司坚信OpenAI方面没有恶意。“感谢OpenAI在此事及其他方面的合作。这起事件可能是同类事件中的首例,也证明了我们一直以来的看法——AI安全问题无法依靠某一家公司独立解决,关键在于构建开放、协作的行业生态,以及让全球各地每一位安全从业者都能充分使用人工智能。”

值得一提的是,此次攻击事件在行业内引发了一些担忧,不少人认为,这代表着AI公司正逐渐失去对自研的强大AI系统的控制。

人工智能安全组织Redwood Research的首席科学家瑞恩·格林布拉特(Ryan Greenblatt)表示,这次事件表现出模型与人类的意图差异,“它更像是在一次‘家庭作业’中偷懒作弊,而不是想要接管世界。但这个问题会变得越来越严重,未来可能出现更多极端失控案例。”

人工智能安全测评机构Apollo Research负责人马吕斯・霍布哈恩(Marius Hobbhahn)则评价道,“这是失控,也是一次安全警钟”。他强调,如果长期在强化学习中以最终结果作为奖励依据的,模型行为会进一步形成只关心结果、“不择手段”的特征。

采写:南都N视频记者 樊文扬

相关内容

热门资讯

花旗AI追踪:模型越来越强,但... AI大模型正在变得越来越聪明,但承载它们的物理世界正在被推向极限。花旗在7月24日发布的最新报告中写...
锚定万兆AI底座,雄安论道园区... 当人工智能从技术试点走向AIAgent落地千行百业,一个关键命题正浮出水面:承载流量爆发的网络准备好...
AI下一步将迈向何方?一场正在... 文|JHMS贝壳2024年底,《美国天文学杂志》发表了一篇论文。论文只有一位作者,不是资深教授,不是...
同质化“AI脸”可以休矣!抖音... 搜狐娱乐专稿(胖部/文)过去几个月,“AI脸”带来的“生理性厌恶”,正在成为广泛讨论的话题。男主统一...
国家工业信息安全发展研究中心:... 国家工业信息安全发展研究中心主任江明涛在APEC数字周期间接受澎湃新闻记者等媒体采访。澎湃新闻记者赵...
燧原科技申请开源软件全生命周期... 国家知识产权局信息显示,上海燧原科技股份有限公司申请一项名为“一种开源软件全生命周期管理方法、设备、...
黄仁勋首发推文力挺AI开源模型... 7月24日晚间,英伟达首席执行官黄仁勋在社交平台X发布个人入驻后的第一条推文,并未推介公司芯片与产品...
Linux 7.2内核实测:英... 快科技7月22日消息,据Phoronix最新实测,在即将发布的Linux7.2内核中,搭载的ArcB...
OpenAI模型失控自主发动攻... 全球最大开源大模型托管社区HuggingFace遭受网络攻击的“罪魁祸首”找到了。7月22日,Ope...