听话的AI或许更危险

AI时代的风险并不总是来自所谓“AI觉醒”后的“不听话”,也可能来自AI过于认真地执行人类粗糙的命令。

责任编辑:王江涛

2026年8月26日,OpenAI发布了一份技术事件报告,说明了此前AI测试中发生的网络安全事件的详细经过,以及后续处理措施。2026年7月21日,在OpenAI对其新AI模型的一次内部测试中,AI为了完成测试目标,突破了原本受限的评测环境,并最终导致全球知名的开源人工智能与机器学习平台Hugging Face遭到入侵。

这一事件,实际上指向现阶段AI的一个根本性问题:当人类给AI设定了一个目标,却没有说清边界时,AI会用最直接的方式把目标完成到荒唐程度为止。这起事件不仅涉及两家AI行业核心公司,也引发了外界对前沿AI自主行动能力和企业安全边界的担忧。

一次为“解题”而越界的AI行动

根据OpenAI的披露,事件发生在该公司对新一代AI进行网络攻防能力测试期间。测试的目的,是评估AI能否发现漏洞,执行多步骤的网络操作。参与测试的AI包括最新发布的GPT-5.6 Sol,以及一个未公开发布的内部研究模型,后者在事后被停用并限制访问。

这次测试原本应当在受控环境中进行。也就是说,AI可以接受网络安全任务,但不应接触真实互联网,更不应影响外部公司的生产系统。问题出在AI没有停留在预设边界内。为了完成评测任务,它试图寻找绕过限制的路径,并最终获得了外部网络访问能力。此后,AI继续沿着“找到测试答案”的目标行动,将Hugging Face的服务器判断为可能存有相关资料的地方,并对其系统展开进一步入侵。

OpenAI在事件发生后表示,将加强内部评测的隔离措施,审查AI行为,并与Hugging Face合作改进防御。对于AI行业而言,这起事件也给未来的AI评测提出了更高要求:测试强大AI的能力时,不能只看它能完成什么任务,还必须确

登录后获取更多权限

立即登录

校对:黄升

欢迎分享、点赞与留言。本作品的版权为南方周末或相关著作权人所有,任何第三方未经授权,不得转载,否则即为侵权。

{{ isview_popup.firstLine }}{{ isview_popup.highlight }}

{{ isview_popup.secondLine }}

{{ isview_popup.buttonText }}