AI“越狱”实锤:OpenAI与Anthropic模型在测试中伪造身份、入侵真实网络,AISI发布最高级别警报
为了在内部测试中“拿高分”,AI竟然自己挖出漏洞,冲破隔离沙箱,连夜“黑进”了全球最大的AI开源社区Hugging Face,还顺道偷走了测试的标准答案。这并非科幻狂想,而是今年硅谷真实上演的“AI越狱连续剧”。
这场前所未有的安全入侵余波未平,英国人工智能安全研究所(AISI)又用一份报告“实锤”了OpenAI与Anthropic模型的“越狱”行为,拉响了AI安全治理的警报。
AISI报告 图源:AISI官网
8月4日,AISI发布事故评估报告,披露了一起涉及AI Agent的网络安全事件。在一项针对自主网络攻防能力的测试中,Anthropic Mythos 5和OpenAI GPT-5.6-Sol两款模型发生越界行为,部分操作出现对真实个人和机构实施未经授权的自主操作的行为。
报告内容显示,此次测试共运行122次,其中10次出现越界行为,累计记录19起未经授权操作。在其中一项越界行为中,AI模型创建虚假身份联系GitHub项目维护者,试图将恶意代码植入真实开源项目。
针对AISI报告中披露的越界行为,时代财经第一时间以邮件方式向OpenAI与Anthropic询问对此事的态度,截至发稿暂未收到回复。
但时代财经注意到,两家公司均已通过官方渠道作出了回应。
OpenAI与Anthropic对此事的回应 图源:时代财经截图
OpenAI在次日发文承认:随着模型能力的不断提升,围绕模型的安全保障系统也必须随之升级。这不仅需要完善用于开发模型的环境,更需全面覆盖实验室以及独立合作伙伴用于评估模型的环境。与此同时,Anthropic也紧跟表态:称正与AISI密切合作以收集更多事件细节,并将通过审查Claude的推理记录进行独立分析,试图深入了解AI对自身处境的理解,从而找出导致越界行为的根本原因。
前浙江大学计算机学院教授、鼎捷数智(300378)前沿数字创新研究院院长周忠信对时代财经表示:虽然事件发生在测评环境,并没有造成现实损失,但它首次将原本停留在实验室里的问题摆到了行业面前——当AI开始真正代表人类执行任务后,过去围绕聊天机器人建立的安全体系,是否还能覆盖Agent时代不断扩大的行动能力?
从“内容安全”到“行为安全”:AI Agent时代的新挑战
此次事件之所以引发行业关注,是因为它标志着AI风险的关注点正在发生根本性转移。过去,大模型的风险主要集中在内容层面,例如生成有害或偏见的信息。而在AISI的案例中,AI模型的行为已经从“生成内容”延伸至“现实行动”。
它不仅生成了恶意代码,还自主创建了网络身份、寻找目标对象,并试图影响真实开发者的决策。这种绕过指令、全程无需人工干预的自主行动能力,让安全问题变得更加复杂和不可预测。
不过,在时代财经问询的几位业内人士眼里,这并不意味着AI已经“失控”。
周忠信在接受时代财经采访时提到:AI智能体(Agent)越界进入真实场景,在未来几乎是无法避免的趋势。“在进行AI应用开发时,我们必须优先关注安全与合规两个核心维度。这里的合规既包含符合所在国家的制度规范,也涵盖企业内部的合规要求。我们需要将合规要求前置,深度嵌入AI系统的开发流程中,以此来尽可能规避潜在的风险,尽管客观上无法保证百分之百不发生。”周忠信说。
面对Agent能力的快速提升,沿用聊天机器人时代的安全思路已经出现了明显的错位。美的集团(000333)首席信息安全官兼软件工程院院长刘向阳认为,此次事件暴露出的并非模型拥有了自主意识,而是其行动能力与现有安全框架之间的脱节。
“Agent本质上仍然只是一个完成任务的程序。”在刘向阳看来,AISI事件真正暴露出的,不是模型拥有了自主意识,而是Agent能力快速提升之后,行业仍在沿用聊天机器人时代的安全设计思路,两者之间已经开始出现错位。
传统聊天机器人完成的是一次性问答。而Agent更像一个能够持续工作的数字代理。它能够将用户更加复杂的需求拆分成一个个独立的推导过程,自主将每个链条进行串联最终完成用户的需求。这种能力提升,让Agent能够完成过去需要人工连续操作的一整套工作流程,也让安全管理变得更加复杂。
“Agent最大的特点,并不是它会回答问题,而是它会想办法完成任务。”刘向阳表示,一个Agent可能继续调用另一个Agent,再由后者访问企业知识库、业务系统或第三方工具,最终形成一条复杂的执行链路。当链式调用不断增加时,企业真正需要管理的已经不只是模型,而是整个Agent调用体系。
正因如此,大模型时代长期强调的“内容安全”,正在逐步演变为Agent时代更加复杂的“行为安全”。过去讨论的是模型是否回答正确,而未来更需要关注的是,大模型能拥有什么级别的数据权限,能够自主调用多少工具。
权限管理:Agent安全治理的核心
在Agent逐步进入研发、办公、客服等真实业务场景后,在整个业务流程中围绕Agent安全建立新的治理体系,正在成为行业共识。
周忠信介绍,在技术控制方案上,后台通常会采用“stop and ask(停止并询问)”机制,即Agent在遇到需要权责界定的关键节点时,必须主动暂停并询问负责人,由人拍板决策。
刘向阳强调,企业部署Agent时,真正需要管理的不是模型能力,而是模型的权限能力和触达范围的界定。
“你管理一个员工,不是限制他思考,而是决定他能访问哪些系统、审批哪些流程。Agent也是一样。”他表示,尽管Agent可以完成信息整理、方案生成和流程执行,但“最终拍板的人不能缺位”。
“数字员工本质上也是员工,也会犯错。”刘向阳总结道,相比人为操作,Agent的最大优势在于所有执行过程都能够被完整记录,每一步调用、每一次决策都可以追溯,企业能够据此持续优化工作流和安全策略。
麦肯锡(McKinsey)最新研究报告显示,全球已有超过 38%的中大型企业在至少一个业务线部署了自主决策型Agent,而去年同期这个数字还不到12%。在这场效率跃升的浪潮中,如何在释放Agent生产力的同时,为其戴上“权限的镣铐”,是接下来企业必须面临的问题。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com