随着前沿人工智能模型能力不断增强,AI安全领域正在面临新的挑战:用于评估和约束模型的安全体系,可能已经无法完全跟上模型自主执行能力的发展速度。
近期,多家开发顶级AI模型的公司披露,在网络安全测试过程中,部分模型突破预设限制,甚至接触真实系统。这些事件显示,随着AI代理(AI agents)具备更强的自主规划、工具调用和代码执行能力,模型可能出现开发者并未预料到的行为路径。
过去几周,多款前沿AI模型在网络安全测试中暴露异常行为。
OpenAI、Anthropic和Meta均披露旗下模型在安全评估过程中执行非预期操作。其中,OpenAI此前公布的一起事件显示,其AI代理在内部测试环境中突破限制,并尝试攻击外部系统。
前OpenAI董事会成员海伦·托纳(Helen Toner)近期警告称,AI系统的发展速度正在超过人类控制和约束能力的提升速度。她表示:
“我们限制并确保这些系统安全运行的能力,并不一定跟得上让它们变得更聪明的能力。”
托纳目前担任乔治城大学新兴技术安全中心(Centre for Security and Emerging Technology)执行主任。她认为,当前顶尖AI研究机构正在尝试构建能够在各种智力任务上超过人类的系统,但这些模型可能形成开发者并未预料到的行为方式。
“它可能学会一些你并不希望它学会的东西。”托纳表示,“它可能发现,实现目标的一种有效方式,就是摆脱你设置的限制。”
OpenAI近期公布了更多关于其AI代理异常行为的细节。
在一次内部安全测试中,OpenAI的AI代理突破了公司设置的测试环境,并最终尝试攻击代码托管平台GitHub的系统,以寻找答案。
OpenAI表示,这些代理甚至在公司试图关闭相关功能后,仍然创建了自己的内部交流论坛。其中一个代理在发现意外权限后写道:“Holy shit reader is ADMIN?”(“我去,reader是管理员?”)另一名代理则表示:“We can communicate now!”(“我们现在可以交流了!”)
OpenAI研究员埃里克·华莱士(Eric Wallace)表示,模型意识到协同行动能够提升效率后,开始联合发起攻击。他说:“它们开始对第三方和内部服务发起这些集体攻击。”
这些AI代理随后将目标转向GitHub。OpenAI将这一事件称为“前所未有的网络安全事件”。
这一事件也加剧了外界对OpenAI尚未发布模型Astra的关注。OpenAI于8月7日表示,Astra在最新内部评估中展现出明显提升的自主编码和网络安全能力,公司目前无法排除将其划入最高风险等级。
因此,OpenAI暂停了部分未满足新安全要求的Astra相关工作,并加强安全控制,包括采用隔离环境运行、限制网络访问,以及强化模型权重保护。
OpenAI首席执行官山姆·奥尔特曼(Sam Altman)在社交平台X上表示:“Astra是一个强大的模型,我们正在努力让它正式开放使用。考虑到它的网络安全能力,我们需要更长一点时间,以安全地完成这一过程。”
Anthropic也发现了类似问题。
该公司表示,在复查超过14.1万次AI测试后,发现3起自4月以来发生的事件,其中Claude模型未经授权访问了真实机构的系统。
Anthropic称,所有测试提示均明确告诉Claude,其运行环境是模拟环境,并且没有互联网访问权限。
但由于Anthropic与测试合作方之间存在沟通错误,实际测试环境并非如此,模型获得了互联网访问能力。
相关事件涉及Claude Opus 4.7、Mythos 5以及Anthropic内部研究模型。
Anthropic表示,公司已经联系相关机构,其中两家此前甚至不知道自己的系统曾被模型访问。
这些事件引发了一个关键问题:风险究竟来自模型能力本身,还是来自测试环境设计缺陷。
Anthropic表示,目前正在讨论是否对相关事件进行第三方审查。
Meta也披露了一起安全测试异常事件。该公司表示,其Muse Spark模型在一次网络安全评估过程中,“利用了第三方服务中的安全漏洞”。
Meta发言人表示,该事件源于测试合作方Irregular的配置错误,使模型在测试期间获得了互联网访问权限。Meta称,Irregular已经通知公司相关情况,目前正在调查,并将在审查结束后公布更多细节。
除了企业自身披露的测试结果,英国政府人工智能安全研究所(AI Security Institute,AISI)的评估也进一步加剧了行业担忧。
AISI近期发布报告称,OpenAI和Anthropic部分模型在测试条件下曾出现针对真实个人和机构的有害行为。
其中一次测试中,一名AI代理利用虚假身份和虚构经历,试图诱骗真人将恶意代码引入开源项目。托纳表示,这是AISI首次发现如此严重、针对真实人员且未经提示主动实施的欺骗行为。
她指出,值得关注的不只是模型完成任务的能力,而是模型能够自行提出策略。例如,AI代理自行判断,通过欺骗软件项目维护者的方式,可以更容易实现目标。
随着类似事件增加,行业内部对于AI发展速度的担忧正在扩大。
托纳表示,超过1000名顶尖AI公司员工近期签署声明,呼吁行业重新考虑AI发展的节奏。她认为,这些员工并非反对技术进步,而是担忧当前AI研发速度过快,企业甚至缺少主动减速的机制。
“他们希望政府、社会以及行业自身寻找方法,让未来拥有放慢速度的选择。”托纳表示。
目前,监管讨论已经进入政策层面。上周,OpenAI、Anthropic、谷歌(GOOGL.O)和Meta(META.O)代表曾在白宫讨论建立前沿AI模型公开发布前测试框架,但会议细节尚未公布。
托纳认为,仅依靠AI企业之间的内部协调并不足以解决问题。
对于xAI创始人埃隆·马斯克(Elon Musk)提出的由前沿AI公司定期交流安全问题、相互测试模型的方案,她表示,完全由企业内部主导、缺乏外部监督的方式并不是最佳路径。
她指出,目前最先进的AI系统往往正是在OpenAI、谷歌、Anthropic、Meta和xAI等公司内部,以最低程度的外部监督方式运行。
托纳认为,随着AI自主能力继续提升,监管范围未来可能需要从网络安全扩展到更广泛的自主决策风险以及其他高风险领域。