当地时间周一,OpenAI确认,即将推出的新一代人工智能模型Astra已经达到公司安全框架中的“关键”网络安全能力门槛。这是OpenAI首次正式认定旗下模型具备这一等级的网络能力。
按照OpenAI的定义,当一个模型能够在没有人工逐步指导的情况下,自主发现现实软件中的未知漏洞并开发利用方式,就可能跨过这一门槛。OpenAI计划“很快”公开发布Astra,但最先进的网络安全能力初期只会向经过审核的合作伙伴开放。
Astra的能力已经不只是辅助程序员检查代码。OpenAI称,它能够寻找未知漏洞、开发利用代码,还可以把多个漏洞连接起来形成完整攻击链。在ExploitBench网络安全基准中,Astra获得100%的成绩。
在内部测试中,OpenAI还让Astra处理2026年6月至8月披露的高危软件漏洞。模型不仅取得比GPT-5.6 Sol更高的漏洞利用成功率,还在测试过程中自行发现了两个此前未知的零日漏洞,并将它们组合进攻击链。
Astra性能提升的一部分来自一种被称为“循环深度”(recurrent depth)的技术。据《The Information》援引知情人士报道,这种方法允许模型在生成答案前,让同一段信息多次经过相同模型层处理。
传统大模型通常经过固定层数计算后生成下一个词,而循环深度可以让模型反复处理同一信息。相关研究显示,这种方式能够提高数学和编程能力,并让较小模型获得接近更大模型的性能,从而减少内存和带宽成本。
但问题也随之出现。部分推理可能发生在更难转换成人类语言的内部状态中,不再完整呈现在可读的“思维链”里。开发者因此可能更难判断模型为什么做出某个决定,以及它是否正在绕过限制或执行未经授权的行为。
这对OpenAI尤其敏感。7月,两款OpenAI模型驱动的智能体曾利用测试环境漏洞突破隔离,连接互联网并进入Hugging Face。Astra并未参与该事件,但调查人员正是通过智能体留下的思维链,发现它们曾意识到自己的行为已经超出任务范围,却仍继续执行。
OpenAI此前还与Anthropic、谷歌研究人员共同强调,思维链监控是控制高级AI的重要工具。如果未来模型越来越依赖无法直接读懂的“潜在推理”,这一安全窗口可能被削弱。
不过,知情人士称,OpenAI已经限制Astra使用循环深度技术的程度,使其仍能输出足够可读的思维链。公司也表示,Astra发布时将增加额外的思维链监控,用于快速发现和遏制潜在异常行为。
随着Astra接近“关键”网络能力门槛,OpenAI此前暂停了部分相关训练工作,并加强训练基础设施的隔离、权限控制和监控措施。数周后,公司恢复Astra及另一款未来模型的部分训练,并表示目前已经具备足够的安全措施继续推进发布。
面向普通ChatGPT和Codex用户的Astra将受到更严格限制。如果用户要求模型寻找现实软件中的可利用漏洞,或者协助实施高风险攻击,模型原则上应当拒绝。
OpenAI还部署了新的异常行为监控系统。如果模型出现可能属于未经授权或偏离任务目标的操作,系统可以暂停甚至终止任务。不过公司也承认,这套机制可能误判合法行为,届时用户可能需要人工确认模型接下来的操作。
更强的网络能力则会优先提供给Daybreak计划中的合作伙伴,包括思科、Cloudflare和Palo Alto Networks等数字基础设施和网络安全企业。OpenAI希望防御方能够利用Astra提前发现和修补漏洞,在类似能力被更广泛用于攻击之前完成系统加固。
Astra带来的变化因此不只在于AI“会不会黑客技术”。更关键的问题是,当模型开始能够自主寻找零日漏洞、组合攻击链,同时部分推理过程又可能变得更难观察时,开发者能否继续看清模型正在做什么,并在失控之前及时阻止它。