OpenAI官宣下一代模型Astra:能自主发现零日漏洞并发起攻击

2026-09-03 09:43:26
18444
根据OpenAI的定义,达到“关键”门槛意味着模型能够在无需人工分步指导的情况下,自主发现现实软件中的未知漏洞并开发利用方式。

当地时间9月1日,OpenAI宣布计划“很快”发布下一代AI模型Astra。由于Astra是首个达到OpenAI《准备框架》中“关键”网络安全能力门槛的模型,公司将对最先进的网络安全功能实施严格限制。

根据OpenAI的定义,达到“关键”门槛意味着模型能够在无需人工分步指导的情况下,自主发现现实软件中的未知漏洞并开发利用方式。按OpenAI框架,此前包括GPT-5.6Sol在内的早期模型上限仅设在较低的“高”等级。

Astra在漏洞利用基准测试Exploit Bench中取得100%的满分成绩。为排除模型记忆答案导致分数膨胀,OpenAI工程师使用Google V8 Java Script引擎在2026年6月至8月披露的20个高严重度漏洞建立了第二项测试。在这项内部测试中,Astra不仅取得了比GPT-5.6Sol更高的任意代码执行率,还在测试过程中自行发现了两个此前未知的零日漏洞,并将它们组合进攻击链。OpenAI正将这两个漏洞披露给相关维护方。

在实际系统测试中,Astra的表现更为惊人。该模型仅通过打开一个恶意HTML文件,就突破了浏览器沙盒并在主机上执行了指令。在另一项测试中,它成功串联了多个漏洞,从普通用户账户一路提权至获取操作系统root权限。

正是由于能力过强,OpenAI决定对Astra采取分级开放策略。高级网络安全功能最初仅向一小批测试人员开放,之后通过DaybreakBlue计划逐步向防御性“蓝队”工作开放。

OpenAI已实施多重安全防护:训练模型更可靠地拒绝有害网络安全请求;增设“不一致性监控器”识别阻止危险行为;并部署额外思维链监控机制。内部测试显示,Astra拒绝了91.5%的网络安全越狱尝试,远高于GPT-5.6Sol的59%。

不过,OpenAI也承认,这些安全护栏可能误将合法防御性活动标记为滥用。ChatGPT和Codex用户可能需要审核暂停的操作,API任务在监测到可疑行为时可能被终止。

免责声明:本文观点来自原作者,不代表天天在线的观点和立场。文章内容仅供参考、交流、学习,不构成投资建议
责任编辑:蓝羽_XN054
猜你感兴趣