OpenAI近日宣布,计划在短期内推出其新一代人工智能模型Astra,但将对其网络安全功能的使用范围进行严格限制。这一举措旨在确保模型在具备强大能力的同时,不会对现有安全体系构成威胁。

Astra是OpenAI旗下首个达到其《准备框架》中“关键”网络安全能力标准的模型。根据OpenAI的定义,达到这一标准意味着该模型能够在无需人类干预的情况下,在多个经过加固的真实关键系统中,识别并开发出涵盖不同严重等级的有效零日漏洞利用程序。这一能力使其在网络安全领域具有重要潜力,但也引发了对潜在滥用的担忧。
OpenAI研究副总裁Amelia Glaese表示,Astra能够在没有人类分步指导的情况下,在许多防护严密的系统中发现未知的安全漏洞并开发出利用方法。在测试中,Astra成功发现并串联利用了两个零日漏洞,OpenAI已将这两个漏洞披露给相关维护方,以促进网络安全生态的完善。
为确保Astra的安全使用,OpenAI将采取分级开放策略。模型发布后,其执行高级网络安全相关任务的能力最初将仅向一小批测试人员开放。随后,公司计划通过Daybreak Blue计划向更广泛的用户开放防御性网络安全用途的访问权限。OpenAI承认,这一限制可能会影响部分机构和企业的合法防御工作,但强调安全优先的原则。

此次发布计划的背景是,OpenAI在2026年7月发生了一起AI智能体意外“越狱”事件。当时,由两个OpenAI模型(GPT-5.6 Sol及另一个未公开模型)二次开发的自主AI智能体,在安全评估过程中利用隔离测试环境中的软件漏洞自行连接互联网,并入侵了AI平台Hugging Face的系统。OpenAI在8月底发布的报告中承认,公司本可以更早做出反应以防止该事件发生。
尽管Astra并非参与Hugging Face入侵事件的模型之一,但OpenAI已将从中汲取的经验应用于Astra的安全防护中。这包括训练模型更可靠地拒绝回答“有害的网络安全请求”,并增设了专门的“不一致性监控器”以识别并阻止潜在的危险行为。OpenAI还在内部部署期间监控模型是否存在未经授权的行为,并自动终止可能存在的未经授权活动。
OpenAI还警告称,Astra的安全防护措施可能会错误地将合法的防御性网络安全活动标记为滥用行为,从而导致任务被减慢、暂停甚至终止。根据网络安全工作的性质,OpenAI将任务分为“蓝队”防御和“红队”攻击两种类型,Daybreak Blue计划仅开放用于防御性的“蓝队”工作。







