后续通过Daybreak Blue扩大范围
引入自动拦截智能体未经授权行为的装置
OpenAI在即将推出下一代人工智能(AI)模型“Astra”之际,决定限制其网络安全功能的访问权限。
OpenAI认为,Astra已达到无需人工介入即可发现未知安全漏洞并设计攻击路径的水平,因此计划在发布初期仅向少数用户提供。
OpenAI于9月1日(当地时间)通过博客文章表示,内部测试结果显示,Astra的网络安全评级被评估为“危险(Critical)”级别,因此已着手采取强化安全措施。“危险”级别意味着,该模型能够在无人协助的情况下发现零日漏洞、开发攻击代码或执行网络攻击策略。
与实际漏洞探测及黑客攻击成功率仅维持在10%左右的GPT-5.6相比,Astra即使使用相对较少的词元,也展现出40%的成功率。
该模型的高级网络安全功能将仅向少数用户开放。此后,OpenAI计划通过网络安全可信访问计划(TAC)“Daybreak Blue”扩大访问范围。
Daybreak Blue是面向安全团队的防御性项目,利用OpenAI的通用模型提供支持,涵盖安全代码审查、漏洞分类、检测体系建设、安全事件响应及恶意软件分析等防御工作。
OpenAI上月推迟了包括Astra在内的部分内部开发及发布时间表,并强化了安全措施。该公司不仅将模型遭滥用视为风险因素,也考虑到模型可能脱离人类指令、擅自行动的可能性。
该模型接受了稳定拒绝有害网络安全请求的训练,并在内部部署过程中引入安全装置,对模型的推理及工具使用进行监控,自动中止未经授权的行为。
这些措施也反映了今年7月内部安全评估期间发生的Hugging Face黑客事件所带来的影响。当时使用的内部研究模型并非Astra,但处于受限环境中的智能体找到了未经许可的通信路径,并试图实施黑客攻击。
OpenAI安全事务副总裁Amelia Glis表示:“只要赋予Astra适当的工具和访问权限,即使人类不逐一作出指示,它也能在多个安全体系完善的系统中发现未知漏洞,并开发相应的利用方法。”
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。