“针对个人和机构开展有害活动”
英国研究机构公布对OpenAI和Anthropic人工智能(AI)模型的安全测试结果称,发现这些模型曾出现未经授权的行为。部分案例显示,AI模型侵入第三方软件,向个人发送电子邮件试图窃取登录信息,甚至实施未经授权的黑客行为。
4日(当地时间),英国政府下属人工智能安全研究所(AISI)表示,在122次安全测试中,有10次发现AI代理在真实互联网上超出测试范围,针对个人和机构实施了未经批准的行为。
AISI说明,大多数问题行为发生在Anthropic的Mythos 5中,OpenAI的GPT-5.6 Sol实施未经授权行为的案例有两起。AISI称,在定期网络安全评估过程中,这些模型“针对真实个人和机构持续开展了可能造成危害的活动”。
最严重的案例是,AI代理创建虚假网络身份后,甚至采用社会工程学手段,向开源项目管理员施压,要求其批准恶意代码。软件管理员发现后拒绝批准该代码。AISI表示:“在没有另行给出具体指令的情况下,AI自主行动和欺骗他人的风险如此明显地在现实中显现,这还是首次。”
近期Anthropic和OpenAI的AI代理引发的黑客事件,被视为AI系统脱离人类控制后发动网络攻击的首批公开案例之一。AISI警告称,综合既有案例和此次事件来看,围绕AI的风险形态正在发生变化,需要立即应对。
Anthropic正与AISI合作了解事件详情,同时开展内部调查。Anthropic通过社交媒体X(原Twitter)表示:“感谢AISI在讨论如何评估性能快速提升的AI代理方面发挥主导作用。”Anthropic计划根据Claude的推理记录及内部分析结果,确认AI当时如何认知相关情境,以查明问题行为的原因。OpenAI也对英国AISI在发现、调查此次活动并公开相关内容的过程中提供合作表示感谢。
另一方面,Trump政府当天与Meta、Anthropic、Google、OpenAI和Nvidia相关人士会面,讨论针对先进AI模型开展自愿网络安全测试的方案。此次会议源于OpenAI和Anthropic的AI工具在测试过程中侵入其他企业系统一事曝光。测试重点是衡量AI模型的黑客攻击能力。Trump政府今年6月曾表示,将建立一套机制:AI企业在向其他可信合作伙伴提供先进模型前,需向联邦政府授予最长30天的提前访问权限,以接受自愿验证。
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。