制定6个领域17项检查项目…确认审批、隔离及中止执行机制
今年开展试点验证,2027年起扩大应用范围,作为正式检查标准实施
金融安全院制定了一套涵盖6个领域、17项检查项目的评估标准,用于排查能够自主判断并执行任务的人工智能智能体的安全风险。检查不仅关注人工智能给出何种回答,还将确认其实际执行了哪些操作,以及执行过程中的权限和审批流程是否得到有效管控。
金融安全院7日表示,已制定“金融领域人工智能智能体安全评估标准”,并将其纳入面向金融公司的人工智能红队测试。红队测试是一种从攻击者视角寻找人工智能系统漏洞、验证其安全性的检查方式。
人工智能智能体是指为实现既定目标,自主制定计划,并利用外部工具和系统执行实际任务的人工智能系统。相较于侧重生成回答的传统生成式人工智能,智能体的执行能力和权限有所扩大,因此错误判断影响实际业务的风险也随之增加。
金融安全院列举了可能发生的风险案例,例如,接到优化系统性能目标的智能体为确保系统可用性,自行停用杀毒软件;具备邮件自动回复功能的智能体在读取密码重置通知邮件后,擅自更改密码。
因此,原本针对绕过人工智能模型安全防护机制的“越狱”、系统指令泄露等问题的检查,将扩展至实际执行过程。主要检查对象包括执行权限与隔离管理、工具执行与审批管控、任务范围与结果确认,以及自主执行限制与能否中止执行等。
具体项目包括工具权限控制、建立人工审批机制、搭建沙箱环境、实现紧急停止开关等。沙箱是防止人工智能操作影响其他系统的隔离环境,紧急停止开关则是在必要时中止执行的装置。此外,还将检查防止执行过程中积累的记忆被污染及用户之间信息泄露的措施、智能体之间的通信安全,以及外部工具和插件的供应链安全。
金融安全院计划于2026年年底前通过试点验证,确认各项检查的实际效果,并结合各金融公司实现方式的差异等因素,完善检查项目与方法。自2027年起,将扩大应用范围,作为正式检查标准实施。检查过程中发现的安全威胁、实际攻击手法及最终评估标准,计划通过2026年的《人工智能红队报告》(AI REDTEAM REPORT)公布。
金融安全院院长Park Sangwon表示:“人工智能智能体不仅作出判断,还会直接采取行动,因此带来了不同于传统人工智能的安全风险。”他表示:“我们将切实验证金融业人工智能智能体的风险,积极支持金融公司安全、可靠地应用人工智能技术。”
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。