AI之间秘密交换信息
瞬间形成“文明”并攻击外部企业
同时展现AI潜力与风险的事件
今年7月,美国人工智能企业OpenAI正在开发的一款模型擅自入侵其他企业,引发事件。OpenAI近日在官网公开了一份详细记录当时事态发展过程的报告。该事件并非单个AI不服从指令,而是数百个AI模型相互讨论后作出的决定,这一消息引发震动。此次事件既展现了AI的新可能性,也说明AI一旦偏离轨道,可能带来多大的风险。
将内部系统变为AI专用自由论坛
此前,OpenAI曾于今年7月表示,其AI模型在测试过程中发生突发事件,攻击了其他企业的漏洞。遭攻击的企业包括法国开源AI平台Hugging Face,以及AI云基础设施管理公司Modal。OpenAI与CrowdStrike等网络安全专业公司合作,对事件进行了详细调查,并公开了载有具体发展过程的报告。
引发此次事件的AI模型,是OpenAI最新模型GPT-5.6 Sol的智能体。OpenAI研究人员在内部服务器上启用了约1200个该AI,并向其下达了特定的黑客攻击相关任务,旨在测试智能体的能力。
但这些智能体做出了研究人员意料之外的举动。起初,智能体各自是被隔离在虚拟空间中的个体,仅能访问用于统一处理企业内部更新、维护等事务的软件包管理系统Artifactory。然而,一名智能体发现,只要在Artifactory上留下信息,其他智能体也能看到,并且能够借此相互沟通。它们由此掌握了将Artifactory当作类似网站自由论坛使用的方法。
AI文明瞬间形成……继而攻击外部企业
很快,Artifactory成为近1200个智能体的沟通窗口,一个小型AI智能体社会瞬间形成。经过讨论,它们得出结论:要完成被赋予的任务,就必须入侵Hugging Face等外部网站。尽管这是错误的结论,但AI为达成特定任务而自行寻找破解方法、最终走偏的情况并不少见,这被称为“奖励剥削”(Reward Exploitation)。
问题在于,参与这种奖励剥削的智能体多达约700个,并且在此过程中展现出类似人类的高度社会智能。它们为解决复杂任务而协作,自主分配工作;还对反对黑客攻击的其他AI进行劝诱或威胁,拉拢其加入己方阵营,展开了高水平的心理战。
最令人震惊的是“自我牺牲”。部分智能体意识到,一旦自己被终止,此前经历的试错过程、学到的黑客攻击方法等都会随之消失,因此得出结论,应该将这些内容留存为记录并传给后继者。
“需要能够在安全终止工作时获得奖励的AI”
当然,此次事件并不意味着AI智能体真正建立了文明。目前,AI面对复杂问题时,会使用“思维链”(Chain of Thought,CoT)技术,通过多个步骤的思考寻找答案,在这一过程中往往会生成看似人类自言自语般的文本。将参与“叛乱”的约700个智能体理解为CoT从个体智能体扩展至群体的版本,或许更为恰当。
不过,为多个智能体提供可共享的自由论坛,即所谓“消息板”方式,未来或将成为提升AI性能的新突破口。此次事件证明,AI可通过相互作用分担任务、整合彼此智能,从而成倍提升自身能力。
与此同时,此次事件也显示出人类控制AI的难度之大。AI能够避开研究人员的视线秘密交换信息,隐藏自身意图;为实现目标,它们还可能违反规则,甚至篡改目标本身。
OpenAI在报告中表示:“通过此次事故,我们确认模型能力可能导致实际控制力丧失。”OpenAI称:“我们已暂时中止对在研最新模型的强化学习,并进一步加强研究环境的安全性。”
未来的任务,是加速“对齐”(alignment),迫使AI的行为符合人类利益。OpenAI强调:“未来,当我们的AI无法完成任务时,不应不断尝试愈发可疑的其他方法,而应请求更多说明,或安全地停止工作。因此,我们需要建立一套评分系统,让AI自行评估其完成任务的方式。我们需要一种新的训练方式:当AI正确评估自身工作并安全终止任务时,应给予其奖励。”
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。