光州科学技术院以4996组图像评估人工智能“变化理解能力”……GPT-5.2得5.72分,人类得7.45分

人工智能(AI)虽然已能生成比人类更自然的句子,但其判断两张照片之间发生了什么变化、哪些变化更为重要的能力,仍明显不及人类。如今,一项新的评估标准也已出台,用于衡量AI在灾害监测、自动驾驶等不仅要识别物体、更要判断“符合情境的变化”的场景中的局限性。

C3-Bench概览。在自然场景、遥感影像、图像编辑、异常检测4个领域下,构建道路、建设、灾害、资源开发、产品缺陷等51种变化情境,综合评估针对各情境的变化说明能力。研究团队供图

C3-Bench概览。在自然场景、遥感影像、图像编辑、异常检测4个领域下,构建道路、建设、灾害、资源开发、产品缺陷等51种变化情境,综合评估针对各情境的变化说明能力。研究团队供图

View original image

光州科学技术院(GIST)14日表示,Kim Euihwan人工智能学系教授团队开发了“C3-Bench(情境感知变化描述基准,Context-Aware Change Captioning Benchmark)”,用于评估AI能否比较两张图像,并在给定情境下找出重要变化并作出准确说明。


C3-Bench并非评估AI在图像中发现了多少差异,而是一种“AI变化理解能力测试”,考察其是否理解“当前应关注什么”,并据此筛选出相应的变化。


例如,即使比较的是同一组铁路照片,正确答案也会因目的而异。若是在观察天气变化,那么积雪增加或云层减少便很重要;但若是检查铁路安全,新出现在轨道上的列车才是核心,天气变化则可能并不重要。

因语境而异的“正确答案变化”示例。同一组铁路图像中,从天气角度看,雪和云层变化是关键;从铁路安全角度看,轨道上出现的列车才是关键变化。研究团队供图

因语境而异的“正确答案变化”示例。同一组铁路图像中,从天气角度看,雪和云层变化是关键;从铁路安全角度看,轨道上出现的列车才是关键变化。研究团队供图

View original image

现有评估数据往往聚焦于特定场景或变化,或未明确不同情境下应重点关注什么,因此即使AI在某项测试中得分很高,也难以判断其在真实环境中能否准确找出所需的变化。


以51种情境检验AI“真正的理解能力”


研究团队从自然场景、卫星及航空等遥感影像、图像编辑、异常检测等4个领域中选取了51种现实情境,收集由人工直接描述变化内容的4996组图像对,构建了C3-Bench。


针对每种情境,团队分别设定了AI应当找出的变化、应当忽略的差异,以及描述变化时须遵守的标准。评估并非让AI看到同一组照片后随意罗列显眼差异,而是检验其是否根据给定目的正确筛选出了相应变化。


评估方式也有所改变。该方法不再仅比较AI答案与标准答案中包含了多少相同词汇,而是综合评估内容的准确性、具体性、语句自然度及情境相关性。研究团队开发的评估方法所得结果,比既有自动评估方式更接近人工直接评估的结果。

最新AI GPT-5.2的典型错误案例。从左至右依次展示遗漏物体或属性的感知错误、误解位置关系的空间错误、图像顺序颠倒后说明相互矛盾的不一致错误,以及只能识别单一方向变化的变化崩溃错误。红色文字为错误说明部分。研究团队供图

最新AI GPT-5.2的典型错误案例。从左至右依次展示遗漏物体或属性的感知错误、误解位置关系的空间错误、图像顺序颠倒后说明相互矛盾的不一致错误,以及只能识别单一方向变化的变化崩溃错误。红色文字为错误说明部分。研究团队供图

View original image

文字虽自然,“变化理解能力”仍落后于人类


研究团队依据这一标准,分别向人类和GPT-5.2展示400组图像对,并要求其说明变化。在涵盖准确性、具体性、自然度和情境相关性的10分制综合评估中,人类平均得分为7.45分,GPT-5.2为5.72分,差距达1.73分。


值得关注的是语句自然度。在该项目中,GPT-5.2以8.53分反而高于人类的8.32分。这意味着,AI生成看似合理、自然的说明的能力,与其在真实场景中准确理解重要变化的能力,可能并非一回事。


在调换照片顺序的实验中,差距进一步扩大。若第一张照片中不存在的物体出现在第二张照片中,AI应说明“物体出现了”;调换两张照片的顺序后,则应将同一变化表述为“物体消失了”。


研究团队以“可逆性(Reversibility)”指标对此进行测量,结果显示人类达到93%,而GPT-5.2仅为61%。这表明,即便AI能够识别照片中的变化,在连贯理解变化方向方面仍存在局限。

研究团队照片。从左起,Kim Euihwan,人工智能学系教授;Kim Jaewoo,硕博连读生。GIST供图

研究团队照片。从左起,Kim Euihwan,人工智能学系教授;Kim Jaewoo,硕博连读生。GIST供图

View original image

AI出错的最大原因是基础视觉识别问题。全部错误中,63.3%源于未能正确识别照片中的物体,或错误判断其类别及特征。此外,也存在将不重要的差异认定为重要变化,或错误说明变化含义及位置关系的情况。


Kim Euihwan教授表示:“本次研究系统地表明,AI‘自然说明的能力’与‘准确理解符合情境的变化的能力’并不一定相同。期待C3-Bench能够成为评估和改进AI变化理解能力的共同基础,应用于灾害及事故现场变化监测、利用卫星与航空影像开展的遥感、自动驾驶、异常检测等多种真实环境。”



本项研究由Kim Euihwan教授指导、Kim Jaewoo硕博连读生作为第一作者参与,已入选计算机视觉与机器学习领域主要国际学术会议“欧洲计算机视觉会议(ECCV)2026”。


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。

不容错过的热点