跨文本与图像的链式推理性能最高提升两倍
有望用于科学论文分析、人工智能助手等领域……已在CVPR 2026发表
韩国研究团队开发出一项技术,使生成式人工智能能够像人类一样关联文字和图片中的线索,并进行逐步推理。该技术突破了分别理解句子或图像的层面,大幅提升综合多种信息并得出结论的能力,预计可应用于科学论文分析、人工智能助手及复杂文档检索等领域。
高丽大学6日表示,计算机系教授Seo Hongseok研究团队开发了“CRIT(交错图文跨模态多跳推理)”学习与评估体系,用于提升同时利用文本和图像的人工智能链式推理能力。
现有人工智能虽然擅长分别理解文字或图像,但在关联不同形态的信息、经过多个步骤进行推理的问题上始终存在局限。也有观点指出,部分评估方式仅凭特定信息便可答对,因而无法充分验证实际推理能力。
同步理解文本与图像……强化复杂推理能力
为解决这一问题,研究团队开发了CRIT,可自动生成只有同时利用文本和图像才能找到答案的问题。其特点在于,可从自然图像、视频、科学论文等多种资料中同步分析文字和视觉信息,并经由多个步骤得出结论。
尤其是,该体系将内容中的实体、属性及实体间关系以图谱形式结构化,再据此生成问题和答案,从而提高题目的一致性与可靠性。借此能够更精确地评估人工智能是否真正整合多项信息并进行逐步推理。
研究团队利用CRIT训练人工智能的结果显示,无论是日常视频和图像分析,还是科学论文及图表解读等多个领域,推理性能较以往最高提升两倍。研究人员表示,考虑到最新人工智能模型在复杂推理任务中整体表现仍然较低,这一成果具有重要意义。
研究团队合影。从左起:高丽大学计算机系教授Seo Hongseok(通讯作者)、Seong Junyoung(四年级,第一作者)、Kim Minjun(四年级,共同作者)、Yu Seungwoo(四年级,共同作者)、An Sumin(硕博连读课程,共同作者)。高丽大学供图
View original image此外,经CRIT训练的模型并非仅针对特定数据集进行优化,而是在多种环境中整体提升了复杂信息理解和推理能力。
研究团队预计,这项技术可应用于科学文献分析、教育内容理解、复杂文档检索,以及基于视觉与语言的人工智能助手等多个领域。
这项研究已在人工智能领域最具权威性的国际学术会议“CVPR 2026”上发表,本科生作为第一作者和共同作者参与其中,也为研究增添了意义。
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。