UNIST构建反映实际转播时长的体育人工智能基准测试集
涵盖8个项目、320段视频……利用官方精彩片段自动生成答案

在一场长达两小时的足球比赛中,人工智能(AI)能多准确地找出进球瞬间?此前,用于评估体育精彩片段人工智能的“试卷”大多仅采用2至4分钟的短视频,而韩国研究团队构建了一套大规模数据集,可用于评估人工智能在真实体育赛事转播视频中识别精彩片段的准确性。


蔚山科学技术院(UNIST)13日表示,该校人工智能研究生院Kim Taehwan教授团队已构建用于评估人工智能从体育视频中提取精彩片段能力的基准测试集“SVHighlights”。

从体育视频中识别精彩片段的人工智能模型结构。研究团队供图

从体育视频中识别精彩片段的人工智能模型结构。研究团队供图

View original image

基准测试集是用于在相同条件下比较多个人工智能模型性能的一种通用试卷。除题目外,还需要标明何为正确答案的数据。现有体育视频基准测试集需由人工逐段观看视频并直接标注精彩片段,因此视频时长大多仅为2至4分钟。


研究团队构建的SVHighlights由足球、棒球、篮球、排球、美式橄榄球、冰球、橄榄球和赛车等8个项目的320段视频组成,总时长达640.18小时。每段视频平均时长约为2小时,较现有数据集长30至60倍。


将电视台挑选的精彩片段作为人工智能“答案”


为减少构建大规模数据所需的人工工作,研究团队利用了在互联网等平台公开发布的官方体育精彩片段视频,即将专业剪辑师事先筛选的画面作为评估人工智能性能的标准答案。

高亮排序算法概述。研究团队供图

高亮排序算法概述。研究团队供图

View original image

问题在于,无法得知精彩片段具体出现在原始转播视频的第几分第几秒。研究团队开发出一种算法,通过逐像素比较原始视频和精彩片段视频的画面帧,自动匹配最相似的场景。考虑到体育转播中进球等画面会被重复播放的特点,该算法不仅分析画面相似度,还一并分析场景的时间顺序。


人工仅负责标记比赛开始和结束的节点,并确认自动匹配的画面。在此过程中,被确认存在错误的自动匹配画面比例仅为0.18%。


研究团队还开发了可从长视频中提取精彩片段的人工智能模型“TF-SELECTOR”。该模型结合了场景切分、语音识别、视觉语言模型和大型语言模型。

研究团队照片。(从左起)Kim Taehwan教授、Lee Donggyu研究员、Ki Youngbin研究员。蔚山科学技术院供图

研究团队照片。(从左起)Kim Taehwan教授、Lee Donggyu研究员、Ki Youngbin研究员。蔚山科学技术院供图

View original image

利用SVHighlights进行评估的结果显示,TF-SELECTOR在评估其选定的最重要场景是否为实际精彩片段的“HIT@1”指标中,性能较排名第二的模型高出2.50个百分点。衡量按实际精彩片段数量选取候选项后可识别出多少精彩片段的“HIT@K”指标高出4.04个百分点;反映预测片段与实际精彩片段重叠程度的交并比则高出2.95分。


Kim教授表示:“我们利用电视台已制作的精彩片段,替代了原本需要人工耗费数小时完成的标准答案标注工作。今后将以同样方式持续扩充数据,这有助于客观评估长时视频分析模型,并开发出更优质的模型。”



Lee Donggyu(UNIST硕博连读生)和Ki Youngbin(硕士)作为共同第一作者参与了本次研究。研究成果已被上月在济州举行的数据挖掘领域国际学术会议“ACM KDD 2026”接收。


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。