构建涵盖8个项目、320部视频、640小时的“SVHighlights”
时长比现有数据集长30至60倍,与实际转播相近
还开发了精彩片段提取人工智能“TF-SELECTOR”,备受关注
一项用于比较人工智能从体育比赛中筛选关键画面能力的技术问世,可大幅减少人工逐帧观看数小时视频并标记精彩片段的工作量。
UNIST人工智能研究生院Kim Taehwan教授团队13日表示,已开发出可评估体育视频精彩片段提取人工智能模型的大规模基准测试集“SVHighlights(Sport Video Highlights)”。
基准测试集如同以统一标准比较多个人工智能性能的“通用试卷”。其中须包含人工智能需要解决的问题,以及标明何为正确答案的数据。
现有体育视频基准测试集大多由时长约2至4分钟的短视频组成。这是因为,若由人工从头到尾检查长视频并标记精彩画面,需要耗费大量时间和成本。
研究团队以另一种方式解决了这一问题:利用在互联网上公开的体育赛事官方精彩集锦视频,将专业剪辑师已筛选出的精彩片段作为“标准答案”。
问题在于,无法得知精彩集锦中的画面分别出自原始比赛视频的第几分第几秒。研究团队开发出一种匹配算法,可自动识别并连接原始视频与精彩集锦视频中的对应画面。该方法以像素为单位比较视频帧,从而找出最相似的画面。
除画面相似度外,团队还同时考量时间顺序。体育转播中,进球或决定性场面往往会被多次回放。若仅寻找相同画面,就可能将回放画面而非实际比赛画面误选为精彩片段。
研究团队开发的SVHighlights由足球、棒球、篮球、排球、美式橄榄球、冰球、橄榄球和赛车等8个项目的320部视频构成,视频总时长达640.18小时。
每部视频平均时长约为2小时,比现有数据集长30至60倍,与实际体育赛事转播视频的规模相近。构建如此庞大数据所需的人工工作也大幅减少:每段视频仅需人工标记一次比赛开始和结束位置,再以网格形式的图像核查算法自动匹配的画面即可。在这一过程中,被确认属于自动匹配错误的比例仅为0.18%。
研究团队还开发了可从长时体育视频中提取精彩片段的人工智能模型TF-SELECTOR。该模型结合了现有场景分割模型、语音识别模型、视觉语言模型和大型语言模型。
利用SVHighlights进行性能比较的结果显示,TF-SELECTOR在多数指标上优于现有模型。用于衡量被模型判定为最重要画面是否确为实际精彩片段的HIT@1指标,比排名第二的模型高2.50个百分点;用于评估在选取与实际精彩片段数量相同的候选片段时能够识别出多少精彩片段的HIT@K指标高4.04个百分点;反映预测区间与实际正确区间重叠程度的交并比也高2.95分。
UNIST硕博连读生Lee Donggyu和硕士Ki Youngbin以共同第一作者身份参与了此次研究。
Kim Taehwan教授表示:“我们利用电视台已制作的精彩集锦,替代了原本需要人工耗费数小时完成的标准答案标注工作。”他解释称:“以同样方式可以持续扩充数据,这将有助于客观评估长时视频分析模型,并开发性能更优的模型。”
研究成果于上月9日在济州举行的数据挖掘领域权威国际学术会议——计算机协会知识发现与数据挖掘特别兴趣小组知识发现与数据挖掘会议——上被录用。数据集和代码可在研究团队的项目页面查看。
本研究获得韩国科学技术信息通信部和信息通信规划评估院“与人类交感的多模态交互人工智能技术”、“产业融合型多模态生成式人工智能人才培养项目”、“人工智能Star Fellowship支持项目”及“人工智能研究生院项目”的资助。论文题为《SVHighlights:迈向超长体育视频精彩片段检测》。
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。