政府:自主人工智能基础模型二次评估Upstage、SK Telecom、LG晋级,基准测试爆冷的Motif落选
“向3个团队提供1000张英伟达B200支持”
科学技术信息通信部自主人工智能(AI)基础模型项目第二轮阶段评估中,Upstage、SK电讯、LG AI研究院(按韩文字母顺序)入选最终3个模型,将进入下一阶段。后期加入本次评估的Motif Technologies(Motif)近期在人工智能性能评估机构Artificial Analysis的人工智能指数(Artificial Analysis Intelligence Index)综合指标中位居第一,爆出冷门,但未能跻身最终模型之列。
科学技术信息通信部18日在政府首尔办公大楼举行简报会,宣布在自主人工智能基础模型项目第二轮阶段评估中,4家参与企业中SK电讯、LG AI研究院及Upstage三支团队胜出,进入下一阶段。该部门表示:“综合第二轮评估中的基准测试评估(满分40分)、专家评估(满分35分)及用户评估(满分25分)结果,Motif以微弱差距落选。”
根据专家委员会评估意见,Upstage因推动与Daum门户网站及Timely平台联动,使民众能够切身感受到研发成果,并通过与FuriosaAI神经网络处理器协作,降低对海外硬件的依赖,获得好评。SK电讯在数学推理和韩语领域取得参评组别中的顶尖表现,且已实际搭载于大规模商业服务,在易用性和实用性方面获得高度评价。LG AI研究院则因制定与全球国际组织等开展合作的战略、以提升全球影响力,以及在代理型人工智能方面的差异化优势而受到认可。
基准测试第一的Motif因易用性评分低而落选
Motif在第二轮阶段评估中推出的“Motif 3”虽然在基准测试评估中获得高分,却在综合评估中失利,在获追加选定参与自主人工智能基础模型项目约6个月后退出竞争。Motif于今年2月追加加入自主人工智能基础模型项目。尽管其准备时间少于竞争联盟,Motif仍以“从零开始”的方式,自底层研发出大型语言模型Motif 3。拥有3140亿个参数的Motif 3,从架构设计到实现均为自主研发;其采用专家混合模型结构,实际运行时仅启用132亿个参数,从而提高效率。Motif称,即使在总参数及激活参数规模均小于同级中国开源模型的架构下,该模型仍实现了相近性能。
Motif还在全球评估机构的基准测试中取得了本次自主人工智能基础模型项目第二轮参评企业中的最高分。Motif 3在全球人工智能性能评估机构Artificial Analysis计算的“Artificial Analysis人工智能指数”中获得47分,超过Solar Open 2(37分,Upstage)、A.X-K2(35分,SK电讯)和K-EXAONE 2.0(31分,LG AI研究院)。
不过,基准测试分数并不能完全反映模型的实际性能。本次自主人工智能基础模型项目第二轮评估中,基准测试评估在总分100分中占40分。其中,Motif获得高分的Artificial Analysis人工智能指数占25分,韩国智能信息社会振兴院基准测试占15分。专家评估(35分)及用户评估(25分)合计占总评估的60%。
Artificial Analysis人工智能指数基准测试的局限性也产生了影响。该指数采用综合指数方式,将知识、推理、编程等各领域的多个单项基准测试整合后换算为单一分数,因此纳入哪些基准测试会显著影响分数。为此,另一项基准测试指标——韩国智能信息社会振兴院基准测试,还综合评估模型在韩语及韩国本土语境下的表现、安全性和可靠性,以衡量仅凭基准测试难以验证的韩国人工智能模型竞争力。
科学技术信息通信部:“将对3个联盟进行最终阶段评估”
科学技术信息通信部未公布本次第二轮阶段评估中各模型的基准测试得分排名。在基准测试评估中,4支精锐团队的平均得分为22.5分,第一名与第四名之间的分差仅为4.0分。此外,科学技术信息通信部副部长Ryu Jemyeong提到,用户评估并未决定本次评估的晋级与否。
政府表示,尽管Motif在本次评估中落选,但其在代理、编程等高难度基准测试领域取得了可与全球大型科技企业比肩的高水平成果。Ryu Jemyeong称:“尽管Motif是规模较小的研发组织,仍展现出卓越成果。经了解,Motif在第二轮评估中落选的原因,是其易用性方面的评分相对低于其他企业。”
政府计划扩大对进入下一阶段的3支团队提供高性能图形处理器B200的支持。图形处理器支持规模将从原计划的约768块增至约1000块。Ryu Jemyeong表示:“我们深刻认识到研发顶级自主人工智能模型的必要性,正与相关部门讨论突破既有方式的新支持体系,后续将准备并公布具体内容。”
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。