自主人工智能基础模型:Upstage、SK Telecom、LG三强角逐……第三阶段评估决出最终胜者(更新)
AAII基准测试高分的Motif未能通过第二阶段评估
"向3支团队提供1000块NVIDIA B200支持"
"第三阶段评估按计划进行,选出最终2支团队"
"此后将重新审视支持方式,稍后公布"
科学技术信息通信部自主人工智能(AI)基础模型(Dopamo)第二阶段评估中,Upstage、SK Telecom、LG AI研究院(按韩文字母顺序)入选最终3个模型,晋级下一阶段。此次评估后期加入的Motif Technologies(Motif)近期在人工智能性能评估机构Artificial Analysis Intelligence Index(AAII)综合指数中位居第一,爆出冷门,但最终仍未能晋级。政府计划通过今年年底举行的第三阶段评估,选出最终2支团队。
科学技术信息通信部18日在政府首尔办公楼举行简报会,宣布在Dopamo第二阶段评估的4家参与企业中,Upstage、SK Telecom及LG AI研究院3支团队晋级下一阶段。该部门表示:“综合基准测试评估(满分40分)、专家评估(满分35分)及用户评估(满分25分)结果,Motif以微弱差距未能晋级。”
Ryu Jemyong科学技术信息通信部次官18日在首尔钟路区政府首尔办公大楼发布自主人工智能基础模型项目第二轮评估结果。2026.8.18 Cho Yongjun记者
View original image根据专家委员会的评估意见,Upstage因推进与门户网站Daum及Timely平台联动,使公众能够切实感受到开发成果,并通过与FuriosaAI神经网络处理器(NPU)的合作降低对海外硬件的依赖,获得好评。SK Telecom在数学推理及韩语领域取得了参评组别中的顶尖性能,并已实际应用于大规模商业服务,在易用性和实用性方面获得较高评价。LG AI研究院则因制定与全球国际组织等开展合作的战略、以提升全球影响力,以及其在智能体AI领域的差异化优势而受到认可。Motif虽未通过此次评估,但在智能体、编程等高难度基准测试领域取得了可与全球大型科技企业相当的高水平成果。
政府计划扩大对晋级的3支团队提供高性能图形处理器(GPU·英伟达B200)的支持。GPU支持规模将从原定约768块增至约1000块。
AAII高分的Motif未能晋级:“各评估项目差距不大”
从本次第二阶段评估的分项结果看,满分40分的基准测试评估中,4支团队的整体平均分为22.5分,第一名与第四名之间仅相差4.0分。4支团队的基准测试评估得分均未超过30分。满分35分的专家评估整体平均分为28.8分,第一名与第四名相差2.4分;满分25分的用户评估整体平均分为17.6分,第一名与第四名相差5.0分。
科学技术信息通信部未公开此次第二阶段评估各项目的得分排名。该部门副部长Ryu Jemyong解释称:“各评估项目中4家企业之间的差距均十分微小,公布第一名的实际意义不大,同时也综合考虑了对其他企业可能造成的影响。”Ryu Jemyong补充称:“在约1400人报名、最终185人参与的普通公众评估中,其结果并未对晋级与否产生决定性影响。”
Motif在全球评估机构的基准测试中取得了Dopamo第二阶段参评企业中的最高分,制造了意外,但最终仍未能晋级。Motif的Motif3在AAII中获得47分,超过Solar Open 2(37分·Upstage)、A.Dot X-K2(35分·SK Telecom)和K-EXAONE 2.0(31分·LG AI研究院)。不过,有观点认为基准测试分数并不能完全体现模型的实际性能。占评估60%的专家评估(35分)及用户评估(25分)被认为是决定晋级结果的关键。
AAII基准测试的局限性也产生了影响。AAII采用综合指数方式,将知识、推理、编程等各领域的多个单项基准测试整合并换算为单一分数,因此纳入哪些基准测试会显著影响得分。科学技术信息通信部解释称,韩国智能信息社会振兴院(NIA)的基准测试则综合评估韩语及韩国本土语境下的性能、安全性和可靠性,以衡量韩国人工智能模型的竞争力。
对于部分舆论提出的“基准测试操纵”担忧,科学技术信息通信部明确表示不存在问题。此前业内曾担忧,Dopamo参与企业中有一家公司为提高AAII基准测试分数,仅针对薄弱项目进行强化训练,进行基准测试操纵。Ryu Jemyong称:“我们向该评估机构咨询了有关基准测试操纵的担忧,未发现能够证明存在为评估而进行系统性记忆或过度拟合问题的证据,对方回复称不存在重大问题。”
政府表示,Motif虽未通过此次评估,但在智能体、编程等高难度基准测试领域取得了可与全球大型科技企业相当的高水平成果。Ryu Jemyong称:“Motif尽管是规模较小的研发组织,仍展现出卓越成果”,“据判断,Motif在第二阶段评估中未能晋级的原因,是其在易用性方面的得分相较其他企业偏低。”
第三阶段评估选出2支团队……支持方式将全面重新审查
Ryu Jemyeong科学技术信息通信部次官18日在首尔钟路区政府首尔办公楼公布自主人工智能基础模型项目第二轮评估结果。2026.8.18 Cho Yongjun记者
View original imageRyu Jemyong在当天简报会结束后接受记者采访时表示:“我们深刻认识到开发顶级自主AI模型的必要性,正与相关部门讨论超越现有方式的新支持体系,今后将准备并公布具体内容。”
政府正在研究开发前沿级AI模型的相关方案,同时也在考察与现有Dopamo项目、通用人工智能(AGI)项目等相关项目之间的衔接及重组方案。
不过,政府仍将按计划通过今年年底至明年年初进行的第三阶段评估,选出最终2支团队。此后的支持方式则将重新审查。Ryu Jemyong表示:“第三阶段评估将按计划推进,选出2支团队的遴选程序也将继续进行”,但“对于2027年是否仍以当前形式支持这2支团队,正在进行全面重新审查”。
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。