“AAII基准测试得分最高却落选……难以理解评估依据”
在政府推进的自主人工智能(AI)基础模型项目第二阶段评估中落选的Motif Technologies,正式提出异议,要求公开评估标准及各项目详细评分。
Motif于27日发布声明称:“针对本次自主AI基础模型项目第二阶段遴选结果,已正式申请提出异议。”
Motif要求科学技术信息通信部公开:▲评估结果及详细评估内容;▲基准测试评估分值计算方式的依据;▲专家评估的详细标准及结果;▲用户评估的方法论、详细标准及结果等。
此前,Motif在第二阶段评估前公开的AI模型“Motif 3”,曾在全球评估机构的基准测试中获得自主AI基础模型第二阶段参评企业中的最高分。该模型在人工分析智能指数(Artificial Analysis Intelligence Index)中获得47分,超过了SOLAR Open 2(37分,Upstage)、A.X K2(35分,SK Telecom)和K-EXAONE 2.0(31分,LG AI研究院)。
人工分析智能指数被用作第二阶段评估中基准测试评估的主要指标,该项评估在总分100分中占40分。具体而言,人工分析智能指数占25分,韩国智能信息社会振兴院基准测试占15分。Motif在人工分析智能指数基准测试评估的折算得分中以11.9分位居最高,但在综合排名中得分最低,最终落选。
Motif对这种基准测试分值计算方式提出质疑。Motif表示,尽管其与LG AI研究院在人工分析智能指数中的得分分别为47分和31分,存在显著差距,但全球主要基准测试结果与专家评估得出相反结论的原因和背景,有必要作出具体说明。
该公司还要求公开专家评估的判断依据。Motif称,在专家评估过程中,曾被要求回答诸如“财团的牵头方及参与企业中,是否有外资或海外法人作为拥有表决权的主要股东参与其中”等问题,因此有必要说明这些问题是基于何种评估目的和标准被采用的。
Motif表示:“据媒体报道,科学技术信息通信部曾解释称,Motif 3仅人工分析智能指数基准测试得分较高,在专家评估和用户评估中存在问题。”该公司还称:“科学技术信息通信部高级官员的表述中,甚至提到Motif 3实际推理性能不及其基准测试得分,易用性和实用性也较低。”
该公司接着表示:“这些内容已不仅是某家企业入选、某家企业落选的问题,而是对自主AI基础模型项目本质及未来发展方向提出了根本性疑问。我们认为,外界可能对我们一直追求的技术方向及其成果存在部分误解,因此基于这一问题意识,郑重请求公开评估分数细节并进行重新审议。”
不过,Motif说明,此次异议并非意在参与未来将进行的自主AI基础模型项目第三阶段评估。该公司表示:“无论异议结果如何,我们都不会参与自主AI基础模型项目第三阶段。提出异议并非为了主张我们必须被选入该项目。”该公司还称:“希望此次异议能成为就自主AI基础模型项目究竟服务于何种目标形成共识,并促使我们及其他竞争企业共同认可、寻找改进方向的过程。”
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。