“只花7.3万韩元、30分钟就追上DeepSeek” 美国发布的AI模型
谷歌对Gemini进行“蒸馏”开发推理模型
“蒸馏难以带来突破性进展”
在中国人工智能初创企业DeepSeek宣称以低成本开发的人工智能模型席卷全球之际,美国一所大学的研究团队仅用50美元(约7.3万韩元)开发出人工智能模型,引发关注。
斯坦福大学和华盛顿大学的人工智能研究团队在最近发表的研究论文中表示,他们以不到50美元的云计算成本训练出了一个人工智能推理模型。名为“s1”的人工智能模型在数学和编程能力测试中,展现出与OpenAI的“o1”、DeepSeek的“R1”相当的性能。o1是OpenAI去年首次推出的推理模型,R1则是DeepSeek上月发布的推理模型。外界认为o1和R1的性能相近。
研究团队解释称,在开发s1的过程中,他们通过一种名为“蒸馏”(distillation)的技术流程进行微调。“蒸馏”是指人工智能模型将其他模型的输出结果作为训练数据,用以开发出类似功能。s1是从谷歌最新的人工智能模型Gemini 2.0 Flash Thinking Experimental中进行蒸馏得到的。
此前有消息称,DeepSeek在开发自家人工智能模型时,也对OpenAI的人工智能模型进行了蒸馏。借助这一方法,其开发成本仅为OpenAI开发ChatGPT成本的5.6%,约为557.6万美元(约80亿韩元)。
此外,研究团队还通过向s1下达“等待”的指令,让人工智能模型在生成回答前有充足的思考时间,从而提高准确率。
研究团队表示:“在s1训练中,我们使用了英伟达的先进人工智能芯片H100图形处理器(GPU),用时不到30分钟”,“总成本不足50美元。”
继DeepSeek之后,s1这类“性价比”(价格与性能比)突出的人工智能模型相继问世,使得谷歌、微软(Microsoft)、Meta等在人工智能基础设施上投入数十亿美元的科技巨头,其高昂开发成本正受到质疑。但专家认为,通过蒸馏方式开发的人工智能模型只是对既有模型的复制,要实现突破性进展仍然困难。
另外,由于谷歌禁止利用其人工智能开发竞争性服务,s1相关研究是否违反了谷歌的服务条款,也可能引发争议。
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。