CES 2024热议“端侧AI”
小而强大的AI与轻量化技术成核心

“端侧人工智能(AI)”正在席卷全球。从智能手机到汽车,各种设备都搭载AI技术,让设备具备自主收集和运算信息的能力是关键。为此需要让AI变得更“轻”的技术,而这一角色由软件(SW)来承担。如果说去年还是以AI模型的“大脑”规模来比拼自身性能,那么今年从笔记本电脑到吸尘器、冰箱、智能汽车等设备搭载AI,已经成为一股巨大潮流。


端侧AI是指不经过服务器或云端,而由设备自身来运行AI。对用户而言,个人信息不外流,在安全性方面具有优势,因此可以实现利用个人信息的个性化服务。对提供方而言,则无需投入服务器运营成本也能提供AI服务。

用量化压缩AI…掌上AI设备核心同样在“软件” View original image

在端侧AI中,如果所需硬件(HW)是高性能半导体,那么软件则负责“减重”。要在智能手机这样性能与空间受限的环境中运行AI,就必须让模型本身足够小,或者把大型模型“瘦身”变轻。


将模型本身做小的,就是轻量级大语言模型(sLLM)。如果说大语言模型(LLM)以庞大“大脑”在通用领域发挥高性能,那么sLLM则是相对体量更小的AI模型,在特定领域性能更好、成本效率更高是其特点。通常将拥有数千亿参数(负责学习和记忆信息)的模型称为LLM,而拥有数十亿至数百亿参数的模型则被划分为sLLM。


要让小模型也能取得良好性能,就必须具备优化技术。AI初创公司Upstage在实现自研LLM“Solar”时,通过拆分并组合小模型,找出了实现最佳性能的比例。其结果是,仅凭107亿参数的规模,就在开源AI模型的全球竞技场——Hugging Face排行榜上夺得第一名。其性能达到由OpenAI开发、拥有1万亿参数的GPT-4的百分之一规模所能实现的高水平。AI技术企业Konan Technology则选择在缩小模型规模的同时增加训练量,或只用高质量数据进行训练。在其自研模型“Konan LLM”中,投入的韩语数据量是Meta开发的“Llama 2”的270倍。


让大模型“瘦身”的轻量化技术也备受关注。AI初创公司Squeezebits开发了通过量化来压缩AI的技术。其原理是,将32位精度的运算用更小单位的运算进行简化表达,在加快计算速度的同时保持同等性能。AI模型优化技术企业Nota则通过减少AI模型的运算量来实现轻量化,具体做法是跳过对最终结果影响相对较小的运算。此外,还有一种自动机器学习(Auto ML)技术,让AI自动寻找在执行特定功能时效率最高的模型。



Squeezebits首席执行官Kim Hyeongjun表示:“能在多大程度上针对不同硬件对模型进行轻量化和优化,将决定端侧AI的竞争力”,“若要让AI在更多领域得到应用,这类技术必不可少。”


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。