Kakao的多模态人工智能语言模型“Kanana-v”在全球开源人工智能平台Hugging Face上的下载量已达160万次。


Kakao于9日表示,开源视觉语言模型“Kanana-1.5-v-3b-Instruct”最近1个月在Hugging Face上的下载量达到38万次。该模型截至目前的累计下载量约达160万次。


开源人工智能平台Hugging Face公开的“Kanana-1.5-v-3b-Instruct”模型。Kakao供图

开源人工智能平台Hugging Face公开的“Kanana-1.5-v-3b-Instruct”模型。Kakao供图

View original image

视觉语言模型是能够同时理解和处理文本与图像的人工智能模型,可用于文档分析、图像说明及视觉信息解读等。


若看最近1个月的下载量,该模型领先于竞争产品。与同等规模的Naver Cloud视觉语言模型“HyperCLOVA X Seed Vision Instruct 3B”相比,其下载量约为后者的2.8倍,后者约为13.7万次;即便与体量更大的LG人工智能研究院“EXAONE 4.5 33B”相比,下载量也更高,后者约为24.7万次。


Kanana-v已被列为开源推理框架vLLM的官方支持模型,无需额外设置即可直接应用于服务。由于属于轻量级模型,即使在图形处理器资源受限的环境中,也能实现经济高效的运行。


Kakao一直专注于提升人工智能模型在多模态理解、指令执行和推理等方面的能力。继去年7月公开“Kanana-1.5-v-3b”后,又于今年1月推出通过自我检查将幻觉现象降至最低的“Kanana-v-4b-Hybrid”。目前,继面向Agentic人工智能优化的“Kanana-2”之后,公司正开发“Kanana-2.5”,并通过开发分词器同时提升推理速度和成本效率。



Kakao相关人士表示:“在能够完整理解用户语境、自主作出判断并完成复杂任务的Agentic人工智能体系中,多模态模型正发挥核心作用。”他还称,“今后将持续推进创新,让更多开发者和企业能够在无成本负担的情况下实现高性能、高效率的Agentic人工智能服务。”


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。

不容错过的热点