全模态人工智能模型Kanana-o可通过自然语言指令调节说话风格、语速和语调
速度与效率提升……基准测试中与全球模型不相上下

Kakao 4日表示,已升级自主研发的全模态人工智能模型“Kanana-o”的语音生成技术。


据Kakao当天通过技术博客公开的内容,Kanana-o升级了语音生成技术,用户仅通过自然语言指令即可控制所需的说话风格、情感乃至语调。同时,借助自主研发的语音分词器,生成速度和效率也得到提升。


Kakao 4日表示,已升级自主研发的全模态人工智能模型“Kanana-o”的语音生成技术。Kakao供图

Kakao 4日表示,已升级自主研发的全模态人工智能模型“Kanana-o”的语音生成技术。Kakao供图

View original image

升级后的Kanana-o可根据用户指令控制语音表达本身。用户以“请读得非常快”“请用低沉的声音读”“请用悲伤的声音读”“请用庆尚道方言读”等自然语言表达所需的发声方式后,人工智能便会生成反映语速、音量、音高、情感、语调及强度的语音。


此外,该模型还可执行“像体育赛事解说一样”“像播音员一样”“像朗读童话书一样”等基于角色的指令,以及“请压低语调、快速且用悲伤的声音读”等同时包含多项要求的复合指令。Kakao称,在英语语音生成中也可执行相同的发声指令。


Kanana-o在评估发声指令执行能力的“InstructTTSEval”韩语基准测试中获得94.50分。这一成绩超过GPT-4o-mini-tts的91.10分,与谷歌Gemini-2.5-Flash-Preview-tts的95.38分相近。


Kakao应用自主研发的语音分词器“LM-SPT(LM-aligned SPeech Tokenizer)”,提升了语音生成速度和效率。LM-SPT是一项让人工智能以更少数量的词元压缩并表达语音的技术,可减少人工智能需要处理的数据量,从而快速、高效地生成语音。


Kakao计划未来继续发展Kanana-o语音技术。该公司将通过研究以统一架构处理语音理解和生成能力,进一步升级语音处理技术,并专注于提供自然、无缝的语音体验。



Kakao统一基础模型成果负责人Noh Byeongseok表示:“此次Kanana-o语音技术升级不仅着眼于实现如人类般自然的语音生成,也重点提升了模型按照自然语言指令表达用户所需说话风格、情感和语调的能力。”他还称:“未来将把Kanana-o模型应用于多种服务,提供更加自然、便捷的人工智能语音体验。”


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。

不容错过的热点