Gaudiolab开发生成式声音AI技术
输入视频、图像、文本等内容即可由AI自动生成所需声音

[AI革命]⑭用AI创造世界万物之声…Gaudio Lab View original image

如果在制作内容时需要尖锐的猫叫声,该怎么办?首先要找到一只猫,然后打开麦克风,等待猫发出尖锐的叫声——这是我们以往能想到的方式。但在人工智能(AI)时代,不必再做这些繁琐的工作,只需输入“尖锐的猫叫声”,AI模型就会生成这种声音。如果不满意,还可以不断生成其他猫叫声。虽然是AI生成的声音,但与现实中的声音几乎一模一样。开发这项技术的公司是Gaudio Lab。AI生成的声音不仅可以用于包括游戏在内的虚拟世界,也能应用于电影、电视剧等所有需要声音的领域。AI正在开启一个任何人都能轻松制作并体验所需声音的未来。


10日,Gaudio Lab表示,将推进AI技术的高度化,使其只需输入视频或图片,就能自动生成与之匹配的音效和声音。Gaudio Lab把这种生成式声音AI称为“SSG项目”,是“Sound Studio Gaudio”的缩写。其基础是Gaudio Lab所拥有的世界顶级AI音源分离技术。这是一种从混合了多种音源的音频信号中提取各个单独音源的技术,通过分离这个世界的各种声音来构建训练数据。借助经过精炼的数据,AI模型可以生成质量更高的声音。Gaudio Lab的AI音源分离技术,很多人在去年11月播出的节目《Hidden Singer 7》中已经有过体验。在已故歌手Kim Hyunsik篇中,AI从1980年代伴奏音乐与人声混录的文件中,将他的嗓音清晰地分离了出来。


[AI革命]⑭用AI创造世界万物之声…Gaudio Lab View original image

Gaudio Lab是一家成立于2015年的音频技术初创企业,以独一无二的技术实力引领市场。其核心技术是通过耳机实现的空间音效技术。Gaudio Lab首席执行官 Oh Hyuno 表示:“即便是用耳机听音乐,也能体验到仿佛置身真实演出现场般的立体声效和沉浸感。”AI是Gaudio Lab在以此技术打好成长基础后,为进军全球市场准备的“王牌武器”。输入文本即可自动生成声音的技术,早在ChatGPT撼动市场之前的2021年就已开始研究。目前,AI已经可以在一百多个类别中生成与现实难以区分的声音。Gaudio Lab称,不仅是YouTuber等创作者,任何个人都可以像给电影配音那样,为内容快速配上仿佛真实存在的声音。在Roblox、Zepeto等元宇宙平台中,也可以借此增强沉浸感。


目前大部分音频AI市场都集中在人的嗓音上,而Gaudio Lab则把技术难度提升到最高级,瞄准“世上所有的声音”。这也是其去年收购韩国代表性电影声音工作室Wave Lab的原因。Wave Lab以《Casino》《International Market》《Oldboy》等作品为代表,在二十多年里积累了市面上难以获取的干净、自然的高品质声音数据。Gaudio Lab将这些数据进行音源分离和精炼,以便AI更好地学习。之所以能够做到这一点,不仅因为AI技术实力,还因为公司拥有包括9名在全球范围内都十分稀缺的声学工程学博士在内、共40余名音频专家。



代表 Oh Hyeonoh

代表 Oh Hyeonoh

View original image

Oh代表表示:“我们的耳朵比眼睛更敏感。即便画面中混入了不相干的图像,眼睛也未必能察觉,但声音只要错一个比特,人就很容易把它当成噪音。”这意味着,生成声音的AI必然比处理文本或图像更难。他接着表示:“如果不是像Gaudio Lab这样聚集了大量精通AI的声学工程学博士的公司,是做不到这件事的。我们认为,只有当我们把这件事完成时,由AI生成的一种未来才算真正走向完结。”


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。