从人声到机器声
语音识别技术升级竞争
随着人工智能从聊天机器人进化为智能体,围绕提升语音识别技术的竞争正在展开。竞争范围已从能够听懂人类语言的语音人工智能,扩大至将机器声和环境声也转化为数据的技术。
据TechCrunch等外媒8月19日报道,美国语音人工智能初创企业Whisper获得2.8亿美元投资(约合4000亿韩元)。其企业估值达到20亿美元,较2025年11月的7亿美元在9个月内增长约3倍。
Whisper提供以语音替代键盘、在电脑和智能手机上输入文字的语音人工智能服务。该服务不仅记录用户说出的内容,人工智能还会删除不必要的表达,并根据语境润色句子。其目标是打造“语音操作系统”,使语音像键盘和鼠标一样成为电脑的基础输入方式。
这一趋势背后,是市场预期人工智能与人类的互动方式将从文本转向语音。用户无需操作多层菜单或输入指令,只需说一句话便可将工作交给人工智能处理的环境,有望逐步形成。
主要人工智能企业也在升级实时语音技术。以往的语音人工智能主要专注于将人类语言转换为文本,而近期则致力于实现能够理解对话语境的自然互动。OpenAI上月推出实时语音模型GPT Live,摆脱了等待用户说完后再回答的方式,实现了可同时听取并回应人类语言的功能。
韩国声学人工智能企业Dipeulli通过人工智能分析制造现场产生的机器声、撞击声等非语言声音,并将其数据化。近期,该公司正着手构建可应用于制造环境的人工智能解决方案及面向企业的标准化模型。语音人工智能企业ElevenLabs近期则将可从陈旧或音质较低的音频档案中分离、修复特定说话者声音的技术,应用于多个行业。该技术仅利用少量语音资料学习说话者的音色和发声模式,随后以修复后的声音制作新内容。
Fortune Business Insights预测,全球语音识别市场规模将从今年的237亿美元增长至2034年的1040.5亿美元,增幅超过4倍;预计2026年至2034年期间年均增长率将超过20%。
东国大学计算机·人工智能学系教授Park Jinho表示:“随着人工智能发展为能够代替人类执行多个步骤的智能体,利用语音以及视觉、听觉等人类感官的交互界面将不断扩大。要提高真实环境中的语音识别准确度,既需要提升输入数据质量,也需要同步发展语境推理、降噪和过滤技术。”
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。