OpenAI于9日表示,已公开基于下一代语音模型“GPT Live”的更加自然的ChatGPT语音体验。
现有语音人工智能通常是先将用户语音转换为文本,再由大型语言模型生成回答,随后再朗读为语音。由于还需要单独判断用户是否已结束发言,对话容易中断或出现响应延迟,这一直是其局限所在。
GPT Live突破了这种方式,能够持续处理语音并实时理解对话语境。即使用户仍在说话过程中,它也能自然作出反应;对于用户打断后重新提问的情况,也可进行应对。
GPT Live在设计上将快速响应用户发言的语音对话功能,与处理复杂请求的推理功能分离开来。
ChatGPT语音也能更自然地支持实时口译体验。通过此次更新,它可以在听取并处理用户语音的同时,结合对话节奏进行口译。
OpenAI表示:“GPT Live是同时提升语音人工智能自然度与智能水平的重要一步。未来将继续推进相关技术发展,使用户无论是通过文本能完成的事情,还是可以向人工智能代理提出的请求,都能在语音对话中自然完成。”
本报道由人工智能(AI)翻译技术生成。
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。