虎嗅

OpenAI的新语音模型,先把用户烦到了

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

OpenAI昨夜发布新一代语音模型GPT-Live,用来升级ChatGPT Voice功能。它主要解决了之前语音助手“回合制对话”的不自然问题——比如用户停顿一秒就急着接话、打断后要重新组织回答等。GPT-Live用“全双工”架构让AI能边听边说,还把语音交互层和后台智能分工(语音层管流畅对话,复杂任务交给GPT-5.5)。官方说它比之前的模型更好,但用户评价两极:有人觉得潜力大,有人嫌它短反馈太多太烦人,还存在不能在摄像头/屏幕共享模式用等问题。这次更新的核心是让语音助手更像真人聊天,把语音从“输入输出工具”变成AI参与现实任务的实时入口。

拆解解读

1. 以前的AI语音聊天为啥像“对讲机”?

过去的ChatGPT Voice(包括其他助手如Gemini、豆包)都是“回合制”:你说完一句,AI才答一句。就像对讲机,必须等对方说完按下按钮,你才能回应。问题出在:

  • 判断“说完没”容易错:你停顿1秒想词,AI以为你说完了,突然插话;你说到一半改主意,AI还按上半句答。
  • 丢失细节:早期用“级联系统”(语音转文字→大模型生成文字→文字转语音),语气、停顿、情绪都没了,就像读稿子。
  • 延迟高:多个模型接力,反应慢,聊起来干涩,没人情味。

比如你说“我今天去了那个…嗯…就是上次你说的那家咖啡馆”,AI可能在你说“嗯”的时候就打断:“哪家咖啡馆?”,让你很尴尬。

2. GPT-Live怎么让对话变“像人”?

它做了两个关键改进:

  • 全双工架构:AI能“边听边说”,每秒做多次决策(继续听、插话、回应“嗯嗯”、暂停等)。比如你说“我最近在学编程,但for循环总是搞不懂…”,AI可能插一句“哦for循环是吧,我懂你的痛点”,而不是等你说完整个句子。
  • 分工合作:语音层只负责“聊天节奏”(听、说、打断、短反馈),复杂任务交给后台的GPT-5.5。比如你问“今天北京天气?”,语音层直接答;问“怎么用Python写for循环?”,就叫GPT-5.5来推理,再用语音说出来。

这就像你和朋友聊天:朋友负责接话、互动,遇到难题时他会找懂行的人帮忙,但表面上还是和你流畅聊。

3. 官方说的“更厉害”靠谱吗?

官方给出的评估结果是“评测者更偏好GPT-Live”,还说它在科学推理、网页搜索等任务上超过旧模型。但要打个问号:

  • 只和自己比:没和谷歌Gemini Live、英伟达PersonaPlex等同行比,不知道在行业里排第几。
  • 不是语音层单独强:效果好是因为后台调用了GPT-5.5,不是语音模型本身变聪明了。比如搜索功能强,是GPT-5.5会搜,不是GPT-Live的语音部分厉害。
  • 评估标准自己定:每次发布新模型,OpenAI都会按新能力改评估标准(比如这次测“短反馈”“中断处理”),有点“自说自话”的意思。

4. 用户为啥有人夸有人骂?

反馈两极分化很正常:

  • 夸的人:觉得全双工是未来方向,比如编程时可以边说边改代码,不用打字;练外语时AI能实时纠正,像真人外教。
  • 骂的人
  • 短反馈太多:AI频繁说“嗯嗯”“明白”,像个话痨,反而打扰聊天;
  • 功能限制:摄像头、屏幕共享模式下不能用,等于废了一半;
  • 没记忆:实时模式下查不到ChatGPT之前的对话记录,聊到一半要重新说。

比如有用户说:“我和它聊旅行计划,刚说到‘我想去云南…’,它就插‘嗯嗯’,我还没说完呢!”

5. 这次更新真的重要吗?

重要,但不是“革命性”,更像“补短板”:

  • 补日常体验:语音助手的核心是“不烦人”。过去用户用它是因为“腾不出手”(比如开车时问路线),但体验不好就不想用。GPT-Live解决的是“自然度”问题,让用户愿意长期用。
  • 语音成实时入口:以前语音只是“打字替代品”,现在它能边听边做任务(比如实时翻译、查天气),变成AI和现实世界连接的通道。

不过,它的真正考验是“会不会少打扰”。文字可以忽略,但声音直接闯进耳朵——如果AI总是插话、说废话,用户会直接关掉。现在的问题(短反馈太多)就是这个考验的开始。

最后一句话总结

GPT-Live让AI语音聊天更像真人,但还没完全搞定“不烦人”的问题。它是AI语音助手的重要一步,但能不能成,要看后续能不能把细节磨好。毕竟,没人喜欢一个话痨的助手。

(全文完)