Source: OpenAI BlogView original ↗
Copyright remains with the original source. This site only collects, translates, or reformats the material.
What happened
Analysis and impact
告别“抢话”与“延迟”:OpenAI 详解 GPT-Live 如何实现实时语音交互
GPT-Live 的核心突破在于移除了语音交互链路中独立的“轮次检测”模型。在以往的语音助手中,系统需要依赖一个小模型来判断用户何时说完话,才能开始生成回复。这个判断极为困难:过早打断会让用户感到突兀,过晚响应则显得迟钝。根据 OpenAI 工程师在官方博客中的描述,GPT-Live 直接采用了一个能够同时听说的全双工语音模型,让 AI 可以在用户还在组织语言时就开始理解并准备回应,从而消除了传统架构中固有的延迟瓶颈[来源: openai.com]。
为了进一步降低网络传输延迟,OpenAI 重新设计了其 WebRTC 技术栈,并开发了一项名为 WARP 的新技术。传统的加密通信连接建立过程需要客户端与服务器之间进行多达六次往返握手,而 WARP 技术成功将这一过程缩减为一次往返。这意味着从用户开口说话到 AI 开始处理语音指令的网络准备时间被压缩到了极致。同时,OpenAI 还采用了分离式中继与收发器架构,在保持标准 WebRTC 客户端行为的同时,优化了全球数据包的路由路径,确保了大规模服务下的低延迟体验[来源: finance.biggo.com][来源: openai.com]。
这种架构上的革新,使得 GPT-Live 的交互体验从“一问一答”的命令式对话,转向了更流畅、自然的持续交流。系统能够捕捉到对话中细微的停顿、语气变化,甚至允许用户中途插话,而 AI 可以像人类一样灵活地切换话题或调整回答。OpenAI 方面表示,从项目启动到系统成型仅用了约六个月时间,这一速度也反映出基础模型能力的提升正推动着上层应用架构的快速演进[来源: startuphub.ai]。