OpenAI 于当地时间 8 月 20 日(北京时间 8 月 21 日)正式发布新一代语音模型 GPT-Live,标志着 AI 语音交互从”回合制”迈入”同步流”时代。据官方披露,该模型基于最新的 GPT-5.5 前沿基础模型,专为持续交互设计,每秒可多次判断是继续聆听、开始说话、暂停、打断还是调用工具,并支持实时翻译、网络搜索、深度推理与复杂任务处理。与前代语音功能相比,GPT-Live 最大的突破在于实现了”边听边说”——AI 能够通过”嗯哼”等简短回应传递倾听信号,增强对话真实感;当用户稍作停顿思考时,模型会耐心等待而非贸然插话,且抗背景噪音能力显著增强。OpenAI 介绍,目前每周已有超过 1.5 亿人使用 ChatGPT 的语音和听写功能,此次发布的 GPT-Live 分为两个版本:GPT-Live-1 面向 Plus 和 Pro 用户,GPT-Live-1 mini 面向 Free 用户,即日起向全球 ChatGPT 用户推送。该版本暂不支持语音通话与屏幕共享,OpenAI 表示正积极推动相关功能尽快上线。业内人士认为,GPT-Live 的推出将极大推动语音交互在免提助手、语言学习、实时翻译等场景的规模化落地。
OpenAI 发布 GPT-Live 语音模型:AI 实现”边听边说”,对话体验逼近真人
上一篇:中央网信办印发五年行动计划,鼓励布局制造业行业大模型与智能体
下一篇:DeepSeek 再上新:多模态视觉模型 V4-Flash-Vision-Exp 上线,多模态 Agent 能力逼近 Opus-4.8