OpenAI 发布 GPT-Live:全新全双工语音模型,让与 AI 对话像真人交流
- 全双工架构实现同时听和说,支持打断、停顿和自然回应
- 后台委派任务给 GPT-5.5 等前沿模型,保持对话流畅
- 推出 GPT-Live-1 和 GPT-Live-1 mini,面向不同用户层级
- 内置安全防护措施,针对语音风险进行专门训练和测试
- 支持视觉化回答和多种语言,但暂不支持视频和屏幕共享

我们正在推出 GPT‑Live,这是一种全新一代的语音模型,让与 AI 对话的感觉更接近与真人交谈。
GPT‑Live 基于全双工(full-duplex)架构构建,意味着它可以同时听和说。在对话过程中,GPT‑Live 可以用“嗯”“对”这样的短语表示它正在认真听,可以进行快速的你来我往,也可以在你需要思考时安静等待。最终的语音体验让人聊起来倍感轻松自然。
GPT‑Live 也是我们迄今最智能的语音模型。对于需要联网搜索、深度推理或更复杂工作的提问,它会在后台将任务委派给我们最新的前沿模型,并在结果就绪时将其带回对话中。在后台处理的同时,GPT‑Live 仍可以继续与你交谈,保持对话的流畅。上线时,GPT‑Live 后台将使用 GPT‑5.5。随着我们发布新的前沿模型,GPT‑Live 所使用的模型也会持续更新。
这些进步为全新的 ChatGPT Voice 体验提供了动力,使其更智能、更自然。长远来看,我们相信这项研究还将解锁用语音完成越来越复杂、运行时间越来越长、更具 Agent 属性的工作的能力。
我们今天开始向全球 ChatGPT 用户推出两个版本的 GPT‑Live:GPT‑Live‑1 和 GPT‑Live‑1 mini。我们还计划尽快将它们引入 API,开发者和企业可以通过这个表单报名获取通知。
迈入人机交互的新时代
我们的愿景是实现真正自然的人机交互:一个让与 AI 协作如同与另一个人共事般流畅灵敏的世界,同时推理和复杂任务的执行在后台无缝完成。
此前的方案
更早几代的语音 AI 系统让我们更接近这一愿景,但伴随着重要的权衡。
级联式语音系统
级联式语音系统(cascaded voice systems)依赖一系列模型依次处理每一轮对话。最初的 ChatGPT Voice 将三个模型串联在一起:一个语音转文字模型来转录你的语音,一个大语言模型来生成回复,再由一个文字转语音模型将其转换回语音。这种方式让我们第一次能与前沿 AI 模型对话,但其复杂性也带来了代价:信息可能在模型之间流失,回复缓慢且生硬。
轮次式语音模型
像 ChatGPT Advanced Voice Mode 这样的轮次式语音模型在单一模型内同时处理和生成音频,降低了延迟,让对话更流畅。但它们仍然通过离散的轮次运作。模型必须等待用户说完才能回应,导致一来一回显得僵硬。此外,由于轮次检测基于静音判断,即使是短暂的停顿或背景噪音也可能被误认为对话结束,使模型在不恰当的时候打断你。
我们的新方案
GPT‑Live 通过两项架构上的改变来解决这些局限。
持续交互
首先,我们为 GPT‑Live 打造了基于全双工架构的持续交互能力。
GPT‑Live 不再处理一系列各自独立的消息,而是在生成输出的同时持续处理输入。因此,模型每秒可以多次做出交互决策:是说话、继续听、暂停、打断,还是调用某个工具。
这使得模型能够进行更自然的来回对话,更好地把握时间感,甚至能完成实时翻译。
深度工作的委派
其次,我们将负责持续交互的 GPT‑Live 与深度工作解耦。当某个问题需要搜索、推理或更强的 Agent 能力时,GPT‑Live 可以把任务委派给另一个模型,比如 GPT‑5.5。这样它就能在后台同时处理多项任务的同时,让对话继续下去。
这一架构改变还让 GPT‑Live 可以持续使用最新的模型和 Agent,将前沿智能与自然交互结合起来。
评测结果
我们构建了新的人类评测来衡量愉悦感和对话的流畅度。在这些正面较量中,在衡量整体偏好、轮次切换、打断、对话流畅度以及每次交互的自然程度的 5 到 10 分钟匹配对话里,GPT‑Live‑1 和 GPT‑Live‑1 mini 相比 Advanced Voice Mode 获得了明显更高的偏好。
- GPQA:GPT‑Live‑1 在 GPQA 上大幅优于 Advanced Voice Mode,该测试考察的是生物学、化学和物理学领域的专家级科学推理。
- BrowseComp:GPT‑Live‑1 在 BrowseComp 上相比 Advanced Voice Mode 有显著提升,该测试考察的是 Agent 式联网搜索以及查找难以定位的信息的能力。
- τ³-Voice Telecom(内部变体):GPT‑Live‑1 在 τ³-Voice Telecom 上优于 Advanced Voice Mode,该测试考察语音 Agent 完成贴近真实场景的多轮电信客服任务的能力。
全新的 ChatGPT Voice 体验
每周有超过 1.5 亿人通过 Voice 和 Dictation 等功能与 ChatGPT 对话。他们用它来获得免手的日常帮助、练习语言、讲睡前故事,或只是在通勤时聊聊天。
从今天起,当你点击语音按钮与 ChatGPT 交谈时,你将获得由 GPT‑Live 驱动的升级体验:更自然的对话、更聪明的回答、更好的倾听以及视觉化的回应。
更自然的对话
与 ChatGPT 交谈现在应该更像一场真实的对话。你可以用提问打断它、暂停一下整理思路,或者让 ChatGPT 说慢一点。它会自然地用“嗯”“知道了”这样的短语回应你,让你知道它在跟上。我们还为 GPT‑Live 重新制作了 ChatGPT 中的九种不同声音。
更聪明的回答
ChatGPT Voice 现在可以调用我们最新的前沿模型,在需要时给出更聪明的回答。你还可以选择适合自己需求的推理深度:Instant 用于快速响应,Medium 和 High 则用于想让 ChatGPT 多花点时间思考的场景。
更好的倾听
如果你停下来思考,ChatGPT Voice 现在会等待,而不是急着插嘴打断。如果你让它安静地听,它就会照做。当周围有背景噪音,比如驶过的车流或附近的谈话声时,ChatGPT 也能更好地聚焦你的声音,而不会分心。
一目了然的视觉化回答
有些回答能看见会更有用。在你说话的同时,ChatGPT 现在可以为天气、股票、体育等主题展示丰富的视觉卡片。语音功能也继续支持搜索、记忆、图片和文件上传。
最终带来的,是一个在日常生活中更自然、更强大、更实用的 ChatGPT Voice 体验。
为语音而设计的安全性
GPT‑Live 默认就是安全的。它在最新模型的安全进步之上,增加了针对关键风险领域的专门安全训练,以及专为语音设计的新防护措施。
扩大的安全测试
为了更好地反映人们在真实场景中使用语音的方式,我们首先扩大了安全测试,加入了新的原生音频评测。我们还创建了使用生成音频的合成评测,更集中地聚焦关键安全领域,并借鉴了从 Advanced Voice Mode 中学到的经验。这些领域包括自残、精神病和躁狂、对 AI 的情感依赖、暴力和性内容。内部专家还对模型进行了针对语音特有风险的红队测试。
在我们的测试中,GPT‑Live 在几乎所有评估领域的表现都达到或优于 Advanced Voice Mode。你可以在 GPT‑Live 的系统卡片中了解更多关于测试和防护措施的内容。
内置防护措施
由于语音对话是实时展开的,我们还构建了能够在模型说话时即时生效的防护措施。当系统检测到潜在不安全的输出时,它可以将模型引导至更安全的回应、显示额外的安全提示或资源,或在风险较高的情形下结束语音对话。对于涉及自残的对话,我们为语音适配了 ChatGPT 的支持流程,包括提供经专家审核的危机热线支持。
我们设计了额外的保护措施来支持青少年用户,并将符合年龄的行为直接训练进模型,以降低不当回复的风险。家长可以通过 Parental Controls 选择是否允许青少年使用 ChatGPT Voice;在涉及潜在自残或自杀意图迹象的高风险情形下,关联的家长可能会收到通知。
从真实使用中学习
我们还在推出聚焦于情感依赖的长期测量和上线后监测,以持续加深理解并完善防护措施。在以往对情感使用与心理健康的研究基础上,这将帮助我们识别新出现的模式,改进系统在情感敏感交互中的回应方式。
最后,GPT‑Live 是为对话而设计的,而非声音模仿。它在 ChatGPT 中使用一组预定义的声音,并配有防止模仿真实人物声音的防护措施。
我们致力于支持安全与身心健康,并将随着从真实使用中不断学习来持续加强这些保护。
可用性与局限
GPT‑Live 现在正向全球 ChatGPT 用户在 iOS、Android 和 ChatGPT.com 上推出。GPT‑Live‑1 将成为驱动 Go、Plus 和 Pro 用户 ChatGPT Voice 的默认模型,而 GPT‑Live‑1 mini 将成为 Free 用户的默认模型。更多可用性详情可在我们的帮助中心查看。
我们针对 ChatGPT 中一些最热门的语言对 GPT‑Live 进行了优化。对于某些语言,模型可能会有非母语的口音或流畅度上的不足。我们正在积极改进跨语言的体验。
上线时,GPT‑Live 在 ChatGPT 中暂不支持语音配合视频或屏幕共享,但我们正在尽快推出这些能力。你仍可以使用旧版的 ChatGPT Voice,包括 Standard 和 Advanced Voice Mode,这些功能在它们可用的地方仍然支持。
评论互动