核心看点
- GPT-Live-1 正式登陆 API,为开发者带来自然流畅的语音交互能力
- 单一模型同时处理听和说,告别传统 STT-LLM-TTS 链式架构的延迟和卡顿
- 打断处理大幅优化:语言学习应用 Speak 实测打断减少近 80%
- Full Duplex Bench 性能比 GPT-Realtime-2 提升 30 个百分点
- 定价 $0.05/分钟,支持电话语音代理部署
详细解析
什么是 GPT-Live-1?
GPT-Live-1 是 OpenAI 推出的全双工语音模型,最初在 ChatGPT 中亮相,现已正式通过 API 向开发者开放。它最大的特点是能够同时”听”和”说”,而不是像传统语音助手那样轮流进行语音识别、推理和合成。
告别传统语音架构
传统语音代理需要拼接三个独立组件:语音识别(STT)、推理模型(LLM)、语音合成(TTS)。每次切换都会增加延迟,还容易丢失对话的上下文和节奏。GPT-Live-1 用一个模型搞定所有事情,可以自然处理打断、停顿和话题转换。
核心优势
打断处理:单一模型同时处理输入和输出音频,避免了链式架构的延迟和脆弱切换。在 Speak 的早期评估中,GPT-Live-1 让学习者有更多思考时间,打断减少了近 80%。
推理和工具调用委派:GPT-Live-1 可以将复杂推理和工具调用委派给后端文本模型(如 GPT-6 Astra 或第三方模型),自己专注于语音交互。
语气、节奏和风格控制:开发者可以通过系统提示词塑造智能体的语气、语速和对话风格。
长会话可靠性:改进的上下文保持能力,让长时间对话依然流畅自然。
电话支持:支持部署全双工语音代理,适用于餐厅预订、客户支持等电话场景。
性能表现
在 Full Duplex Bench 评估中,GPT-Live-1 比 GPT-Realtime-2 提升 30 个百分点,在轮次切换延迟和交互行为方面都有显著改善。搭配 GPT-6 Astra(中等推理强度),在 Tau3 语音代理智能评估中排名第一。
总结
GPT-Live-1 的 API 发布为语音应用开发者带来了全新的可能性。无论是构建更自然的语音助手、电话客服系统,还是创新的语音交互体验,它都提供了一个强大、灵活且易于使用的基础。$0.05/分钟的定价也让大规模部署变得更加可行。
本文地址:https://www.163264.com/15478


微信扫一扫,鼓励一下~