语音

  • GPT-Live-1 登陆 OpenAI API:全双工语音模型,打断减少 80%,对话更自然

    核心看点 GPT-Live-1 正式登陆 API,为开发者带来自然流畅的语音交互能力 单一模型同时处理听和说,告别传统 STT-LLM-TTS 链式架构的延迟和卡顿 打断处理大幅优化:语言学习应用 Speak 实测打断减少近 80% Full Duplex Bench 性能比 GPT-Realtime-2 提升 30 个百分点 定价 $0.05/分钟,支持电话语音代理部署 详细…

    openai-gpt 5天前
  • Gemini Live升级:语音AI代理时代来了,动动嘴就能管邮件、写文档、做规划

    核心看点 语音代理化:Gemini Live新增Agentic能力,动动嘴就能完成复杂任务 每日简报:自动汇总Gmail、日历重要信息,语音播报 邮件管家:语音搜索、归档、标记邮件,开车时也能处理收件箱 Gemini Spark:后台执行多步骤任务,甚至能记住跨天/跨周的目标 详细解析 8月27日,Google宣布Gemini Live迎来重大升级——从”能聊天的语…

    Google Gemini 2026年8月28日
  • AI日报:商汤8B小钢炮U1.5-Lite-Preview发布;MiniMax H3开源排除美国;微软自研全双工AI语音模型曝光

    AI日报:商汤8B小钢炮U1.5-Lite-Preview发布;MiniMax H3开源排除美国;微软自研全双工AI语音模型曝光AI日报:商汤8B小钢炮U1.5-Lite-Preview发布;MiniMax H3开源排除美国;微软自研全双工AI语音模型曝光AI日报:商汤8B小钢炮U1.5-Lite-Preview发布;MiniMax H3开源排除美国;微软自研全双工AI语音模型曝光AI日报:商汤8B小钢炮U1.5-Lite-Preview发布;MiniMax H3开源排除美国;微软自研全双工AI语音模型曝光

    欢迎来到今天的AI日报!这里是你每天探索人工智能世界的指南,聚焦AI领域的热点内容,助你洞悉技术趋势、了解创新AI产品应用。 1、微软首款自研全双工AI语音模型曝光:听说并行,16种语言自由切换 微软正在测试其首款原生实时语音模型MAI Realtime,该模型支持16种语言和两种语音风格,实现了听说并行的全双工交互,打破了传统语音助手的轮次交替模式。 🗣️ 支持16种语言和两…

    2026年8月5日 AI 日报
  • 京东外卖发布AI智能头盔:语音接单+单王导航,首批免费发给全职骑手

    京东外卖推出了一款AI智能头盔,首批免费发给全职骑手,后续逐步向全体骑手开放。这款头盔的核心思路很明确:用技术手段让骑手更安全、更高效地工作。 语音接单,不用掏手机 头盔内置AI语音助手,骑手在骑行过程中可以直接用语音完成接单、到店确认、联系用户等操作。不用在风雨里掏手机,安全隐患大幅降低。 “单王带路”,省时间 针对大型社区和写字楼寻路难的问题,头盔搭…

    应用 2026年8月4日
  • 阿里发布 Qwen-Audio-3.0-ASR-Flash:专业场景语音识别新突破

    阿里最近放出了新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,主打一个「专业领域听得准」。 说实话,语音识别在平常聊天场景已经挺成熟了,但一到医疗、法律、工业这些专业领域,模型就经常掉链子——术语太密集,很多词发音还相近,误判率居高不下。这次的新模型就是冲着这个痛点去的,据说在医疗听写场景里准确率已经飙到 95% 以上。 阿里这次开了三个不同版本的接口,…

    模型框架 2026年7月31日
  • AI日报:Fish Audio发布S2.1Pro语音模型、Grok 4.6定档8月7日、360推出企业智能体平台

    今天AI圈有几件值得关注的事,快速过一下。 🎙️ Fish Audio 发布 S2.1Pro 实时对话语音模型 Fish Audio 在成立周年之际推出了生产级语音大模型 S2.1Pro,专为实时对话场景打造。亮点: 首帧音频播放延迟约90毫秒,对话轮替自然流畅 覆盖83种语言,统一语音识别架构 支持耳语模式和情绪控制,可以直接在文本里嵌入括号标签来调节语气 对需要语音交互的产…

    2026年7月30日
  • Claude Opus、Sonnet、Haiku全面支持语音模式:从聊天到实时参谋

    核心看点 Claude语音模式升级,支持Opus、Sonnet和Haiku三大模型 支持连接Gmail、Slack等工具,实现语音指令执行任务 扩展多语言支持,允许用户在对话中切换语言 从简单问答升级为能调工具、换语言的实时参谋 详细解析 7月24日消息,Anthropic的Claude语音模式迎来重大升级。此次升级显著提升了Claude处理复杂问题的能力,同时增加了对多种模型…

    anthropic-Claude 2026年7月28日
  • xAI升级Grok Voice:新增21款多语言旗舰语音

    xAI 最近对 Grok Voice 进行了一次大升级,新增了21款旗舰级语音,同时优化了原有的5款经典语音。这次更新让 Grok 的语音能力从”能用”变成了”好用”。 21款新语音覆盖多场景 新增的21款语音不是简单的”换个人说话”,而是针对不同场景做了专门优化。客户服务、角色扮演、新闻播报、教育讲解………

    模型框架 2026年7月7日
  • Google Gemini 3.5实时翻译上线:70种语言同声传译,语调语速全保留

    核心看点 6月9日,Google推出Gemini 3.5实时翻译模型,支持70多种语言的实时语音到语音翻译。它能自动检测语言、保留说话者的语调语速,让跨语言交流真正变得自然流畅。 详细解析 技术突破:不只是翻译,是”同声传译” 与传统翻译工具不同,Gemini 3.5实时翻译模型实现了: 自动语言检测:无需手动选择源语言和目标语言,模型自动识别70+种语…

    Google Gemini 2026年6月22日
  • Claude语音模式重磅升级:终于支持中文了,还新增按下通话模式

    核心看点 中文支持终于来了:Claude语音模式打破英语限制,新增中文、日语、西班牙语等7种语言 新增按下通话模式:除了原有的免提连续对话,现在可以按住说话、松开发送,更像微信语音 Claude Fable 5持续霸榜:Anthropic迄今最强模型,编程、科研、视觉理解全面领先 CEO自曝随时可被解雇:阿莫迪公开公司治理结构,长期利益信托有权撤换CEO 正文 6月18日消息,…

    anthropic-Claude 2026年6月20日