跳到文章正文
大模型 编辑推荐

微软发布 MAI-Transcribe-2-Streaming:2.5% 词错误率、0.13 秒延迟登顶

开会时的实时字幕,最怕两件事:一是慢半拍,人已经说完了,字幕还在后面追;二是错得离谱,把“季度目…

开会时的实时字幕,最怕两件事:一是慢半拍,人已经说完了,字幕还在后面追;二是错得离谱,把“季度目标”听成“季节目标”。微软最新发布的流式语音转写模型,想同时解决这两个问题。它叫 MAI-Transcribe-2-Streaming,官方给出的成绩单是:词错误率低至 2.5%,端到端延迟仅 0.13 秒,在多项实时评测中拿下第一。

一分钟速览

  • 微软推出首个实时流式语音转写模型 MAI-Transcribe-2-Streaming;
  • 可在讲话进行中持续输出文字,覆盖 60 种语言;
  • 支持自动语言检测,适合实时对话与字幕场景;
  • 优惠期价格为每小时 0.54 美元,约合每分钟 0.009 美元;
  • 接到音频后约 100 多毫秒生成首批“部分文本”,并持续修正。

“流式”和“非流式”,差在哪

要理解这个模型的定位,得先分清两类转写。非流式转写是“听完再写”:把整段音频处理完,一次性给出完整文本,适合录音文件、会议纪要和临床文书。微软此前已推出非流式的 MAI-Transcribe-2,价格更低一些。而流式转写是“边听边写”:一边讲话,一边把文字吐出来,适合实时对话和现场字幕。

MAI-Transcribe-2-Streaming 走的是后一条路。它会在收到音频后约 100 多毫秒内生成第一批“部分文本”,随后随着上下文增加不断修正,等一句话说完,再快速提交稳定结果。微软称,在实时评估中,文字最快可在语音出现后约 320 毫秒显示出来。对字幕这类场景来说,几百毫秒的差别,体验上就是“跟得上”和“总在追”的区别。

数据支撑:把延迟压进毫秒级

官方给出的两项关键指标值得拆开看。第一是准确率,2.5% 的词错误率意味着每 40 个词大约错 1 个,已经接近可用字幕的门槛;第二是延迟,0.13 秒的端到端延迟,让“边说边显示”成为可能。再叠加 60 种语言覆盖和自动语言检测,这个模型瞄准的是全球化、多人多语的实时沟通场景。

价格方面,MAI-Transcribe-2-Streaming 目前处于优惠阶段,每小时 0.54 美元,约合每 1000 分钟 9 美元。开发者可以通过 Microsoft Foundry、MAI Playground、OpenRouter 等渠道体验或接入。对做会议、客服、直播和在线教育的团队来说,这个价位处于“可以大规模试”的区间。

趋势洞察

语音转写正在从“事后整理”变成“实时基建”。一旦延迟降到几百毫秒、错误率降到个位数,实时字幕就能真正用于会议记录、无障碍沟通、跨语言谈判,甚至给 AI 智能体提供“实时听觉”。这也意味着,语音接口会成为大模型多模态竞争中越来越关键的一环——谁先把“听得准、反应快、还便宜”做到位,谁就更容易接管人与机器之间的第一道入口。

与此同时,低价流式转写也会加速一批应用的诞生:实时翻译耳机、会议助手、客服质检、播客自动字幕……基础设施一旦便宜,上层应用就会密集冒出来。

结语

MAI-Transcribe-2-Streaming 不是那种能上头条的炫技模型,但它更像是“水电煤”级别的能力升级。当机器能把人类话语实时、准确地变成文字,很多过去要人工完成的活儿,都会被悄悄改写。

本文地址:https://www.163264.com/16017