阿里发布 Qwen-Audio-3.0-ASR-Flash:专业场景语音识别新突破

阿里最近放出了新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,主打一个「专业领域听得准」。

说实话,语音识别在平常聊天场景已经挺成熟了,但一到医疗、法律、工业这些专业领域,模型就经常掉链子——术语太密集,很多词发音还相近,误判率居高不下。这次的新模型就是冲着这个痛点去的,据说在医疗听写场景里准确率已经飙到 95% 以上

阿里这次开了三个不同版本的接口,从轻量版到高精度版都有,开发者按需取用。这种分层策略挺实在的:小团队用轻量版省成本,大企业用高精度版保质量。

现在智能助手、会议转写、无障碍辅助这些需求涨得很快,谁能把专业术语和方言口音吃透,谁就能在 B 端市场占住坑位。阿里这一步,显然是冲着这块蛋糕去的。

本文地址:https://www.163264.com/14474

(0)
AI日报:豆包搜索开放、人机双写落地、GPT-5.6家族亮相
上一篇 1天前
面壁智能估值破200亿:端侧AI不想只做「几块钱的组件」
下一篇 22小时前

相关推荐