阿里最近放出了新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,主打一个「专业领域听得准」。
说实话,语音识别在平常聊天场景已经挺成熟了,但一到医疗、法律、工业这些专业领域,模型就经常掉链子——术语太密集,很多词发音还相近,误判率居高不下。这次的新模型就是冲着这个痛点去的,据说在医疗听写场景里准确率已经飙到 95% 以上。
阿里这次开了三个不同版本的接口,从轻量版到高精度版都有,开发者按需取用。这种分层策略挺实在的:小团队用轻量版省成本,大企业用高精度版保质量。
现在智能助手、会议转写、无障碍辅助这些需求涨得很快,谁能把专业术语和方言口音吃透,谁就能在 B 端市场占住坑位。阿里这一步,显然是冲着这块蛋糕去的。
本文地址:https://www.163264.com/14474


微信扫一扫,鼓励一下~