开源项目 编辑推荐
边听边说还能后台干活:openJiuwen 开源全双工多模态 Agent
跟 AI 说话最别扭的地方,是你必须等它说完。如果它能一边听、一边说,还能同时帮你去后台查资料、…
文章目录
跟 AI 说话最别扭的地方,是你必须等它说完。如果它能一边听、一边说,还能同时帮你去后台查资料、调工具,对话的感觉就完全不一样了。
一分钟速览
- openJiuwen 发布 workSwarm,主打全双工多模态:像聊天一样与 Agent 交互,随时打断、追问、补充。
- 核心是让实时对话与 Core Agent 的后台执行真正并行,而不是轮流排队。
- 即使关闭全双工音视频,已经提交给 Core Agent 的任务仍可继续执行,结果会回到原对话。
- 工具任务可排队、调整、停止,音视频连接与后台任务被解耦。
- 支持 JoyAI 与 Qwen Omni 协议,并可在昇腾 NPU 上基于 vLLM-Omni 部署。
深度分析:把“回合制”改成“并行制”
传统语音助手是回合制的:你说话,它打断自己的思考,等你说完再回应。全双工颠覆了这个前提——用户随时可以打断,模型随时可以补充,并且后台任务不会因为对话结束而中断。
workSwarm 的价值不只是“边听边说”,而是把“前台对话”和“后台执行”拆成两条独立的流水线。你可以对着镜头发起一个查询,然后关掉音视频去忙别的,过一会儿回来查看结果;现场交代的工作,因此有了可追踪的执行过程。
数据支撑:双协议与国产算力适配
支持 JoyAI 与 Qwen Omni 两种协议,意味着上层应用可以灵活切换:JoyAI 走 ASR、LLM、TTS 三段拼接,Qwen Omni 则走 realtime websocket。更关键的是,它支持基于华为云 ModelArts、用 vLLM-Omni 在昇腾系列 NPU 上部署全双工多模态模型,给国产算力留出了完整通路。
趋势洞察:语音交互的下一站是“同事感”
当 AI 不再要求人迁就回合,人机协同的节奏就会接近人和同事之间的协作:边说边办,随时打断,任务持续推进。这类能力一旦进入客服、会议、户外作业等场景,效率提升会比单纯“语音转文字”大得多。
结语
全双工多模态的意义,不在于让 AI 说得更像人,而在于让它干活的方式更像人。
落地场景
这类能力的直接受益方是客服与现场作业:客服可以在通话中随时插入查询,不必让用户“稍等”;工程师可以一边巡检一边用语音记录,把后台任务交给 Agent 持续跟踪。核心价值不在于多智能,而在于不再打断人。
本文地址:https://www.163264.com/15869