模型框架 编辑推荐
Cloudflare 推出开放权重决策模型 Clef-omni,支持音频视频输入
Cloudflare 发布了一款新的开放权重决策模型,叫 Clef-omni。它最大的变化是,一…
文章目录
Cloudflare 发布了一款新的开放权重决策模型,叫 Clef-omni。它最大的变化是,一次 API 调用就能处理文本、图像、音频和视频,不用再分别对接多个模型。
这个模型是在此前 Clef 系列的基础上做的多模态升级。之前的 Clef 支持文本、图像,以及把视频按时间抽成一张张静态图再输入;而 Clef-omni 直接支持音频和完整视频,wav、mp3、mp4、webm 这些格式都能处理。
对开发者来说,好处很实在:不用再自己搭语音转写、音视频拆分那一套流程,一个模型就能搞定多种输入。
技术上,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,保留了主要理解能力,面向的是结构化决策任务,不生成普通文本输出。速度方面,纯文本请求的中位响应时间约 130 毫秒,图像约 150 毫秒,一段带声音的 21 秒视频约 1.5 秒就能完成评分。
价格也跟着降了。Clef-flash 每百万输入 Token 的价格从 0.09 美元降到 0.038 美元,降幅约 58%,不过托管版的上下文窗口也从 64k 缩到了 24k。
本文地址:https://www.163264.com/16719