DeepSeek V4-Flash-Vision-Exp 上线,开启多模态 API 服务

DeepSeek V4-Flash-Vision-Exp 上线,开启多模态 API 服务

2026年8月21日,DeepSeek正式在API平台上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp。开发者只需将模型名称设置为 deepseek-v4-flash-vision-exp,就能在原有V4-Flash强大文本能力的基础上,直接加入图片理解。这标志着DeepSeek从纯文本模型正式迈向多模态产品矩阵,也给开发者带来了低成本、高可用的视觉Agent新选择。

简单说,以前DeepSeek的V4-Flash已经在推理、代码Agent、世界知识等方面表现亮眼,但“看不见图”。现在V4-Flash-Vision-Exp补上了这一环:它能描述图片、识别截图里的文字、分析图表、理解界面布局,并把这些视觉信息无进Agent工作流。官方数据显示,纯文本能力(Agent、推理、世界知识等)与正式版V4-Flash基本持平;而在需要视觉理解的Agent基准测试上,表现大幅跃升,多模态Agent能力已接近Claude Opus-4.8。

为什么这次上线特别值得关注?

首先是性能平衡做得好。很多多模态模型加了视觉后,文本能力会打折。V4-Flash-Vision-Exp没有这个问题——文本侧继续保持原有水准,视觉侧则带来质的提升。Terminal Bench 2.1从82.7升到83.9,DeepSWE从54.4升到59.3,其他代码与工程相关基准也有进步。图表理解、界面分析等任务上更是明显拉开差距。

其次是价格友好。图片会被转换成token计费,单张图片最多只占384个token,价格与普通V4-Flash完全一致。没有额外的“视觉专项费用”。这意味着用多模态几乎不用多花多少钱,对频繁调用图片的Agent场景尤其划算。上下文窗口仍是100万token级别,最大输出可达38.4万token,支持思考模式、工具调用、JSON输出等,兼容OpenAI Chat Completions、Anthropic Messages和Responses API,方便接入现有框架。

再次是配套完善。同一天,DeepSeek还发布了Harness框架0.1.1版本,开箱即支持新模型。图片输入支持三种方式:Base64内联、外部公开URL,以及新上线的免费Files API。Files API允许先上传图片一次,之后用file_id反复引用,既省带宽又方便多轮对话。支持JPEG、PNG、GIF、WebP等常见格式,系统会根据实际文件内容识别,而不是依赖文件名。

能做什么?解锁更多实用Agent场景

有了视觉能力,Agent不再只是“看文字、写代码”,而是真正能“看图办事”。官方和社区已经展示了不少例子:

  • 根据用户上传的截图或参考图,生成商业定制PPT(比如西藏自驾游方案)。
  • 分析图表、仪表盘,提取关键数据并给出结论。
  • 识别网页或App界面截图,辅助重构网站或做前端Demo。
  • 结合工具调用,完成屏幕操作、数据提取、自动化调研等复杂工作流。

这些场景以前往往需要拆成“看图模型 + 文本模型”两步,现在一个模型就能搞定,延迟更低、一致性更好。

对开发者和行业的意义

DeepSeek这次动作很务实:先把文本Agent和Harness框架做好,再迅速补上视觉输入,形成完整闭环。实验性质的标签说明它还会持续迭代,但已经足够实用。对个人开发者和中小团队来说,这意味着可以用接近顶级多模态模型的Agent能力,却支付Flash级别的价格。对行业来说,它进一步推高了开源/开放API多模态Agent的性价比天花板。

想立刻体验的朋友,直接去DeepSeek API平台,把model参数改成deepseek-v4-flash-vision-exp即可。详细调用文档和Files API说明都已上线。从纯文本到多模态,DeepSeek用一周左右时间就把关键拼图补齐——这种“先把东西做出来再优化”的节奏,正是当前AI竞争中最务实的态度。

V4-Flash-Vision-Exp的上线,不只是“加了眼睛”,更是把视觉理解真正融入了低成本、高可用的Agent生态。对开发者而言,多模态不再是昂贵的附加功能,而是触手可及的生产力工具。接下来,就看大家如何用它创造更多有趣的应用了。

本文地址:https://www.163264.com/15081

(1)
商汤科技开源8B轻量多模态大模型:原生4K输出、全能视觉编辑
上一篇 9小时前
文本到视频:AnimateDiff
下一篇 2023年7月18日 上午12:14

相关推荐