📖 文章导读:
DeepSeek 终于给 V4 Flash 装上“眼睛”,多模态模型 V4-Flash-Vision-Exp 近期上线,在保持极低价格的同时补齐了视觉短板。本文将通过多轮真实使用场景测评,结果显示,其文本能力未缩水,视觉理解已达实用水平,尽管在复杂推断与代码精细度上有瑕疵,但仍是低成本 Agent 工作流的性价比利器。
8 月 21 日,DeepSeek 终于给 V4 Flash 装上了“眼睛”,上线了这款实验性多模态模型:DeepSeek-V4-Flash-Vision-Exp。
此前,V4 Flash 这条产品线一直以高吞吐、低成本见长,但之前它只能读取文字、代码、日志、文档,唯独不具备视觉能力。过去一周,DeepSeek Harness 的 GitHub 讨论区里,最高频的问题就是“怎么让 DeepSeek 看图”,开发者们甚至自己写了各种 vision bridge 插件,把图片先转成文字再塞给模型。
而现在,多模态这一空白终于被补齐,DeepSeek 总算把这块能力接进了自己的 V4 主力模型和 Agent 工作流里。

DeepSeek-V4-Flash-Vision-Exp 的特征很明确:文本能力基本维持 V4-Flash 正式版的水平(Agent、推理、世界知识等),视觉能力成了主要增量。
在纯文本 Agent、推理和世界知识等任务上,V4-Flash-Vision-Exp 与 V4-Flash 正式版大致持平;Terminal Bench 2.1、DeepSWE 等 Coding Agent 测试也有小幅提升。变化更明显的是加入视觉信息后的 Agent 任务。官方数据显示,它在 Chartography 等视觉理解基准上取得了明显成绩,并称多模态 Agent 能力已经接近 Opus 4.8。
与此同时,DeepSeek 也并未因增加了视觉能力就单独抬高价格。图片会被转换成 Token 计费,单张图片最多占 384 Tokens,整体价格与 V4-Flash 保持一致。API 支持 Chat Completions、Messages 和 Responses 三种调用格式,图片可通过 Base64、URL 或 Files API 传入,对于已经在使用 DeepSeek Agent 生态的开发者来说,接入门槛并不高。
榜单排名:

目前在Artificial Analysis榜单中位列第32位。
用户评价:

当然,模型后缀的 Exp 也提醒我们,它目前还是一个实验模型。对于真实使用场景中的截图识别、UI 理解、图表分析到底能做到什么程度,跑分显然回答不了。所以这次,302.AI将从几个维度展开本期的模型实测,看看其真实表现是否能达到预期水平。
1. 实测模型基础信息
(1)实测模型在 302.AI 的价格:
| 模型名称 | 上下文 | 说明 | 302.AI内的价格 |
|---|---|---|---|
| deepseek-v4-flash-vision-exp | 1000000 | 闲时价格 | 缓存读取:$ 0.007 / 1M tokens输入:$ 0.22 / 1M tokens输出:$ 0.66 / 1M tokens |
| 高峰期价格 (北京时间:09:00‑12:00,14:00‑18:00) | 缓存读取:$ 0.014 / 1M tokens输入:$ 0.44 / 1M tokens输出:$ 1.32 / 1M tokens | ||
| claude-opus-5 | 1000000 | 缓存写入:$ 5 / 1M tokens缓存读取:$ 0.5 / 1M tokens | 输入:$ 5 / 1M tokens输出:$ 25 / 1M tokens |
(2)测评目的:
本评测侧重模型对逻辑,数学,编程,多模态,人类直觉等问题的测试,非专业前沿领域的权威测试。旨在观察对比模型的进化趋势,提供选型参考。
(3)测评方法:
本次测评使用302.AI收录的题库进行独立测试。模型分别就逻辑与数学(共10题),人类直觉(共7题),多模态(共20题)以及编程模拟(共12题)进行案例测试,对应记分规则取最终结果,下文选取代表性案例进行展示。
题库地址:https://docs.google.com/spreadsheets/d/1sBxs60yWsxc9I5Va8Rjc1_le1Omg2hOXbwqOzpImZio/edit?gid=0#gid=0
💡记分规则:
按满分10分记分,设定对应扣分标准,最终取每轮得分的平均值。
(4)测评工具:
- 所有模型均在302.AI Stuidio客户端内使用对应模型,使用统一的提示词,取第一次生成结果
- 编程测试使用302.AI Stuidio客户端的Vibe模式:调用Claude Code沙盒
编程案例分数评级:
⭐⭐⭐⭐⭐ S 级(封神): 行业标杆,重新定义标准。
⭐⭐⭐⭐ A 级(卓越): 生产力合格,无明显短板。
⭐⭐⭐ B 级(优秀): 表现中规中矩,存在短板。
⭐⭐及以下 C级(不合格): 不可用,存在明显问题。
2. 测试结果总览
302.AI 多模态模型测评分数榜单:

3. 案例展示
案例 1:多模态逻辑推理
提示词:根据插画推测以下六张图分别代表哪部著名电影 答案: 1. 《Kill Bill》《杀死比尔》
2. 《Back to the Future》《回到未来》
3. 《American Pie》《美国派》
4. 《Million Dollars Baby》《百万美元宝贝》
5. 《The Matrix》《黑客帝国》
6. 《No Country for Old Men》《老无所依》

DeepSeek-V4-Flash-Vision-Exp:5 部推理正确

Claude Opus 5:4 部推理正确

提示词:按逻辑为漫画进行排序
答案:C → A → D → B

DeepSeek-V4-Flash-Vision-Exp:推理错误,有相关解释但逻辑比较牵强

laude Opus 5:推理正确,解释合理

案例 2:程序化 SVG 图形生成
提示词:将参考图展示的画面绘制为动态svg
参考图 1:

DeepSeek-V4-Flash-Vision-Exp 输出效果:

Claude Opus 5 输出效果:

提示词:将参考图展示的画面绘制为动态svg
参考图 2:

DeepSeek-V4-Flash-Vision-Exp 输出效果:

Claude Opus 5 输出效果:

简评:
两组模型都能准确理解和表达参考图画面逻辑,但在复杂图形构成和动态表现上都各有瑕疵。
| 测评点 | DeepSeek-V4-Flash-Vision-Exp | Claude Opus 5 |
| 语义表达准确度 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 图形构造复杂度 | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| 动态实现质量 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
案例 3:网页复刻
提示词:复刻截图所展示的网页。
网页截图:

(来源:Zama Khan Mohammed)
DeepSeek-V4-Flash-Vision-Exp 输出效果:
Claude Opus 5 输出效果:
简评:
两组模型都较完整地还原了网页内容,DeepSeek-V4-Flash-Vision-Exp 在排版布局上与原网页相近度更高,Opus 5 的整体视觉风格协调性更强。
| 测评点 | DeepSeek-V4-Flash | Claude Opus 5 |
| 功能完整性 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 视觉表现力 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| 还原度 | ⭐⭐⭐⭐ | ⭐⭐⭐ |
案例 4:建筑草图复原
提示词:
根据参考图理解房间的空间结构,将其还原为一个可交互的Three.js 3D场景。
尽可能准确地复现图中的房间布局、建筑结构、家具位置、比例关系、材质、色彩和灯光氛围,并根据参考图合理推断不可见的空间结构。
视角支持鼠标旋转、缩放和自由查看。整体效果应尽可能还原参考图的空间感和视觉风格。
参考图:

DeepSeek-V4-Flash-Vision-Exp 输出效果:
简评:
✅ 核心优势:
- 基础设施较还原,配色系统更大胆明亮,灯光系统非常完整,光线自然和谐;
- 明确设定了房间尺寸,所有家具的位置和比例关系都较为严谨。
❌ 不足之处:
- 代码组织方式较为传统,使用
<script>标签直接加载,未使用 ES Module; - 部分装饰物几何精度一般,形状略显生硬,窗户严重穿模。
Claude Opus 5 输出效果:
简评:
✅ 核心优势:
- 代码架构现代且优雅,使用
ES Module方式引入 Three.js,符合当前主流开发规范; - 更具风格化和艺术感,低饱和色系搭配,整体调性非常统一。
❌ 不足之处:
- 右侧窗户处理与参考图区别较大,部分家具出现穿模;
- 虽然也构建了从窗户射入的方向光,但与窗户的物理关联性不够紧密。
| 测评点 | DeepSeek-V4-Flash | Claude Opus 5 |
| 建模质感 | ⭐⭐⭐ | ⭐⭐⭐ |
| 视觉表现力 | ⭐⭐⭐ | ⭐⭐⭐ |
| 还原度 | ⭐⭐⭐ | ⭐⭐⭐ |
4. DeepSeek-V4-Flash-Vision-Exp 模型实测结论

综合测试结果来看,DeepSeek-V4-Flash-Vision-Exp 的视觉能力已经达到了日常实用的水平。
首先,文本能力没缩水。 在逻辑推理、代码生成等纯文本任务上,它基本延续了 V4-Flash 正式版的水平。视觉能力的加入没有明显牺牲原本的 Agent 和编程能力,这也是它作为 V4-Flash 视觉版最重要的基础。
其次,视觉能力的加入,确实改变了使用边界。在多模态逻辑推理中,模型能够准确理解大部分图片信息。更重要的是,进入图片驱动的编程任务后,它能完成从理解参考图、提取视觉和空间信息,再转换成代码的过程。网页复刻中,DeepSeek-V4-Flash-Vision 的页面布局还原度表现较佳,建筑草图建模也能较好地处理房间结构、家具位置和整体空间关系。和 Claude Opus 5 对比来看,两者各有胜负,DeepSeek 在网页布局还原、空间结构理解上并不吃亏,而在复杂图形构造的精细度和代码组织规范性上,则还有差距。
最后,短板也很明显。 漫画排序的逻辑推理案例翻车,暴露了模型在遇到需要同时结合视觉线索、时序关系和多步推断的复杂任务时,稳定性仍然不足。SVG 动态图形和 Three.js 场景生成中,几何精度、细节表现也会出现瑕疵,整体效果能用,但完成度有限。如果只是追求极强的单项视觉理解或最高质量的前端生成,它暂时未能取代或超越 Opus 5 这类更高定位的模型。
考虑到目前 V4-Flash-Vision-Exp 版本与 V4-Flash 保持了相同价格,本次升级的性价比仍具吸引力。对于原本就使用 DeepSeek API 的用户来说,纳入视觉能力几乎没有额外的使用门槛,却让 Agent 多了一层感知能力。放在 DeepSeek 自己的产品体系里看,V4-Flash-Vision-Exp 更重要的意义在于,把图片真正接进了低成本、高吞吐的 Agent 工作流。
“Exp”的后缀意味着模型还在迭代,这还不是它的最终形态。至于下一阶段会带来怎样的能力变化,仍值得继续期待。
常见问题 FAQ
Q1:DeepSeek-V4-Flash-Vision-Exp 是什么?和 V4-Flash 有什么区别?
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 在 V4-Flash 基础上推出的实验性多模态模型,新增图像理解能力,同时保留文本、推理和 Agent 能力。它支持图像输入,视觉能力是主要增量,整体价格与 V4-Flash 保持一致。相比原版 V4-Flash,Vision-Exp 更适合截图分析、图表理解、UI 识别和视觉辅助 Agent 工作流。
Q2:DeepSeek-V4-Flash-Vision-Exp 的视觉能力有多强?
DeepSeek-V4-Flash-Vision-Exp 可以处理截图、图表、界面和建筑草图等视觉输入,并将图像信息纳入 Agent 任务。根据 302.AI 实测,它的视觉理解已经达到实用水平,适合多模态逻辑推理、网页复刻和建筑草图复原。不过,在复杂视觉推断和细节识别上仍可能出现偏差,不能把实验版本当作完全成熟的视觉旗舰。
Q3:DeepSeek-V4-Flash-Vision-Exp 支持多模态 Agent 吗?
支持。模型可以将图像理解与文本推理、工具调用和代码任务结合,适合截图分析、UI 理解、图表分析和视觉辅助的 Agent 工作流。官方称其多模态 Agent 能力已经接近 Opus 4.8,但这是基于特定基准和官方口径,实际效果仍需要结合任务类型、提示词和工具链进行验证。
Q4:DeepSeek-V4-Flash-Vision-Exp 的价格是多少?
根据 302.AI 当前页面,闲时缓存读取价格为 $0.007/百万 Token,输入 $0.22/百万 Token,输出 $0.66/百万 Token;高峰期缓存读取为 $0.014/百万 Token,输入 $0.44/百万 Token,输出 $1.32/百万 Token。图片会转换为 Token 计费,单张图片最多占 384 Tokens。具体价格以 302.AI API 超市实时页面为准。
Q5:DeepSeek-V4-Flash-Vision-Exp 支持哪些图片调用方式?
DeepSeek-V4-Flash-Vision-Exp 的 API 支持 Chat Completions、Messages 和 Responses 三种调用格式。图片可以通过 Base64、URL 或 Files API 传入。对于已经使用 DeepSeek Agent 生态的开发者来说,通常不需要重新搭建完整系统,只需根据接口要求增加图像输入字段即可完成适配。
Q6:DeepSeek-V4-Flash-Vision-Exp 擅长哪些场景?
根据 302.AI 的 4 个实测案例,DeepSeek-V4-Flash-Vision-Exp 主要适合:1)多模态逻辑推理;2)程序化 SVG 图形生成;3)网页复刻;4)建筑草图复原。此外,它也适合截图识别、UI 理解、图表分析以及低成本的视觉 Agent 工作流。对于需要高频调用视觉能力的应用,它的价格优势比较明显。
Q7:DeepSeek-V4-Flash-Vision-Exp 有哪些局限性?
DeepSeek-V4-Flash-Vision-Exp 目前仍是实验性模型,主要局限包括:1)复杂视觉推断和细节理解仍可能出错;2)部分代码生成和工程细节不够精确;3)Artificial Analysis 榜单中位列第 32 位,综合能力并非顶尖;4)官方基准表现不能完全代表真实工作流体验。因此,它更适合作为低成本多模态 Agent 组件,而不是所有视觉任务的旗舰替代品。
Q8:如何在 302.AI 上调用 DeepSeek-V4-Flash-Vision-Exp API?
在 302.AI 调用 DeepSeek-V4-Flash-Vision-Exp 的步骤是:1)注册并充值 302.AI 账号;2)进入 API 超市,搜索 DeepSeek-V4-Flash-Vision-Exp;3)获取 API Key;4)使用在线调试功能测试;5)按照接口文档,通过 Chat Completions、Messages 或 Responses 接口传入文本和图片。也可以通过 Base64、URL 或 Files API 传图,并接入 Python、Node.js 等应用。
5. 如何在 302.AI 上使用
1. 使用302.AI客户端
步骤指引:对话框内选择模型菜单

输入deepseek-v4即可获取相应版本调用

2. 聊天机器人中使用
步骤指引 :应用超市→聊天机器人→立即体验

选择模型:国产模型→deepseek-v4-flash-vision-exp→确认

3. 使用模型 API
步骤指引:API超市→语言大模型→Deepseek→deepseek-v4-flash-vision-exp

点击【Playground】在线调用 API

想即刻体验 DeepSeek-V4-Flash-Vision-Exp 模型?
👉立即注册免费试用302.AI,开启你的AI之旅!👈
为什么选择302.AI?
● 灵活付费:无需月费,按需付费,成本可控
● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求
● 开源生态:支持开发者深度定制,打造专属AI应用
● 易用性:界面友好,操作简单,快速上手
