📖 文章导读:
9 月 10 日,DeepSeek V4.1 Flash发布。新模型采用全新架构,原生补齐多模态,大幅压缩KV Cache并下调价格,正式接棒V4 Pro。本期测评通过真实任务实测发现,其展现出逼近甚至局部超越 Pro 的能力,性价比极高。虽极限复杂任务仍有瑕疵,但“Pro 级能力、Flash 级价格”已初步坐实。一文解析其实战表现与选型参考。
9 月 10 日,DeepSeek 正式发布 Deepseek V4.1 Flash。本次新版本在性能、速度、成本和任务总用时几个维度上都超过了 V4 Pro,官方表示将在 9 月 14 日之后把 V4 Pro 的 API 请求全部转向 V4.1 Flash。
看来本次的 V4.1 Flash 确实不是此前那种常规的小版本更新。它换上了全新的 Causal-Encoder-Decoder 架构,总参数达到 552B,输入侧只激活 8B,输出侧激活 16B;同时原生加入视觉理解,KV Cache 继续大幅压缩,API 价格也再次下调。简单来说,DeepSeek 旨在让一个 Flash 模型,承担越来越多原本属于 Pro 的工作,同时把推理成本继续往下压。

- 模型架构换代
V4.1 Flash 是 DeepSeek 新架构系列中最小的一款模型,总参数规模达到 552B,采用 MoE 结构,这使得它很适配 Agent 场景。Coding Agent 往往需要反复读取代码仓库、工具说明和历史上下文,最后只输出少量代码或工具指令。输入、输出采用不同的计算规模,可以减少信息读取环节的计算开销。
从官方公布的 Benchmark 来看,V4.1 Flash 在 GPQA Diamond、Codeforces、MathArena Apex、Terminal-Bench、CyberGym 等测试中表现突出,部分项目超过 V4 Pro。不过在 Terminal-Bench 3.0/4.0、ProgramBench 等项目上,它与顶级闭源模型仍有差距。综合来看,这次升级的重点仍在于能力、速度和成本之间的平衡。
- 原生多模态补齐
此前 DeepSeek 的视觉能力更多通过 V4-Flash-Vision-Exp 这类实验版本提供,这一次,V4.1 Flash 直接把视觉理解并进主力模型。图片、截图、图表、PDF 等内容,都可以进入同一套模型流程。
这对 Agent 场景尤其重要。现实任务很少只有纯文本:网页里有截图,产品文档里有流程图,代码任务里有报错界面,办公文件里还有表格和 PDF。模型能够直接把这些信息放进同一个任务上下文里处理,使用方式会顺手很多。
- KV Cache 再砍一刀
新一代模型大幅缩小 KV Cache,相比上一代,HBM 需求降到 1/4,SSD 需求降到 1/8;相对初代模型,KV Cache 已缩小 437 倍。如果缓存占用和缓存命中价格持续下降,那么一个 Agent 连续跑几十轮、上百轮任务的成本也会跟着下降。V4.1 Flash 这次把缓存、架构和价格放在一起优化,目的就是让模型更适合持续工作。
- 价格和能力同时上升
V4.1 Flash 的 API 继续峰谷定价,闲时价格为高峰的一半,新价格 9 月 10 日 12:00 生效。与此同时,官方宣布在 9 月 14 日 12 点之后逐步下线 V4 Pro,让原本指向 V4 Pro 的请求直接转到 V4.1 Flash。从这一动作不难看出新模型的定位:Flash 开始承担主力模型的位置。
榜单排名

在目前Artificial Analysis榜单中排名37位,Flash模型中排名第6。
用户评价

在规格、Benchmark 和价格之外,那些集中在 Coding、Agent、多模态和长上下文等实际跑起来才能感受到差异的场景才是我们最关心的部分。因此302.AI准备了几组实测,看看模型在真实任务里的表现,究竟能否将“Pro 级能力、Flash 级价格”这句话坐实。
1. DeepSeek-V4.1-Flash 模型基础信息
(1)实测模型在 302.AI 的价格:
| 模型名称 | 上下文 | 说明 | 302.AI内的价格 |
|---|---|---|---|
| deepseek-v4.1-flash | 1000000 | 闲时价格 | 缓存读取 $0.003 / 1M tokens输入 $0.15 / 1M tokens输出 $0.6 / 1M tokens |
| 高峰期价格 | 缓存读取 $0.006 / 1M tokens输入 $0.3 / 1M tokens输出 $1.2 / 1M tokens |
(2)测评目的:
本评测侧重模型对逻辑,数学,编程,多模态,人类直觉等问题的测试,非专业前沿领域的权威测试。旨在观察对比模型的进化趋势,提供选型参考。
(3)测评方法:
本次测评使用302.AI收录的题库进行独立测试。模型分别就逻辑与数学(共10题),人类直觉(共7题)以及编程模拟(共12题)进行案例测试,对应记分规则取最终结果,下文选取代表性案例进行展示。
题库地址:https://docs.google.com/spreadsheets/d/1sBxs60yWsxc9I5Va8Rjc1_le1Omg2hOXbwqOzpImZio/edit?gid=0#gid=0
💡记分规则:
按满分10分记分,设定对应扣分标准,最终取每轮得分的平均值。
(4)测评工具:
- 所有模型均在302.AI Stuidio客户端内使用对应模型,使用统一的提示词,取第一次生成结果
- 编程测试使用302.AI Stuidio客户端的Vibe模式:调用Claude Code沙盒
编程案例分数评级:
⭐⭐⭐⭐⭐ S 级(封神): 行业标杆,重新定义标准。
⭐⭐⭐⭐ A 级(卓越): 生产力合格,无明显短板。
⭐⭐⭐ B 级(优秀): 表现中规中矩,存在短板。
⭐⭐及以下 C级(不合格): 不可用,存在明显问题。
2. 测试结果总览
302.AI 多模态模型测评分数榜单:

3. DeepSeek-V4.1-Flash 案例展示
案例 1:程序化 SVG 图形生成
绘制一幅旋转木马正在运作的动态svg图
DeepSeek-V4.1-Flash 输出效果:

绘制一幅滑板少年腾空完成 Ollie 的动态 svg 图
DeepSeek-V4.1-Flash 输出效果:

简评:
V4.1-Flash 输出的图形构成复杂度、场景氛围都比较到位,只有在动态表现上出现较明显瑕疵,例如滑板上的人物有起跳、悬空和降落的腿部关节变化表现,但手部动态表现不合理。
案例 2:网页复刻
提供网址:https://v0.app/templates/mono-ecommerce-template-YZqpzOQAqeb?b=deployment
要求模型像素级复刻网页
DeepSeek-V4.1-Flash 输出效果:
简评:
整体还原度较高,网页基本结构完整得到完整复刻,动效实现基本与原网页一致,只有以下部分细节处存在区别:
字体部分区别:

排版部分区别:

案例 3:3D 小球倾倒模拟
Create a single-page HTML 3D animation using Three.js.
Build a clean product-style scene with a transparent rectangular box containing about 30 colorful balls.
Animation:
1. The box slowly tilts to one side, causing the balls to fall out naturally.
2. The balls roll, bounce, and collide with each other and the ground.
3. After a short pause, the balls gradually roll back toward the box.
4. The balls enter the box and settle back inside.
5. The animation then loops.
Requirements:
- Use Three.js and JavaScript.
- Simulate basic gravity, velocity, collision, bouncing, and friction.
- Avoid balls passing through each other, the box, or the ground.
- The balls should have natural physical movement rather than simply following predefined paths.
- Add soft lighting, shadows, and a clean light-colored background.
- Add Play / Replay controls.
- Allow mouse drag to rotate the camera and scroll to zoom.
- Make the layout responsive.
Focus on realistic physics and smooth transitions. Avoid clipping, floating, teleportation, or obviously scripted-looking movement.
DeepSeek-V4.1-Flash 输出效果:
完整网页:https://ho5ricbk16.302ai.app
录屏展示:
附 DeepSeek-V4-Pro 效果对比:
完整网页:https://8sqqou9h6b.302ai.app/
录屏展示:
简评:
DeepSeek-V4.1-Flash 输出的小球倾倒模拟器,在建模质感、比例关系、控制面板方面的完成度都明显优于 V4 Pro,在最重要的动态表现上也出色完成,小球运动未见明显违背物理逻辑的状态。
案例 4:Three.js 交互式世界
Create a polished, cinematic 3D railway simulator entirely in Three.js. Build a continuous countryside railway where a passenger train travels from a small station through a village, dense forest, mountain valley, dramatic bridge, and dark tunnel before emerging beside a beautiful lake.
Procedurally generate the train, tracks, terrain, trees, buildings, bridges, tunnels, signals, and other environmental details without Blender or external 3D assets. Give the train realistic motion with rotating wheels, subtle suspension, headlights, and smoke, while adding moving cars, birds, animated water, and swaying vegetation to make the world feel alive.
Use cinematic camera movements that follow the train, reveal wide landscapes, and showcase key moments along the journey. Make the environment gradually shift from warm countryside to mysterious forest, dramatic mountains, and a bright lakeside finale. Prioritize visual richness, smooth animation, atmospheric lighting, and a strong sense of scale while keeping everything performant in the browser.
DeepSeek-V4.1-Flash 输出效果:
完整网页:https://v9ia0i417b.302ai.app
录屏展示:
简评:
✅ 核心优势:
- 庞大的场景建造,使用 InstancedMesh 布置了 2000 松树、950 阔叶、2400 灌木、520 巨石、9000 草、2600 花、1800 芦苇,代码工程量大;
- 苛刻的细节打磨,蒸汽机车构造包括烟箱、火箱、烟囱、司机室、连杆、十字头、汽笛、钟、头灯等大量细节元素,动态上悬挂 bob 与速度成正比,符合实际物理直觉;
- 良好的氛围实现,9 段 ATMOS 关键帧覆盖颜色、太阳高度角、雾密度、云量等,天空颜色变化曲线完整;
- 工程架构清晰,分 part 1–8 逐层构建,每帧逻辑高度解耦。
❌ 不足之处:
- 文件体量与结构过大,单文件近 4000 行,首次解析成本高;
- 物理动画存在瑕疵,部分场景车厢运动脱离轨道;
- 场景贴图部分翻车,植物悬浮于地面之上。
4. DeepSeek-V4.1-Flash 模型实测结论

先说结论,虽然 V4.1 版本以 Flash 作为后缀命名,但模型展现现出了接近甚至超越 V4 Pro 的能力。在本次测试涉及的编程、3D 场景构建、物理模拟和多模态任务中,都展现出了较高的完成度与稳定性,部分案例的实际表现甚至比 V4 Pro更加出彩。
优势
- 编程能力提升明显
优势方面,最直观的还是编程能力。本次测试里的 SVG 动态图、网页复刻、Three.js 铁路模拟器以及小球物理模拟任务,都能看出 V4.1 Flash 对复杂需求的拆解和实现能力有了提升。尤其是 3D 小球倾倒案例,模型需要同时处理场景建模、重力、碰撞、反弹、摩擦、箱体倾斜和交互控制,最终输出的模型在建模质感、比例关系、控制面板和动态表现上都完成得比较完整,小球运动也没有出现明显违背物理逻辑的情况。相比 V4 Pro,这种综合型 Coding 任务的完成度提升更加直观;而在复杂 Three.js 案例里,模型同样能够搭建出规模较大的场景,并处理灯光、动画和环境细节,并且保持在单文件 4000 行代码的长程任务中持续输出、思考并反复验证交付效果。
- 多模态能力补足使用体验
原生多模态则进一步补足了模型的实际使用体验。图片、截图、图表、PDF 等内容可以直接放进同一套工作流里处理,对于需要结合视觉信息完成任务的 Agent 来说更加方便,同时也能较好地保持输出内容的视觉审美和整体风格。再加上更低的 API 价格和更小的 KV Cache,V4.1 Flash 在长上下文、多轮调用和持续执行任务这些场景里也有一定优势。
不足
- 复杂任务稳定性欠佳
虽然在某部分具体任务中,V4.1 Flash 表现出超越 V4 Pro 的能力,但其上限仍和真正的主流旗舰模型存在距离。它在复杂 Coding、3D 场景和 Agent 类任务上已然进行了大幅优化,但一旦把任务难度继续往上拉,稳定性依然会出现波动。譬如案例中铁路模拟器出现车厢脱轨、植物悬浮、大规模穿模等问题。小球模拟虽然整体完成度不错,但这类结果更多体现了它已经具备处理复杂任务的能力,距离旗舰模型那种长期保持高质量、独特审美以及低错误率的表现还有一段距离。
- 性价比优势并不绝对
此外,从实际使用成本来看,V4.1 Flash 也并未形成压倒性的性价比优势。API 价格确实够低,尤其是缓存命中后的输入成本已经极具吸引力,但如果把能力、稳定性和价格放在一起比较,GLM 5.3 Flash 这类同级模型具备更强的竞争力。对于不同任务类型的成本把控,也很难单纯用 API 单价来一概而论。
常见问题 FAQ
Q1:DeepSeek-V4.1-Flash 是什么?和 V4 Pro 是什么关系?
DeepSeek-V4.1-Flash 是 DeepSeek 于 2026年9月10日发布的新一代模型,采用全新 Causal-Encoder-Decoder 架构,总参数 552B,输入侧激活 8B、输出侧激活 16B,并原生补齐视觉理解能力。官方宣布 9 月 14 日 12 点后逐步下线 V4 Pro,原本指向 V4 Pro 的 API 请求将全部转向 V4.1 Flash。根据 302.AI 实测,它展现出接近甚至部分超越 V4 Pro 的能力,正式接棒成为主力模型。
Q2:DeepSeek-V4.1-Flash 的新架构有什么特点?
V4.1 Flash 采用全新 Causal-Encoder-Decoder 架构,总参数 552B 的 MoE 结构,输入侧只激活 8B、输出侧激活 16B。这种设计专为 Agent 场景优化:Coding Agent 往往需要反复读取代码仓库、工具说明和历史上下文,最后只输出少量代码或指令,输入输出采用不同计算规模可以显著减少信息读取环节的计算开销。同时它大幅压缩 KV Cache,相比上一代 HBM 需求降到 1/4、SSD 需求降到 1/8,相对初代已缩小 437 倍。
Q3:DeepSeek-V4.1-Flash 支持多模态吗?
支持。此前 DeepSeek 的视觉能力通过 V4-Flash-Vision-Exp 等实验版本提供,V4.1 Flash 首次把视觉理解并入主力模型:图片、截图、图表、PDF 等内容都可以进入同一套模型流程处理。这对 Agent 场景尤其重要——网页截图、产品流程图、报错界面、办公表格都可以直接放进同一个任务上下文,不需要再借助 vision bridge 之类的中转方案。
Q4:DeepSeek-V4.1-Flash 的价格是多少?
API 继续峰谷定价,闲时价格为高峰的一半:302.AI 平台闲时缓存读取 $0.003/百万 Token、输入 $0.15/百万 Token、输出 $0.6/百万 Token;高峰期缓存读取 $0.006、输入 $0.3、输出 $1.2/百万 Token,支持 1M 上下文。缓存命中后的输入成本极低,对连续跑几十轮、上百轮任务的 Agent 工作流成本优势明显。新价格 9 月 10 日 12:00 生效。
Q5:DeepSeek-V4.1-Flash 的编程和 3D 能力如何?
编程能力是 V4.1 Flash 提升最直观的方向。302.AI 实测中,SVG 动态图、网页复刻、Three.js 铁路模拟器和 3D 小球物理模拟都有较高完成度:小球倾倒案例在建模质感、比例关系、控制面板和动态表现上明显优于 V4 Pro;铁路模拟器用 InstancedMesh 布置了近 1.7 万株植物石块,在单文件 4000 行代码的长程任务中持续输出并反复验证。部分综合型 Coding 任务的表现甚至超过 V4 Pro。
Q6:DeepSeek-V4.1-Flash 在榜单上的排名如何?
在 Artificial Analysis 榜单中,DeepSeek-V4.1-Flash 位列第 37 位,在 Flash 模型中排名第 6。官方 Benchmark 显示它在 GPQA Diamond、Codeforces、MathArena Apex、Terminal-Bench、CyberGym 等测试中表现突出,部分项目超过 V4 Pro;但在 Terminal-Bench 3.0/4.0、ProgramBench 等项目上与顶级闭源模型仍有差距。升级重点在能力、速度和成本的平衡。
Q7:DeepSeek-V4.1-Flash 有哪些局限性?
根据 302.AI 实测:1)复杂任务稳定性欠佳——铁路模拟器出现车厢脱轨、植物悬浮、穿模等问题,与旗舰模型长期保持高质量、低错误率的表现还有距离;2)性价比优势并不绝对——API 单价够低,但把能力、稳定性和价格放在一起比较,GLM-5.3-Flash 等同级模型具备更强竞争力。它坐实了 Pro 级能力、Flash 级价格,但离全能旗舰仍有一段路。
Q8:V4 Pro 下线后老用户怎么办?V4.1 Flash 适合哪些场景?
官方将于 9 月 14 日 12 点后逐步下线 V4 Pro,原请求自动转向 V4.1 Flash,无需改代码但建议重新验证效果。适用场景:1)Coding Agent 与多轮工具调用——输入输出不对称激活加超小 KV Cache 天然适合;2)结合截图、图表、PDF 的多模态任务;3)预算敏感的高频调用——闲时价格只有高峰一半。极限复杂长任务且对最终交付质量要求高的场景,仍建议对比顶级旗舰。
Q9:如何在 302.AI 上调用 DeepSeek-V4.1-Flash API?
在 302.AI 调用 DeepSeek-V4.1-Flash 有三种方式:1)客户端——对话框内选择模型菜单,输入 deepseek-v4.1 获取对应版本;2)聊天机器人——应用超市→聊天机器人→国产模型→deepseek-v4.1-flash→确认;3)API——API超市→语言大模型→Deepseek→deepseek-v4.1-flash→点击 Playground 在线调用。302.AI 按需付费、无需月费,成本可控。
5. 如何在 302.AI 上使用
1. 使用302.AI客户端
步骤指引:对话框内选择模型菜单

输入deepseek-v4.1即可获取相应版本调用

2. 聊天机器人中使用
步骤指引 :应用超市→聊天机器人→立即体验

选择模型:国产模型→deepseek-v4.1-flash→确认

3. 使用模型 API
步骤指引:API超市→语言大模型→Deepseek→deepseek-v4.1-flash

点击【Playground】在线调用 API

想即刻体验 DeepSeek-V4.1-Flash 模型?
👉立即注册免费试用302.AI,开启你的AI之旅!👈
为什么选择302.AI?
● 灵活付费:无需月费,按需付费,成本可控
● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求
● 开源生态:支持开发者深度定制,打造专属AI应用
● 易用性:界面友好,操作简单,快速上手
