deepseek-v4.1-flash

deepseek-v4.1-flash

DeepSeek全新一代“越级智商 + 极速高吞吐”开源大模型
2026-09-10
语言大模型
Model capability: thinkingModel capability: function_call
缓存读取:
$0.003/1M tokens
输入:
$0.15/1M tokens
输出:
$0.6/1M tokens
大额采购联系客户经理享专属优惠

API介绍

DeepSeek-V4.1-Flash 是DeepSeek 全新一代面向高并发、复杂长程智能体与工程级代码交付打造的“越级智商 + 极速高吞吐”开源大模型。模型采用 552B 骨干 MoE 架构并融合了 196B Engram 模块(Prefill 仅激活 8B,Decode 激活 16B),实现了推理吞吐量(最高达 400+ TPS)与首字延迟的跨越式跃升。在多项严苛的真实场景测试中,V4.1-Flash 的综合推理质量与复杂工作流完成速度已全面超越上一代模型 V4 Pro,是企业规模化跑 AI 代码助手、智能体集群与高密工作流的绝对性价比杀手。

───────────────────────────────────────────────────────────────────

核心能力

智力越级与全量路由替代: 在内部与外部测试中,V4.1-Flash 的综合性能、生成速度与任务完成度全面超越上代旗舰 V4 Pro。

Engram 架构与极致 KV Cache 压缩: 结合 196B Engram 嵌入模块与全新 QAT 压缩算法,将 1M 超长上下文的 KV Cache 显存占用大幅压缩至 ~900MB,长文本Prefill 与连续追问体验极佳。

极致的高吞吐速度(高达 400+ TPS): 端到端推理速度大幅提升,首字响应极快,非常适合高并发 API 接入与实时交互系统。

1M 超长上下文与自动无感缓存: 原生支持 1,000,000 (1M) Tokens 窗口与最高 384K Tokens 导出,无需手动配置,原生支持磁盘级 Context Caching 自动命中。

Playground

登录后,探索更多精彩功能! 点击登录

API统计

API列表 (3)

API描述接口地址请求方法稳定性参数说明
Chat(深度求索)
POST
稳定
查看详情
Chat(深度求索)
POST
稳定
查看详情
Messages(Claude Code专用)
POST
稳定
查看详情

API价格表

$
模型说明上下文官网原价302.AI价格官网价差

deepseek-chat

闲时价格
1000000

输入$0.15 / 1M tokens
输出$0.6 / 1M tokens

缓存读取$0.003 / 1M tokens
输入$0.15 / 1M tokens
输出$0.6 / 1M tokens

原价

deepseek-chat

高峰期价格 (北京时间:09:00‑12:00,14:00‑18:00)
1000000

输入$0.3 / 1M tokens
输出$1.2 / 1M tokens

缓存读取$0.006 / 1M tokens
输入$0.3 / 1M tokens
输出$1.2 / 1M tokens

原价