
deepseek-v4.1-flash
DeepSeek全新一代“越级智商 + 极速高吞吐”开源大模型
2026-09-10
缓存读取:
$0.003/1M tokens起
输入:
$0.15/1M tokens起
输出:
$0.6/1M tokens起
大额采购联系客户经理享专属优惠
API介绍
DeepSeek-V4.1-Flash 是DeepSeek 全新一代面向高并发、复杂长程智能体与工程级代码交付打造的“越级智商 + 极速高吞吐”开源大模型。模型采用 552B 骨干 MoE 架构并融合了 196B Engram 模块(Prefill 仅激活 8B,Decode 激活 16B),实现了推理吞吐量(最高达 400+ TPS)与首字延迟的跨越式跃升。在多项严苛的真实场景测试中,V4.1-Flash 的综合推理质量与复杂工作流完成速度已全面超越上一代模型 V4 Pro,是企业规模化跑 AI 代码助手、智能体集群与高密工作流的绝对性价比杀手。
───────────────────────────────────────────────────────────────────
核心能力
智力越级与全量路由替代: 在内部与外部测试中,V4.1-Flash 的综合性能、生成速度与任务完成度全面超越上代旗舰 V4 Pro。
Engram 架构与极致 KV Cache 压缩: 结合 196B Engram 嵌入模块与全新 QAT 压缩算法,将 1M 超长上下文的 KV Cache 显存占用大幅压缩至 ~900MB,长文本Prefill 与连续追问体验极佳。
极致的高吞吐速度(高达 400+ TPS): 端到端推理速度大幅提升,首字响应极快,非常适合高并发 API 接入与实时交互系统。
1M 超长上下文与自动无感缓存: 原生支持 1,000,000 (1M) Tokens 窗口与最高 384K Tokens 导出,无需手动配置,原生支持磁盘级 Context Caching 自动命中。
Playground
登录后,探索更多精彩功能! 点击登录
API统计
API列表 (3)
API价格表
$¥ 円 ₽