DeepSeek
DeepSeek V4.1 Flash
最大上下文
1M
最大输出
384K
发布日期
暂无
deepseek-v4-flashDeepSeek V4 Flash 保留了 V4 系列的 1M token 长上下文能力,但采用更轻量的 MoE 配置,常见模型卡描述为 284B 总参数、13B 激活参数。它的重点不是最大推理深度,而是更快推理、更低调用成本和更适合生产环境的吞吐量。对于高频请求、批量处理和长上下文但不一定需要最高推理强度的任务,Flash 会比 Pro 更合适。
上下文窗口
1M Token
最大输出
384K Token
发布日期
2026年4月24日
模态
| 输入价格 | 输出价格 | 缓存读取 |
|---|---|---|
| $0.2857/M | $1.1429/M | $0.0057/M |
推理
工具调用
Temperature 参数
附件
知识库
Endpoint 协议
DeepSeek V4 Flash 结合 Agent 编程、可调节推理强度与高效长上下文处理,适合要求较高的开发任务。
经过后训练强化,可处理终端操作、代码仓库修改和多步骤软件工程任务。
低、高和最大三档推理强度,可让开发者根据工作负载平衡思考深度与响应时间。
V4 架构支持百万 Token 上下文处理,有助于模型分析大型代码库和规模较大的文档集合。
DeepSeek V4 Flash 适合代码仓库工程、长文档分析,以及结合推理与代码执行的多步骤自动化任务。
检查代码库中的依赖关系,识别受影响文件,并为软件维护任务实施协同修改。
审阅大篇幅技术规范或文档集合,关联不同章节的信息并生成结构化结论。
规划并执行包含终端命令、代码修改和结果检查的工作流,以完成边界明确的操作任务。
import OpenAI from "openai"
const client = new OpenAI({
apiKey: process.env.TOKENHUB_API_KEY,
baseURL: "https://us-api.tokenhub.com/v1",
})
const result = await client.chat.completions.create({})
console.log(result.choices[0]?.message?.content)| 指数分数 | ||
|---|---|---|
| Artificial Analysis 综合能力指数 | Artificial Analysis 综合能力评分 | 40.3 |
| Artificial Analysis 代码能力指数 | Artificial Analysis 软件任务评分 | 38.7 |
| 知识与推理 | ||
| GPQA | 高阶科学问题求解 | 89.4% |
| HLE | 广泛专家级考试集合 | 32.1% |
| 代码与工程 | ||
| SciCode | 科学计算代码挑战 | 44.9% |
| Terminal-Bench Hard | 高难度终端任务执行 | 35.6% |
| 指令遵循与 Agent 任务 | ||
| IFBench | 指令约束遵循 | 79.2% |
| AA-LCR | 长上下文推理 | 63% |
| τ²-Bench | Agent 工作流任务 | 95.0% |
指标来源 Artificial Analysis
DeepSeek V4 Flash 的能力、适用场景、限制和 TokenHub 使用指南。
DeepSeek V4 Flash 是 DeepSeek 面向快速、高效的推理和智能体任务的模型。
适合对响应速度敏感的应用、智能体流程、高并发请求,尤其适合重视响应速度和成本效率的场景。
核心优势是更小的规模和更快、更经济的推理,并具备可切换的思考与非思考模式。
在最难的推理和工程任务上,它的能力上限较低。 更看重最高回答质量时,可考虑 DeepSeek V4 Pro。
使用 TokenHub 显示的精确标识符,并按账户文档确认当前功能。
通过一个 API Key 接入 DeepSeek V4 Flash 与更多 AI 模型。
媒体与讨论
精选与此模型相关的公开视频和帖子。
X (Twitter)
Reddit
YouTube