DeepSeek V4 Flash Vision Exp

deepseek-v4-flash-vision-exp

DeepSeek V4 Flash Vision Exp 是 DeepSeek V4 Flash 0731 的实验性视觉增强版本,在保持基础模型文本性能(包括智能体能力、推理和世界知识)的同时,引入图像理解功能。它基于稀疏混合专家(MoE)架构,总参数为284B,激活参数为13B。

上下文窗口

1M Token

最大输出

384K Token

发布日期

2026年8月21日

模态

DeepSeek V4 Flash Vision Exp 价格

输入价格输出价格缓存读取
$0.2857/M$1.1429/M$0.0057/M

DeepSeek V4 Flash Vision Exp API 能力

推理

支持

工具调用

支持

Temperature 参数

支持

附件

支持

知识库

—

Endpoint 协议

Completions APIResponses APIMessages API

DeepSeek V4 Flash Vision Exp 模型亮点

DeepSeek V4 Flash Vision Exp 将图像理解与 DeepSeek V4 Flash 的推理、Agent 和知识能力结合,面向实验性多模态工作流。

图文理解

模型可同时接收图像和文本,并结合书面请求理解其中的视觉信息。

Flash 文本推理

其文本能力与 DeepSeek V4 Flash 保持一致,覆盖推理、世界知识和面向 Agent 的问题处理。

多模态 Agent 推理

视觉理解可融入 Agent 工作流,使后续决策能够利用图像中识别出的信息。

DeepSeek V4 Flash Vision Exp 使用场景

DeepSeek V4 Flash Vision Exp 适合截图理解、图表与文档分析,以及根据视觉输入进行决策的 Agent。

截图分析

检查应用截图、描述可见的界面状态,并识别与问题排查或用户支持相关的元素。

视觉文档提取

读取文档图像中的文本、表格和图表,并将相关内容整理为结构清晰的文本结果。

视觉 Agent 工作流

根据图像中识别出的信息选择后续工具、调查问题,并生成文本结论。

如何通过 TokenHub API 使用 DeepSeek V4 Flash Vision Exp

创建 API key
import OpenAI from "openai"

const client = new OpenAI({
  apiKey: process.env.TOKENHUB_API_KEY,
  baseURL: "https://us-api.tokenhub.com/v1",
})

const result = await client.chat.completions.create({})
console.log(result.choices[0]?.message?.content)

DeepSeek V4 Flash Vision Exp 基准测试

DeepSeek V4 Flash 0731 (Reasoning, Max Effort)

指数分数
Artificial Analysis 综合能力指数Artificial Analysis 综合能力评分51.8
Artificial Analysis 代码能力指数Artificial Analysis 软件任务评分69.1

指标来源 Artificial Analysis

DeepSeek V4 Flash Vision Exp 媒体与演示

关于 DeepSeek V4 Flash Vision Exp 的已核验公开公告、API 指南、演示和社区讨论。

X (Twitter)

View post on X
View post on X
View post on X

Reddit

YouTube

Watch on YouTube
Watch on YouTube
Watch on YouTube

DeepSeek V4 Flash Vision Exp 常见问题

在 TokenHub 评估和使用 DeepSeek V4 Flash Vision Exp 的实用指南。

deepseek-v4-flash-vision-exp 是什么?+

它是 DeepSeek 的实验性多模态模型,可接收文本和图片并输出文本。DeepSeek 将其定位为 V4 Flash 系列中支持视觉的型号。

该模型最适合哪些任务?+

它适合描述图片、读取截图文字、分析图表,以及同时需要视觉证据和语言推理的智能体工作流。

它的主要优势是什么?+

其主要优势是把 V4 Flash 的文本能力与原生图像理解结合起来。它还支持通过常见 API 形式提交图文混合请求,并可在智能体工作流中配合工具使用。

需要考虑哪些限制或取舍?+

该模型被明确标记为实验性版本,上线生产前应验证可靠性。图片会被缩放并转换为 token,可能损失细节;重要的视觉结论应由人工复核。

如何通过 TokenHub 使用该模型?+

如果你的 TokenHub 账户已提供该模型,请使用准确的模型 ID deepseek-v4-flash-vision-exp,并配合 TokenHub 接口地址和凭据调用。文本与图片应按所选 TokenHub API 路由支持的请求格式提交。

关于价格和可用性需要了解什么?+

DeepSeek 已在其 API 平台提供该实验性模型,并说明图片缩放后每张最多按 384 个 token、采用 V4 Flash 价格计费。TokenHub 的可用性和费率可能不同,部署前请查看当前模型列表。

什么时候应选择该模型而不是其他模型?+

当任务必须处理图片,并希望在同一请求中使用 V4 Flash 风格的文本与智能体能力时,可优先考虑它。对于纯文本、精细视觉或生产关键任务,应使用代表性测试与其他模型比较准确度、延迟、稳定性和成本。

准备调用 DeepSeek V4 Flash Vision Exp?

通过一个 API Key 接入 DeepSeek V4 Flash Vision Exp 与更多 AI 模型。

创建 API Key