DeepSeek V4 Flash Vision Exp

deepseek-v4-flash-vision-exp

DeepSeek V4 Flash Vision Exp は、DeepSeek V4 Flash 0731 の実験的なビジョン対応版であり、画像理解機能を導入しつつ、ベースモデルのテキスト性能(エージェント機能、推論、世界知識を含む)を維持しています。スパース混合専門家(MoE)アーキテクチャに基づき、総パラメータ数は284B、アクティブパラメータ数は13Bです。

最大コンテキスト

1Mトークン

最大出力

384Kトークン

リリース日

2026年8月21日

モダリティ

DeepSeek V4 Flash Vision Exp の料金

入力価格出力価格キャッシュ読み取り
$0.4286/M$1.2857/M$0.0143/M

DeepSeek V4 Flash Vision Exp を API 経由で使用するには?

POSTanthropic/v1/messages
POSTopenai/v1/chat/completions
POSTopenai-response/v1/responses

DeepSeek V4 Flash Vision Exp のベンチマーク

DeepSeek V4 Flash 0731 (Reasoning, Max Effort)

51.8

/100

Artificial Analysis Intelligence Index

Artificial Analysis broad capability aggregate

指数スコア

69.1

/100

Artificial Analysis Coding Index

Artificial Analysis software task aggregate

指数スコア

指標の出典 Artificial Analysis

DeepSeek V4 Flash Vision Expのメディアとデモ

DeepSeek V4 Flash Vision Expに関する確認済みの公開発表、API案内、デモ、コミュニティ議論です。

X (Twitter)

Open social media source
View post on X
Open social media source
View post on X
Open social media source
View post on X

Reddit

YouTube

Open social media source
Watch on YouTube
Open social media source
Watch on YouTube
Open social media source
Watch on YouTube

DeepSeek V4 Flash Vision Exp よくある質問

TokenHubでDeepSeek V4 Flash Vision Expを評価・利用するための実用的な案内です。

deepseek-v4-flash-vision-expとは何ですか?+

DeepSeekの実験的なマルチモーダルモデルで、テキストと画像を入力し、テキストを出力します。V4 Flashファミリーの視覚対応モデルとして位置づけられています。

このモデルはどのようなタスクに適していますか?+

画像の説明、スクリーンショット内の文字の読み取り、グラフの分析、視覚情報と言語推論の両方を必要とするエージェント処理に適しています。

主な強みは何ですか?+

V4 Flashのテキスト能力とネイティブな画像理解を組み合わせている点が主な強みです。一般的なAPI形式でテキストと画像を混在させ、エージェント処理でツールと連携できます。

どのような制限やトレードオフがありますか?+

明確に実験版とされているため、本番利用前に信頼性を検証してください。画像は縮小されトークン化されるため細部の忠実度が下がる場合があり、重要な視覚的判断は人が確認すべきです。

TokenHub経由でどのように利用しますか?+

TokenHubアカウントで利用可能な場合は、正確なモデルID deepseek-v4-flash-vision-exp とTokenHubのエンドポイントおよび認証情報を使用します。テキストと画像は、選択したTokenHub APIルートが対応する形式で送信してください。

料金と提供状況について何を確認すべきですか?+

DeepSeekはこの実験モデルをAPIプラットフォームで提供し、画像は縮小後に1枚あたり最大384トークンとしてV4 Flash料金で課金すると案内しています。TokenHubでの提供状況と料金は異なる場合があるため、導入前に最新のモデル一覧を確認してください。

他のモデルではなく、このモデルを選ぶべきなのはいつですか?+

画像が不可欠で、同じリクエスト内でV4 Flash系のテキスト能力とエージェント能力も使いたい場合に適しています。テキストのみ、細かな視覚認識、本番の重要処理では、実際の用途に近いテストで精度、遅延、安定性、コストを代替モデルと比較してください。