DeepSeek
DeepSeek V4.1 Flash
最大上下文
1M
最大输出
384K
发布日期
暂无
deepseek-v3DeepSeek V3 是 V3 系列的通用 MoE 基座模型,常见官方资料描述为 671B 总参数、37B 激活参数。技术报告强调 MLA、DeepSeekMoE、高效训练,以及较强的通用语言和代码能力。在模型列表中,它更适合作为 DeepSeek 的通用对话与代码基线模型,而不是单纯的深度推理专用模型。
上下文窗口
128K Token
最大输出
16K Token
发布日期
2024年12月26日
模态
| 输入价格 | 输出价格 | 缓存读取 |
|---|---|---|
| $0.2857/M | $1.1429/M | $0.1143/M |
推理
工具调用
Temperature 参数
附件
知识库
Endpoint 协议
DeepSeek V3 结合高效的混合专家架构以及通用语言、推理和编程能力。
每个 token 激活 6710 亿总参数中的 370 亿,在保留模型容量的同时提高推理效率。
可通过一个通用文本模型处理知识问答、数学、代码和自然语言任务。
128K token 上下文窗口支持分析较长文档、对话和源代码集合。
DeepSeek V3 适合软件开发辅助、文档分析和通用知识应用等工作负载。
生成、解释和修改代码,帮助开发者实现功能并解决编程问题。
审阅长篇文本、提取重要信息,并生成摘要或结构化结论。
回答问题、解释概念,并将提供的信息整理为清晰且面向任务的回复。
curl 'https://us-api.tokenhub.com/v1/messages' \
-X 'POST' \
-H "Authorization: Bearer $TOKENHUB_API_KEY"DeepSeek V3 的能力、适用场景、限制和 TokenHub 使用指南。
DeepSeek V3 是 DeepSeek 面向开放权重的通用文本、编程和推理任务的模型。
适合通用对话、复杂编程、自托管部署,尤其适合重视部署控制权的场景。
核心优势是开放权重和高效的 MoE 架构。
它属于较早一代,可能缺少后续模型的新能力。 更看重需要最新能力时,可考虑 DeepSeek V4 Pro。
使用 TokenHub 的精确标识符;托管行为可能与自托管不同。
通过一个 API Key 接入 DeepSeek V3 与更多 AI 模型。
媒体与讨论
精选与此模型相关的公开视频和帖子。
X (Twitter)
Reddit
YouTube