模型广场

在一个生产级目录中查看 AI 模型价格、能力、端点和供应商覆盖。

Alibaba

Qwen3.8 Max

qwen3.8-max

Qwen3.8-Max 是一款拥有2.4万亿参数的MoE旗舰模型,专为高级推理、编程和企业生产力而设计。它能自主执行复杂的长期任务——从软件开发到专业工作流——在法律、金融和设计等领域提供生产级成果。凭借原生多模态智能,Qwen3.8-Max 能理解长上下文中的文本、图像和视频,支持对大量文档和长篇幅内容的深度分析。其智能体能力支持在复杂工作流中自主规划、执行、验证和持续迭代。

最大上下文

1M

最大输出

128K

发布日期

2026年8月3日

输入$2 / 百万 Token
输出$6 / 百万 Token
缓存读取$0.25 / 百万 Token

Moonshot

Kimi K3

kimi-k3

Kimi K3 是一款高性能 AI 模型,专为高级推理、编码和复杂任务执行而设计。它在大规模编程项目、多步骤问题解决和知识密集型应用中表现强劲。凭借强大的上下文处理和多模态能力,K3 适用于构建强大的 AI 智能体、开发者工具和企业级应用。

最大上下文

1M

最大输出

131.1K

发布日期

2026年7月16日

输入$2.8571 / 百万 Token
输出$14.2857 / 百万 Token
缓存读取$0.2857 / 百万 Token

OpenAI

GPT-5.6 Sol

gpt-5.6-sol

GPT-5.6 Sol 是 Sol 系列的标准版本,适合通用问答、文本处理、内容草拟、摘要生成、轻量级代码辅助和业务自动化任务。 Sol 专为需要扎实通用能力、同时注重响应效率和成本的场景而设计,可用于产品功能、聊天助手、内容生成工具、数据清理、知识库问答和批量处理任务。对于大规模使用或快速原型开发,Sol 是一个灵活的起点。

最大上下文

1.1M

最大输出

128K

发布日期

2026年7月9日

输入$5 / 百万 Token
输出$30 / 百万 Token
缓存读取$0.5 / 百万 Token

OpenAI

GPT-5.6 Sol Pro

gpt-5.6-sol-pro

GPT-5.6 Sol Pro 是 Sol 系列的专业版,专为复杂任务和更高质量输出而设计。适用于高级写作、精准问答、商业推理、代码生成、结构化分析以及多轮任务执行。 Sol Pro 特别适合需要更高准确性、上下文理解能力和指令完成度的任务,可用于专业内容生产、数据分析助手、知识问答系统、复杂的智能体工作流,以及企业内部 AI 工具。

最大上下文

1.1M

最大输出

128K

发布日期

2026年7月9日

输入$5 / 百万 Token
输出$30 / 百万 Token
缓存读取$0.5 / 百万 Token

OpenAI

GPT-5.6 Terra

gpt-5.6-terra

GPT-5.6 Terra 是 Terra 系列的通用版本,适用于日常对话、文本生成、摘要、信息提取、轻量推理和编程辅助。 Terra 在通用能力、响应效率和成本之间实现了实用的平衡。可用于聊天助手、内容工具、办公自动化、知识库问答以及批量文本处理工作流。对于需要快速迭代或对成本敏感的应用,Terra 是 Terra 系列中的首选默认选项。

最大上下文

1.1M

最大输出

128K

发布日期

2026年7月9日

输入$2.5 / 百万 Token
输出$15 / 百万 Token
缓存读取$0.275 / 百万 Token

OpenAI

GPT-5.6 Terra Pro

gpt-5.6-terra-pro

GPT-5.6 Terra Pro 是 Terra 系列的增强版,旨在复杂任务中提供高品质输出。适用于高级问答、深度内容创作、商业分析、编程辅助和多步推理。与标准版相比,Terra Pro 更适合需要更强可靠性、更完整推理和更好指令遵循的场景。适合专业写作、复杂信息整合、知识型助手、自动化代理和企业级 AI 应用。

最大上下文

1.1M

最大输出

128K

发布日期

2026年7月9日

输入$2.5 / 百万 Token
输出$15 / 百万 Token
缓存读取$0.275 / 百万 Token

OpenAI

GPT-5.6 Luna

gpt-5.6-luna

GPT-5.6 Luna 是 Luna 系列的通用版本,适用于日常 AI 应用场景。可用于对话问答、文本改写、摘要生成、信息提取、简单推理、编程辅助及办公自动化。 Luna 是原型开发、轻量级业务功能、批量内容处理和常见用户交互场景的实用选择。当速度、简洁性和成本控制很重要时,它是一个很好的入门模型;如果任务需要更高质量或更稳定的输出,可以考虑 Luna Pro。

最大上下文

1.1M

最大输出

128K

发布日期

2026年7月9日

输入$1 / 百万 Token
输出$6 / 百万 Token
缓存读取$0.1 / 百万 Token

OpenAI

GPT-5.6 Luna Pro

gpt-5.6-luna-pro

GPT-5.6 Luna Pro 是 Luna 系列的增强版本,旨在提供更高质量的回答、更稳定的指令遵循和更强的任务完成能力。它适用于复杂对话、内容生成、知识问答、业务分析、编程辅助以及多步骤自动化任务。 Luna Pro 非常适合注重输出质量和用户体验的产品场景,如专业写作助手、企业 AI 助手、客户支持、知识库系统和智能体工作流。当任务需要比标准 Luna 模型更高的可靠性时,它是一个很好的选择。

最大上下文

1.1M

最大输出

128K

发布日期

2026年7月9日

输入$1 / 百万 Token
输出$6 / 百万 Token
缓存读取$0.1 / 百万 Token

DeepSeek

DeepSeek V4 Pro

deepseek-v4-pro

DeepSeek V4 Pro 被描述为大规模 MoE 模型,拥有 1.6T 总参数与 49B 激活参数,并支持 1M token 上下文窗口,适合处理超长输入。官方和三方模型卡更强调它在高级推理、代码任务和长周期 Agent 工作流中的能力,而不是普通聊天。相比 V4 Flash,Pro 更偏能力上限,适合大型代码库分析、复杂研究资料综合、多步骤自动化等需要深度推理的任务。

最大上下文

1M

最大输出

384K

发布日期

2026年4月24日

输入$1.2857 / 百万 Token
输出$3.8571 / 百万 Token
缓存读取$0.0429 / 百万 Token

Z.ai

GLM-5.2

glm-5.2

GLM-5.2 是 Z.ai 面向长程工程任务的旗舰基础模型,重点提升了可用的 1M token 上下文能力,可承载项目级代码、系统文档和工程背景信息。它强调长任务执行稳定性、工程规范遵循能力,以及从需求分析、仓库理解到实现、测试和多平台部署的完整开发流程能力。相比普通对话模型,GLM-5.2 更适合需要大上下文、持续规划和可靠 Agent 执行的工程场景。

最大上下文

1M

最大输出

131.1K

发布日期

2026年6月13日

输入$1.1429 / 百万 Token
输出$4 / 百万 Token
缓存读取$0.2857 / 百万 Token

DeepSeek

DeepSeek V4 Flash

deepseek-v4-flash

DeepSeek V4 Flash 保留了 V4 系列的 1M token 长上下文能力,但采用更轻量的 MoE 配置,常见模型卡描述为 284B 总参数、13B 激活参数。它的重点不是最大推理深度,而是更快推理、更低调用成本和更适合生产环境的吞吐量。对于高频请求、批量处理和长上下文但不一定需要最高推理强度的任务,Flash 会比 Pro 更合适。

最大上下文

1M

最大输出

384K

发布日期

2026年4月24日

输入$0.4286 / 百万 Token
输出$1.2857 / 百万 Token
缓存读取$0.0143 / 百万 Token

Anthropic

Claude Opus 5

claude-opus-5

Claude Opus 5 是 Anthropic 的旗舰模型,专为要求严苛的推理、编码和长期自主任务而设计。它在端到端软件任务、代码审查和错误发现、图表和文档的视觉分析、复杂办公交付以及协调并行子代理方面尤为出色。该模型在长时间任务中保持强大的指令遵循和工具使用能力,同时在优先考虑延迟和令牌效率的低努力设置下仍然有效。

最大上下文

1M

最大输出

128K

发布日期

2026年7月24日

输入$5 / 百万 Token
输出$25 / 百万 Token
缓存读取$0.5 / 百万 Token

Anthropic

Claude Opus 5 Fast

claude-opus-5-fast

Opus 5 的快速模式变体 - 与常规 Opus 5 相同的性能,但输出速度更快,价格为常规 Opus 5 的两倍。 了解更多,请查看 Anthropic 文档:https://platform.claude.com/docs/en/build-with-claude/fast-mode

最大上下文

1M

最大输出

128K

发布日期

2026年7月24日

输入$10 / 百万 Token
输出$50 / 百万 Token
缓存读取$1 / 百万 Token

xAI

Grok 4.6

grok-4.6

Grok 4.6 是 xAI 的先进推理模型,专为复杂编程、长时间运行的智能体任务和知识工作而构建。它支持文本和图像输入,上下文窗口最高可达 50 万 token,并支持低/中/高/极高推理强度配置。凭借函数调用、Web 与 X 搜索、代码执行和结构化输出,Grok 4.6 针对跨代码库分析、持续多步工具使用、自我验证和端到端工程工作流进行了优化。它应被视为通用推理与智能体模型,而不仅仅是与 X 平台相关的聊天机器人。

最大上下文

500K

最大输出

500K

发布日期

2026年8月12日

输入$2 / 百万 Token
输出$6 / 百万 Token
缓存读取$0.3 / 百万 Token

Google

Gemini 3.6 Flash

gemini-3.6-flash

Gemini 3.6 Flash 是来自 Google 的高效模型,适用于编码、智能代理工作流以及网络和应用开发。它旨在生成精炼的输出,减少不必要的编辑和模棱两可的表述,同时降低完成任务所需的 Token 使用量和模型调用次数。

最大上下文

1M

最大输出

65.5K

发布日期

2026年7月21日

输入$1.5 / 百万 Token
输出$7.5 / 百万 Token
缓存读取$0.15 / 百万 Token

xAI

Grok 4.5

grok-4.5

Grok 4.5 是 xAI 面向编程、智能体任务与知识工作的推理模型,支持文本和图像输入、最高 50 万 token 上下文,以及低/中/高可配置推理强度。它支持函数调用、网页与 X 搜索、代码执行和结构化输出,适合长上下文分析、多步骤工具调用与端到端工程工作流;不应仅被定位为与 X 平台关联的聊天机器人。

最大上下文

500K

最大输出

500K

发布日期

2026年7月8日

输入$2 / 百万 Token
输出$6 / 百万 Token
缓存读取$0.3 / 百万 Token

Alibaba

Qwen3.7 Plus

qwen3.7-plus

Qwen3.7 Plus 延续 Qwen3.7 面向 Agent 的设计方向,但更偏性价比。三方模型卡描述它支持文本和图片输入,并强化视觉语言能力,以及 GUI、移动端导航、视觉参考等混合 Agent 任务。它适合需要 Qwen3.7 新一代能力,但不一定需要 Max 档位成本的场景。

最大上下文

1M

最大输出

64K

发布日期

2026年6月2日

输入$0.2857 / 百万 Token
输出$1.1429 / 百万 Token
缓存读取$0.0571 / 百万 Token

OpenAI

GPT-4.1

gpt-4.1

GPT-4.1 是 OpenAI 强调代码、指令遵循和长上下文能力提升的一代模型。官方发布信息将它描述为在许多编程和指令密集型任务上强于 GPT-4o 的开发者模型。它的描述应突出代码可靠性和长上下文理解。

最大上下文

1M

最大输出

32.8K

发布日期

2025年4月14日

输入$2 / 百万 Token
输出$8 / 百万 Token
缓存读取$0.5 / 百万 Token

OpenAI

GPT-4.1 Mini

gpt-4.1-mini

GPT-4.1 Mini 将 GPT-4.1 系列的代码和指令遵循能力,以更快、更低成本的形式提供出来。它适合高频开发者工具、结构化生成、信息抽取,以及不需要完整大模型能力的产品功能。它的核心差异是保留 4.1 一代任务纪律性的同时提升生产效率。

最大上下文

1M

最大输出

32.8K

发布日期

2025年4月14日

输入$0.4 / 百万 Token
输出$1.6 / 百万 Token
缓存读取$0.1 / 百万 Token

OpenAI

GPT-4o

gpt-4o

GPT-4o 是 OpenAI GPT-4o 一代的多模态旗舰模型,支持文本和图像输入,并具备较强的通用智能。官方文档将它描述为适合广泛语言与视觉任务的高智能通用模型。在更看重多模态理解和自然交互,而不是最新推理栈的场景中,它仍然有价值。

最大上下文

128K

最大输出

16.4K

发布日期

2024年5月13日

输入$2.5 / 百万 Token
输出$10 / 百万 Token
缓存读取$1.25 / 百万 Token

OpenAI

GPT-4o Mini

gpt-4o-mini

GPT-4o Mini 是 GPT-4o 家族中的快速、低成本小模型。OpenAI 文档将其定位为面向聚焦任务的模型,支持文本和图像输入、结构化输出、微调和蒸馏工作流。它更适合被介绍为轻量级多模态生产模型,而不是 GPT-4o 的简单缩小版。

最大上下文

128K

最大输出

16.4K

发布日期

2024年7月18日

输入$0.15 / 百万 Token
输出$0.6 / 百万 Token
缓存读取$0.075 / 百万 Token

热门模型推荐

从实时目录中优先查看高关注模型,再进入详情页比较上下文、端点和实际价格。

Alibaba

Qwen3.8 Max

Qwen3.8-Max 是一款拥有2.4万亿参数的MoE旗舰模型,专为高级推理、编程和企业生产力而设计。它能自主执行复杂的长期任务——从软件开发到专业工作流——在法律、金融和设计等领域提供生产级成果。凭借原生多模态智能,Qwen3.8-Max 能理解长上下文中的文本、图像和视频,支持对大量文档和长篇幅内容的深度分析。其智能体能力支持在复杂工作流中自主规划、执行、验证和持续迭代。

最大上下文

1M

输入价格

$2 / 百万 Token

查看模型

Moonshot

Kimi K3

Kimi K3 是一款高性能 AI 模型,专为高级推理、编码和复杂任务执行而设计。它在大规模编程项目、多步骤问题解决和知识密集型应用中表现强劲。凭借强大的上下文处理和多模态能力,K3 适用于构建强大的 AI 智能体、开发者工具和企业级应用。

最大上下文

1M

输入价格

$2.8571 / 百万 Token

查看模型

OpenAI

GPT-5.6 Sol

GPT-5.6 Sol 是 Sol 系列的标准版本,适合通用问答、文本处理、内容草拟、摘要生成、轻量级代码辅助和业务自动化任务。 Sol 专为需要扎实通用能力、同时注重响应效率和成本的场景而设计,可用于产品功能、聊天助手、内容生成工具、数据清理、知识库问答和批量处理任务。对于大规模使用或快速原型开发,Sol 是一个灵活的起点。

最大上下文

1.1M

输入价格

$5 / 百万 Token

查看模型

OpenAI

GPT-5.6 Sol Pro

GPT-5.6 Sol Pro 是 Sol 系列的专业版,专为复杂任务和更高质量输出而设计。适用于高级写作、精准问答、商业推理、代码生成、结构化分析以及多轮任务执行。 Sol Pro 特别适合需要更高准确性、上下文理解能力和指令完成度的任务,可用于专业内容生产、数据分析助手、知识问答系统、复杂的智能体工作流,以及企业内部 AI 工具。

最大上下文

1.1M

输入价格

$5 / 百万 Token

查看模型

OpenAI

GPT-5.6 Terra

GPT-5.6 Terra 是 Terra 系列的通用版本,适用于日常对话、文本生成、摘要、信息提取、轻量推理和编程辅助。 Terra 在通用能力、响应效率和成本之间实现了实用的平衡。可用于聊天助手、内容工具、办公自动化、知识库问答以及批量文本处理工作流。对于需要快速迭代或对成本敏感的应用,Terra 是 Terra 系列中的首选默认选项。

最大上下文

1.1M

输入价格

$2.5 / 百万 Token

查看模型

OpenAI

GPT-5.6 Terra Pro

GPT-5.6 Terra Pro 是 Terra 系列的增强版,旨在复杂任务中提供高品质输出。适用于高级问答、深度内容创作、商业分析、编程辅助和多步推理。与标准版相比,Terra Pro 更适合需要更强可靠性、更完整推理和更好指令遵循的场景。适合专业写作、复杂信息整合、知识型助手、自动化代理和企业级 AI 应用。

最大上下文

1.1M

输入价格

$2.5 / 百万 Token

查看模型

模型对比

与选定的相邻目录模型快速对比。

模型目录常见问题

快速了解如何在 TokenHub 目录中选择、比较和使用模型。

应该如何从列表中选择模型?

+

先看你的具体任务。可以按供应商、标签、端点类型和计费分组筛选,再比较上下文长度、最大输出、模态能力以及输入或输出价格。

实际价格是什么意思?

+

实际价格会把当前计费分组倍率应用到模型价格数据上,帮助你估算所使用分组下真实的输入、输出或按次调用成本。

这些模型都可以通过 API 端点使用吗?

+

可以进入模型详情页查看支持的端点类型和文档链接。可用性会因模型、供应商和当前路由配置而不同。

为什么上下文窗口和最大输出很重要?

+

上下文窗口决定模型能读取多少提示词和对话历史;最大输出决定单次响应能生成多少内容,对长文写作、代码和文档任务尤其重要。