Kimi K3 评测:基准测试、API 价格与社区演示
Kimi K3 是 Moonshot AI 的 2.8 万亿参数旗舰模型,专为长周期编码、知识工作、多模态推理和智能体任务而设计。本评测涵盖其规格、Kimi K3 基准测试、API 价格、TokenHub 和 OpenCode 设置、社区演示,以及与 Claude Fable 5、Opus 4.8 和 GLM-5.2 的重点对比。
简而言之:Kimi K3 的 100 万 token 上下文窗口、原生视觉能力和早期基准测试结果,使其值得在大型代码库、长文档、视觉开发和研究中进行测试。生产决策仍应取决于您自己的工作流中的任务质量、延迟、成本和可靠性。
快速访问:尝试 Kimi K3,通过 TokenHub 使用单个 API 密钥和兼容 OpenAI 的端点。

什么是 Kimi K3?
发布于 2026 年 7 月 16 日,Kimi K3 是截至本次评测为止 Moonshot AI 最强大的模型。其稀疏混合专家设计在每 token 激活 896 个专家中的 16 个,而不是为每个请求使用全部 2.8 万亿参数。Kimi Delta Attention 和 Attention Residuals 旨在提高长序列和模型深度方面的效率。

Kimi K3 规格与发布详情
| 规格 | Kimi K3 |
|---|---|
| 开发者 | Moonshot AI |
| 发布日期 | July 16, 2026 |
| 架构 | 稀疏混合专家 |
| 总参数量 | 2.8万亿 |
| 专家配置 | 每个 token 激活 896 个专家中的 16 个 |
| 上下文窗口 | 最多 1,048,576 个 tokens |
| 原生输入模态 | 文本、图像和视觉/视频上下文 |
| 主要工作负载 | 编程、研究、知识工作、智能体、长文档 |
| 推理级别 | 低、高和最高,取决于访问方式 |
| TokenHub 模型 ID | kimi-k3 |
| TokenHub 最大输出 | 131.1K tokens |
| TokenHub 端点 | /v1/chat/completions 和 /v1/messages |
| 全量权重发布 | 计划于2026年7月27日 |
Moonshot 表示,新的架构和训练方法使整体扩展效率相比 Kimi K2 提高了约 2.5 倍。Kimi K3 还采用了量化感知训练,使用 MXFP4 权重和 MXFP8 激活。尽管采用稀疏激活,自托管如此规模的模型仍是一个基础设施密集型项目,而非典型的本地 LLM 部署。
Kimi K3 基准测试:早期数据说明了什么
TokenHub 模型页面目前列出了来自 Artificial Analysis 的以下指标:
| 基准 | Kimi K3 得分 | 衡量内容 |
|---|---|---|
| Artificial Analysis 智能指数 | 57.1/100 | 广泛模型能力 |
| Artificial Analysis 编程指数 | 76.2/100 | 编程与软件工程 |
| GPQA | 93.5% | 研究生水平的科学推理 |
| HLE | 44.3% | 广泛的专家级知识 |
| SciCode | 58.7% | 科学Python编程 |
| AA-LCR | 74.7% | 长上下文推理 |
Moonshot的发布评估还报告了Terminal-Bench 2.1上的88.3分、BrowseComp上的91.2分、DeepSearchQA上的95.0分以及GPQA Diamond上的93.5%。这些分数表明了该模型预期的优势,但Kimi K3通常在最大推理努力下进行测试,并且一些模型比较使用了不同的代理框架。应将较小的分数差异视为方向性参考,而非普遍优越性的证明。
如何在TokenHub上使用Kimi K3
对于想知道如何在不创建另一个特定于提供商的集成的情况下使用Kimi K3的开发人员,TokenHub通过其统一的API网关提供该模型。
1. 创建TokenHub工作区
打开TokenHub控制台,使用电子邮件或Google身份验证创建工作区。
2. 添加使用余额
TokenHub在受支持的提供商和模型之间使用共享的工作区余额。为计划运行的测试工作负载添加足够的余额。
3. 生成TokenHub API密钥
在TokenHub控制台中创建网关密钥。将密钥存储为环境变量,而不是硬编码在应用程序中。
export TOKENHUB_API_KEY="YOUR_TOKENHUB_API_KEY"4. 使用 OpenAI SDK 发送请求
TokenHub 提供与 OpenAI 兼容的 API。现有的 OpenAI SDK 代码可以通过更改基本 URL、API 密钥和模型 ID 来使用 Kimi K3。
import os\nfrom openai import OpenAI\n\nclient = OpenAI(\n base_url=\"https://us-api.tokenhub.com/v1\",\n api_key=os.environ[\"TOKENHUB_API_KEY\"],\n)\n\nresponse = client.chat.completions.create(\n model=\"kimi-k3\",\n messages=[\n {\n \"role\": \"user\",\n \"content\": \"审查此函数并找出任何并发问题。\",\n }\n ],\n)\n\nprint(response.choices[0].message.content)在 TokenHub 上,模型标识符是 kimi-k3. 不要将其替换为 k3 标识符,该标识符用于某些 Kimi Code 集成,除非端点文档特别要求您这样做。
TokenHub 还列出了一个与 Anthropic 兼容的 /v1/messages 路由。使用与应用程序其余部分匹配的端点和 SDK 风格。
使用 Kimi K3 与 OpenCode
Kimi K3 可以通过 Kimi 官方的 Kimi For Coding 登录或通过 TokenHub。官方路由使用 Kimi API 密钥和模型 ID k3; 下面的 TokenHub 路由使用 TokenHub API 密钥和 kimi-k3.
通过 TokenHub 进行 Kimi K3 OpenCode 设置
由于 TokenHub 提供了与 OpenAI 兼容的端点,因此可以将其添加为自定义的 OpenCode 提供程序。首先请安全地存储 API 密钥:
export TOKENHUB_API_KEY="YOUR_TOKENHUB_API_KEY"然后将自定义提供程序添加到 opencode.json:
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"tokenhub": {
"npm": "@ai-sdk/openai-compatible",
"name": "TokenHub",
"options": {
"baseURL": "https://us-api.tokenhub.com/v1",
"apiKey": "{env:TOKENHUB_API_KEY}"
},
"models": {
"kimi-k3": {
"name": "Kimi K3",
"limit": {
"context": 1048576,
"output": 131072
}
}
}
}
}
}启动 OpenCode 并运行 /models 以选择 TokenHub / Kimi K3. OpenCode 的提供方配置可能会发生变化,因此如果模型未出现,请在 OpenCode 文档中确认当前的自定义提供方语法。
Kimi K3 社区展示
社区项目比单独的基准测试表更能具体地展示人们正在使用 Kimi K3 尝试的内容。这些示例是演示,而非受控评估:原始提示词、迭代次数、手动编辑、工具和托管工作可能未得到公开记录。
前端页面生成:Windows XP 网页体验
一个被广泛分享的 由 AB Kuai.Dong 发布的 X 帖子 突显了一个据报道使用 Kimi K3 构建的基于浏览器的 Windows XP 重现。该帖子链接到 windows-xp.kimi.site 并显示了一个熟悉的 Windows XP 桌面,带有可交互的窗口。其附带视频演示了 Grand Theft Auto: Vice City 在网页体验中运行,并表示该项目也可以运行 Command & Conquer: Red Alert 2.
该帖子的作者将这个项目描述为另一个社区制作的 macOS 风格网页的进阶之作。在本次查看时,这条 X 帖子显示约有 441,000 次查看、2,489 个赞和 1,013 个书签,表明人们对 Kimi K3 的前端生成能力有浓厚兴趣。
该演示所展示的内容
- 复现可识别的桌面操作系统界面
- 多个分层窗口和交互式 UI 状态
- 在网页内集成可玩或流式传输的游戏体验
- 协调视觉设计、应用逻辑和大型前端代码库的能力
它不能证明的内容
公开帖子并未披露完整的提示历史、源代码、生成次数、人工更正,或其他模型和工具是否参与。因此,最好将其视为 Kimi K3 辅助前端开发的社区展示,而非独立的 Kimi K3 基准测试,或该模型一次生成整个项目的证明。
交互式 3D 场景生成:湖泊环境
另一个 来自 gimu 的社区帖子展示了一个 3D 湖泊环境,该环境是作者 Kimi K3 性能测试的一部分。视频呈现了一个可导航的景观,包括反射水面、茂密树木、周围群山,以及一个用于调整环境设置的屏幕上的大气面板。
创作者表示,湖泊、森林和山景的质量超出了他们的预期,并得出结论,该结果优于同帖中包含的之前 Claude Fable 5 湖泊实验。在审核时,Kimi K3 帖子显示约有 212,000 次查看、1,268 次点赞和 555 次收藏。
“优于 Fable 5”的结论是创作者的主观评估。该帖子没有公布标准化的评分方法、完整的提示、源代码、生成设置或涉及的人工工作量,因此不应将其视为受控的 Kimi K3 与 Fable 5 基准测试。
网页设计工作流:从视觉研究到成品落地页
在一个由 Viktor Oddy 分享的社区教程中,Kimi K3 被用于一个约 13 分钟的工作流程中,来创建作者所称的“获奖”网站。视频展示了创作者收集视觉参考资料并推进设计过程,随后呈现了一个精美的落地页概念,包含醒目的排版、克制的单色插画、清晰的导航和突出的行动号召。
这是一个有用的Kimi K3 网页设计展示,因为它所呈现的不只是一张最终截图。它展示了一个实际的工作流程,从视觉方向和参考资料收集到页面生成与迭代,这使得它对设计师、创意开发者以及使用 AI 进行快速网站原型制作的团队都具有参考价值。
在审核时,该帖展示了大约 107,000 次查看、1,689 次点赞和 2,223 次收藏。异常高的收藏数表明读者认为该教程是一个可重复的工作流程,而不仅仅是一个视觉演示。
Kimi K3 对比 Claude, Fable 5, Opus 4.8 和 GLM-5.2
此表为评审提供支持性背景。社区演示和基准分数是有用的信号,但生产决策仍需要针对您自己的工作负载进行受控测试。
| 模型 | 主要定位 | 上下文 | 开放性 | 显著优势 | 主要考虑因素 |
|---|---|---|---|---|---|
| Kimi K3 | 多模态编码、智能体和知识工作 | 最高可达 1M | 开放权重发布已公布 | 长上下文与视觉代理工作流 | 长期生产证据有限的新模型 |
| Claude Fable 5 | 困难、持续的编码与专业工作 | 查看当前访问层级 | 已关闭 | 高端知识工作和长期任务 | 封闭平台和高端定位 |
| Claude Opus 4.8 | 前沿编码与推理 | 查看当前API文档 | 已关闭 | 成熟的智能体编码性能 | 成本与供应商依赖 |
| GLM-5.2 | 开源长周期工程模型 | 1M | MIT许可的权重 | 灵活的算力投入与开放部署 | 在部分困难的编程基准测试中落后于最强的闭源模型 |
Kimi K3 vs Fable 5
对于像”Kimi K3 vs Fable 或 Kimi K3 vs Fable 5″, Moonshot自身的发布定位表示Fable 5整体上仍然更强。当开放权重、有记录的1M上下文窗口、多模态开发或API经济性更为重要时,Kimi K3可能更具吸引力;应在目标工作流上对两者进行测试,而不是假设一个能赢得所有任务。
Kimi K3 vs Claude
“Kimi K3 vs Claude”是一个宽泛的比较,因为Claude包含多个模型层级。Claude拥有成熟的生态系统和已建立的编码工作流,而Kimi K3则强调开放权重、原生视觉、1M上下文和长期运行的代理任务。比较成功率、延迟、工具可靠性和每项已完成任务的成本——而不仅仅是Token价格。
Kimi K3 vs Opus 4.8
在 Kimi K3 vs Opus 4.8,Opus 是更成熟的生产选择,适用于高级软件工程和智能体推理。Kimi K3 在部分发布的基准测试中与 Opus 不相上下或领先,但对于优先考虑长上下文、多模态和更高模型开放度的团队来说,它是较新的选择。
Kimi K3 vs GLM-5.2
关于Kimi K3 vs GLM 5.2的对比之所以重要,是因为两者都面向长周期工作,并支持 1M token 的上下文。GLM-5.2 提供 MIT 许可的权重和可选的投入力度;Kimi K3 规模大得多,并强调原生视觉和更广泛的知识工作。它们的发布报告在 Terminal-Bench 2.1 上分别列出了 81.0 和 88.3,但评测细节不同,因此不能把这一差距视为纯粹的直接对比结果。
Kimi K3 API 价格:官方 API vs TokenHub
Kimi K3 的 API 价格取决于模型的访问位置。
| 访问方式 | 每1M tokens 输入 | 每1M tokens 输出 | 每1M tokens 缓存输入/读取 |
|---|---|---|---|
| Kimi 官方 API | $3.00 | $15.00 | $0.30 |
| TokenHub | $2.8571 | $14.2857 | $0.2857 |
TokenHub 目前列出的实际价格略低于官方 Kimi API。价格可能变动,因此在计算生产预算前,请查看实时模型页面。
例如,一个使用 100,000 个未缓存输入 token 和 20,000 个输出 token 的 TokenHub 请求,费用大约为:
- 输入:
0.1 × $2.8571 = $0.28571 - 输出:
0.02 × $14.2857 = $0.285714 - 预计总计: 大约
$0.57
如果相同的 100,000 个输入 token 按缓存读取计费,输入部分将降至约 $0.02857. 实际代理成本可能更高,因为推理、工具结果、重试和长对话历史会增加令牌使用量。
Kimi K3 优势
- 1M-token 上下文,适用于大型代码库和文档集合
- 原生视觉支持,适用于截图、界面和可视化开发
- 在编码、搜索、推理和长上下文评估方面取得了强劲的早期结果
- 通过 TokenHub 提供 OpenAI 与 Anthropic 兼容的路由
- 上下文缓存和已宣布的开源权重发布
Kimi K3 局限性
- 生产历史有限,且在较大程度上依赖发布期评估
- 结果因推理力度、所用工具和智能体框架而异
- 深度推理和长上下文会增加延迟和总成本
- 自行托管一个2.8T参数规模的模型需要大量的基础设施
- 长上下文和使用工具的智能体仍然需要检索检查、权限控制、日志记录和人工审核
谁应该测试Kimi K3?
Kimi K3最适合以下人群:
- 处理大型代码库或编码智能体的开发者
- 综合整理长文档集合的研究人员
- 根据视觉参考生成代码的前端团队
- 反复重用缓存上下文的应用
- 团队通过兼容OpenAI的网关评估开放权重替代模型
它可能对于可以由更小,更便宜的模型处理的短文本分类,提取,或常规聊天任务是不必要的.
常见问题
我如何使用Kimi K3?
通过Kimi的应用程序, 官方API, Kimi Code, OpenCode, 或TokenHub使用Kimi K3. 在TokenHub上, 生成API密钥并调用 kimi-k3 通过 https://us-api.tokenhub.com/v1.
Kimi K3是免费的吗?
Kimi提供免费会员层级,但K3的使用基于积分,访问限制取决于当前方案。API使用并非免费:官方Kimi API和TokenHub均按token计费。除非明确提供单独的促销或试用额度,否则TokenHub要求付费模型请求有使用余额。
在哪里可以获取Kimi K3 API密钥?
如需直接访问Moonshot,请在Kimi API控制台创建API密钥。要与其他提供商的模型一起访问Kimi K3,请在TokenHub工作区创建TokenHub API密钥。这些密钥属于不同服务,不可互换。
Kimi K3使用什么模型ID?
TokenHub使用 kimi-k3. 某些Kimi Code和Kimi For Coding集成使用 k3. 始终使用您所调用端点记录的标识符。
Kimi K3与OpenCode兼容吗?
是的。使用 Kimi For Coding 的官方登录,或将 TokenHub 配置为自定义的兼容 OpenAI 的提供商,并使用kimi-k3 模型 ID。
最终结论:你应该尝试 Kimi K3 吗?
Kimi K3 的规格、早期基准测试和社区项目证明,在高要求的负载下对其进行测试是合理的。Windows XP 演示展示了其前端潜力,但生产环境评估仍应衡量任务成功率、未经证实的声明、延迟、token 使用量、工具可靠性以及所需的人工修正。
在 TokenHub 上试用 Kimi K3 并使用统一的 API 密钥在您自己的代码库、文档、图片或代理工作流中运行它。