Kimi K3 评测:基准测试、API 价格与社区演示

EverydayChicHub


Kimi K3 是 Moonshot AI 的 2.8 万亿参数旗舰模型,专为长周期编码、知识工作、多模态推理和智能体任务而设计。本评测涵盖其规格、Kimi K3 基准测试、API 价格、TokenHub 和 OpenCode 设置、社区演示,以及与 Claude Fable 5、Opus 4.8 和 GLM-5.2 的重点对比。

简而言之:Kimi K3 的 100 万 token 上下文窗口、原生视觉能力和早期基准测试结果,使其值得在大型代码库、长文档、视觉开发和研究中进行测试。生产决策仍应取决于您自己的工作流中的任务质量、延迟、成本和可靠性。

快速访问:尝试 Kimi K3,通过 TokenHub 使用单个 API 密钥和兼容 OpenAI 的端点。

kimi k3 rank 1 on arena

什么是 Kimi K3?


发布于 2026 年 7 月 16 日,Kimi K3 是截至本次评测为止 Moonshot AI 最强大的模型。其稀疏混合专家设计在每 token 激活 896 个专家中的 16 个,而不是为每个请求使用全部 2.8 万亿参数。Kimi Delta Attention 和 Attention Residuals 旨在提高长序列和模型深度方面的效率。

comparison table among agents

Kimi K3 规格与发布详情

规格Kimi K3
开发者Moonshot AI
发布日期July 16, 2026
架构稀疏混合专家
总参数量2.8万亿
专家配置每个 token 激活 896 个专家中的 16 个
上下文窗口最多 1,048,576 个 tokens
原生输入模态文本、图像和视觉/视频上下文
主要工作负载编程、研究、知识工作、智能体、长文档
推理级别低、高和最高,取决于访问方式
TokenHub 模型 IDkimi-k3
TokenHub 最大输出131.1K tokens
TokenHub 端点/v1/chat/completions/v1/messages
全量权重发布计划于2026年7月27日

Moonshot 表示,新的架构和训练方法使整体扩展效率相比 Kimi K2 提高了约 2.5 倍。Kimi K3 还采用了量化感知训练,使用 MXFP4 权重和 MXFP8 激活。尽管采用稀疏激活,自托管如此规模的模型仍是一个基础设施密集型项目,而非典型的本地 LLM 部署。

Kimi K3 基准测试:早期数据说明了什么

TokenHub 模型页面目前列出了来自 Artificial Analysis 的以下指标:

基准Kimi K3 得分衡量内容
Artificial Analysis 智能指数57.1/100广泛模型能力
Artificial Analysis 编程指数76.2/100编程与软件工程
GPQA93.5%研究生水平的科学推理
HLE44.3%广泛的专家级知识
SciCode58.7%科学Python编程
AA-LCR74.7%长上下文推理

Moonshot的发布评估还报告了Terminal-Bench 2.1上的88.3分、BrowseComp上的91.2分、DeepSearchQA上的95.0分以及GPQA Diamond上的93.5%。这些分数表明了该模型预期的优势,但Kimi K3通常在最大推理努力下进行测试,并且一些模型比较使用了不同的代理框架。应将较小的分数差异视为方向性参考,而非普遍优越性的证明。

如何在TokenHub上使用Kimi K3

对于想知道如何在不创建另一个特定于提供商的集成的情况下使用Kimi K3的开发人员,TokenHub通过其统一的API网关提供该模型。

1. 创建TokenHub工作区

打开TokenHub控制台,使用电子邮件或Google身份验证创建工作区。

2. 添加使用余额

TokenHub在受支持的提供商和模型之间使用共享的工作区余额。为计划运行的测试工作负载添加足够的余额。

3. 生成TokenHub API密钥

在TokenHub控制台中创建网关密钥。将密钥存储为环境变量,而不是硬编码在应用程序中。

export TOKENHUB_API_KEY="YOUR_TOKENHUB_API_KEY"

4. 使用 OpenAI SDK 发送请求

TokenHub 提供与 OpenAI 兼容的 API。现有的 OpenAI SDK 代码可以通过更改基本 URL、API 密钥和模型 ID 来使用 Kimi K3。

import os\nfrom openai import OpenAI\n\nclient = OpenAI(\n    base_url=\"https://us-api.tokenhub.com/v1\",\n    api_key=os.environ[\"TOKENHUB_API_KEY\"],\n)\n\nresponse = client.chat.completions.create(\n    model=\"kimi-k3\",\n    messages=[\n        {\n            \"role\": \"user\",\n            \"content\": \"审查此函数并找出任何并发问题。\",\n        }\n    ],\n)\n\nprint(response.choices[0].message.content)

在 TokenHub 上,模型标识符是 kimi-k3. 不要将其替换为 k3 标识符,该标识符用于某些 Kimi Code 集成,除非端点文档特别要求您这样做。

TokenHub 还列出了一个与 Anthropic 兼容的 /v1/messages 路由。使用与应用程序其余部分匹配的端点和 SDK 风格。

使用 Kimi K3 与 OpenCode

Kimi K3 可以通过 Kimi 官方的 Kimi For Coding 登录或通过 TokenHub。官方路由使用 Kimi API 密钥和模型 ID k3; 下面的 TokenHub 路由使用 TokenHub API 密钥和 kimi-k3.

通过 TokenHub 进行 Kimi K3 OpenCode 设置

由于 TokenHub 提供了与 OpenAI 兼容的端点,因此可以将其添加为自定义的 OpenCode 提供程序。首先请安全地存储 API 密钥:

export TOKENHUB_API_KEY="YOUR_TOKENHUB_API_KEY"

然后将自定义提供程序添加到 opencode.json:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "tokenhub": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "TokenHub",
      "options": {
        "baseURL": "https://us-api.tokenhub.com/v1",
        "apiKey": "{env:TOKENHUB_API_KEY}"
      },
      "models": {
        "kimi-k3": {
          "name": "Kimi K3",
          "limit": {
            "context": 1048576,
            "output": 131072
          }
        }
      }
    }
  }
}

启动 OpenCode 并运行 /models 以选择 TokenHub / Kimi K3. OpenCode 的提供方配置可能会发生变化,因此如果模型未出现,请在 OpenCode 文档中确认当前的自定义提供方语法。

Kimi K3 社区展示

社区项目比单独的基准测试表更能具体地展示人们正在使用 Kimi K3 尝试的内容。这些示例是演示,而非受控评估:原始提示词、迭代次数、手动编辑、工具和托管工作可能未得到公开记录。

前端页面生成:Windows XP 网页体验

一个被广泛分享的 由 AB Kuai.Dong 发布的 X 帖子 突显了一个据报道使用 Kimi K3 构建的基于浏览器的 Windows XP 重现。该帖子链接到 windows-xp.kimi.site 并显示了一个熟悉的 Windows XP 桌面,带有可交互的窗口。其附带视频演示了 Grand Theft Auto: Vice City 在网页体验中运行,并表示该项目也可以运行 Command & Conquer: Red Alert 2.

该帖子的作者将这个项目描述为另一个社区制作的 macOS 风格网页的进阶之作。在本次查看时,这条 X 帖子显示约有 441,000 次查看、2,489 个赞和 1,013 个书签,表明人们对 Kimi K3 的前端生成能力有浓厚兴趣。

该演示所展示的内容

  • 复现可识别的桌面操作系统界面
  • 多个分层窗口和交互式 UI 状态
  • 在网页内集成可玩或流式传输的游戏体验
  • 协调视觉设计、应用逻辑和大型前端代码库的能力

它不能证明的内容

公开帖子并未披露完整的提示历史、源代码、生成次数、人工更正,或其他模型和工具是否参与。因此,最好将其视为 Kimi K3 辅助前端开发的社区展示,而非独立的 Kimi K3 基准测试,或该模型一次生成整个项目的证明。

交互式 3D 场景生成:湖泊环境

另一个 来自 gimu 的社区帖子展示了一个 3D 湖泊环境,该环境是作者 Kimi K3 性能测试的一部分。视频呈现了一个可导航的景观,包括反射水面、茂密树木、周围群山,以及一个用于调整环境设置的屏幕上的大气面板。

创作者表示,湖泊、森林和山景的质量超出了他们的预期,并得出结论,该结果优于同帖中包含的之前 Claude Fable 5 湖泊实验。在审核时,Kimi K3 帖子显示约有 212,000 次查看、1,268 次点赞和 555 次收藏。

“优于 Fable 5”的结论是创作者的主观评估。该帖子没有公布标准化的评分方法、完整的提示、源代码、生成设置或涉及的人工工作量,因此不应将其视为受控的 Kimi K3 与 Fable 5 基准测试。

网页设计工作流:从视觉研究到成品落地页

在一个由 Viktor Oddy 分享的社区教程中,Kimi K3 被用于一个约 13 分钟的工作流程中,来创建作者所称的“获奖”网站。视频展示了创作者收集视觉参考资料并推进设计过程,随后呈现了一个精美的落地页概念,包含醒目的排版、克制的单色插画、清晰的导航和突出的行动号召。

这是一个有用的Kimi K3 网页设计展示,因为它所呈现的不只是一张最终截图。它展示了一个实际的工作流程,从视觉方向和参考资料收集到页面生成与迭代,这使得它对设计师、创意开发者以及使用 AI 进行快速网站原型制作的团队都具有参考价值。

在审核时,该帖展示了大约 107,000 次查看、1,689 次点赞和 2,223 次收藏。异常高的收藏数表明读者认为该教程是一个可重复的工作流程,而不仅仅是一个视觉演示。

Kimi K3 对比 Claude, Fable 5, Opus 4.8 和 GLM-5.2

此表为评审提供支持性背景。社区演示和基准分数是有用的信号,但生产决策仍需要针对您自己的工作负载进行受控测试。

模型主要定位上下文开放性显著优势主要考虑因素
Kimi K3多模态编码、智能体和知识工作最高可达 1M开放权重发布已公布长上下文与视觉代理工作流长期生产证据有限的新模型
Claude Fable 5困难、持续的编码与专业工作查看当前访问层级已关闭高端知识工作和长期任务封闭平台和高端定位
Claude Opus 4.8前沿编码与推理查看当前API文档已关闭成熟的智能体编码性能成本与供应商依赖
GLM-5.2开源长周期工程模型1MMIT许可的权重灵活的算力投入与开放部署在部分困难的编程基准测试中落后于最强的闭源模型

Kimi K3 vs Fable 5

对于像”Kimi K3 vs FableKimi K3 vs Fable 5″, Moonshot自身的发布定位表示Fable 5整体上仍然更强。当开放权重、有记录的1M上下文窗口、多模态开发或API经济性更为重要时,Kimi K3可能更具吸引力;应在目标工作流上对两者进行测试,而不是假设一个能赢得所有任务。

Kimi K3 vs Claude

“Kimi K3 vs Claude”是一个宽泛的比较,因为Claude包含多个模型层级。Claude拥有成熟的生态系统和已建立的编码工作流,而Kimi K3则强调开放权重、原生视觉、1M上下文和长期运行的代理任务。比较成功率、延迟、工具可靠性和每项已完成任务的成本——而不仅仅是Token价格。

Kimi K3 vs Opus 4.8

Kimi K3 vs Opus 4.8,Opus 是更成熟的生产选择,适用于高级软件工程和智能体推理。Kimi K3 在部分发布的基准测试中与 Opus 不相上下或领先,但对于优先考虑长上下文、多模态和更高模型开放度的团队来说,它是较新的选择。

Kimi K3 vs GLM-5.2

关于Kimi K3 vs GLM 5.2的对比之所以重要,是因为两者都面向长周期工作,并支持 1M token 的上下文。GLM-5.2 提供 MIT 许可的权重和可选的投入力度;Kimi K3 规模大得多,并强调原生视觉和更广泛的知识工作。它们的发布报告在 Terminal-Bench 2.1 上分别列出了 81.0 和 88.3,但评测细节不同,因此不能把这一差距视为纯粹的直接对比结果。

Kimi K3 API 价格:官方 API vs TokenHub

Kimi K3 的 API 价格取决于模型的访问位置。

访问方式每1M tokens 输入每1M tokens 输出每1M tokens 缓存输入/读取
Kimi 官方 API$3.00$15.00$0.30
TokenHub$2.8571$14.2857$0.2857

TokenHub 目前列出的实际价格略低于官方 Kimi API。价格可能变动,因此在计算生产预算前,请查看实时模型页面。

例如,一个使用 100,000 个未缓存输入 token 和 20,000 个输出 token 的 TokenHub 请求,费用大约为:

  • 输入: 0.1 × $2.8571 = $0.28571
  • 输出: 0.02 × $14.2857 = $0.285714
  • 预计总计: 大约 $0.57

如果相同的 100,000 个输入 token 按缓存读取计费,输入部分将降至约 $0.02857. 实际代理成本可能更高,因为推理、工具结果、重试和长对话历史会增加令牌使用量。

Kimi K3 优势

  • 1M-token 上下文,适用于大型代码库和文档集合
  • 原生视觉支持,适用于截图、界面和可视化开发
  • 在编码、搜索、推理和长上下文评估方面取得了强劲的早期结果
  • 通过 TokenHub 提供 OpenAI 与 Anthropic 兼容的路由
  • 上下文缓存和已宣布的开源权重发布

Kimi K3 局限性

  • 生产历史有限,且在较大程度上依赖发布期评估
  • 结果因推理力度、所用工具和智能体框架而异
  • 深度推理和长上下文会增加延迟和总成本
  • 自行托管一个2.8T参数规模的模型需要大量的基础设施
  • 长上下文和使用工具的智能体仍然需要检索检查、权限控制、日志记录和人工审核

谁应该测试Kimi K3?

Kimi K3最适合以下人群:

  • 处理大型代码库或编码智能体的开发者
  • 综合整理长文档集合的研究人员
  • 根据视觉参考生成代码的前端团队
  • 反复重用缓存上下文的应用
  • 团队通过兼容OpenAI的网关评估开放权重替代模型

它可能对于可以由更小,更便宜的模型处理的短文本分类,提取,或常规聊天任务是不必要的.

常见问题

我如何使用Kimi K3?

通过Kimi的应用程序, 官方API, Kimi Code, OpenCode, 或TokenHub使用Kimi K3. 在TokenHub上, 生成API密钥并调用 kimi-k3 通过 https://us-api.tokenhub.com/v1.

Kimi K3是免费的吗?

Kimi提供免费会员层级,但K3的使用基于积分,访问限制取决于当前方案。API使用并非免费:官方Kimi API和TokenHub均按token计费。除非明确提供单独的促销或试用额度,否则TokenHub要求付费模型请求有使用余额。

在哪里可以获取Kimi K3 API密钥?

如需直接访问Moonshot,请在Kimi API控制台创建API密钥。要与其他提供商的模型一起访问Kimi K3,请在TokenHub工作区创建TokenHub API密钥。这些密钥属于不同服务,不可互换。

Kimi K3使用什么模型ID?

TokenHub使用 kimi-k3. 某些Kimi Code和Kimi For Coding集成使用 k3. 始终使用您所调用端点记录的标识符。

Kimi K3与OpenCode兼容吗?

是的。使用 Kimi For Coding 的官方登录,或将 TokenHub 配置为自定义的兼容 OpenAI 的提供商,并使用kimi-k3 模型 ID。

最终结论:你应该尝试 Kimi K3 吗?

Kimi K3 的规格、早期基准测试和社区项目证明,在高要求的负载下对其进行测试是合理的。Windows XP 演示展示了其前端潜力,但生产环境评估仍应衡量任务成功率、未经证实的声明、延迟、token 使用量、工具可靠性以及所需的人工修正。

在 TokenHub 上试用 Kimi K3 并使用统一的 API 密钥在您自己的代码库、文档、图片或代理工作流中运行它。

下一页GLM 5.2 对比 GLM 5.1:现在升级还是等待?