Kimi K3 評測:基準測試、API 價格與社群示範

EverydayChicHub


Kimi K3 是 Moonshot AI 的 2.8 兆參數旗艦模型,適用於長期編碼、知識工作、多模態推理和代理任務。本評測涵蓋其規格、Kimi K3 基準測試、API 價格、TokenHub 與 OpenCode 設定、社群示範,以及與 Claude Fable 5、Opus 4.8 和 GLM-5.2 的重點比較。

簡而言之:Kimi K3 的 100 萬 token 上下文視窗、原生視覺能力,以及早期的基準測試結果,使其值得針對大型程式碼庫、長文件、視覺開發與研究進行測試。生產環境的決策仍應取決於您自身工作流程中的任務品質、延遲、成本與可靠性。

快速存取:試用 Kimi K3,透過 TokenHub 使用單一 API 金鑰和 OpenAI 相容端點。

kimi k3 rank 1 on arena

什麼是 Kimi K3?


Kimi K3 於 2026 年 7 月 16 日發布,是 Moonshot AI 截至本次評測為止能力最強的模型。其稀疏 Mixture-of-Experts 設計每個 token 啟用 896 個專家中的 16 個,而非對每個請求使用全部 2.8 兆個參數。Kimi Delta Attention 與 Attention Residuals 旨在提升長序列和模型深度的效率。

comparison table among agents

Kimi K3 規格與發布詳情

規格Kimi K3
開發者Moonshot AI
發布日期2026年7月16日
架構稀疏混合專家
總參數2.8兆
專家配置每個 token 啟用 896 個專家中的 16 個
上下文窗口最多 1,048,576 個 tokens
原生輸入模態文字、圖片與視覺/影片上下文
主要工作負載程式設計、研究、知識工作、智能體、長文件
推理層級低、高與最高,視存取方式而定
TokenHub 模型 IDkimi-k3
TokenHub 最大輸出131.1K tokens
TokenHub 端點/v1/chat/completions/v1/messages
全權重發布預定於2026年7月27日

Moonshot表示,新的架構和訓練方案提供的整體擴展效率約為Kimi K2的2.5倍。Kimi K3還採用量化感知訓練,使用MXFP4權重和MXFP8激活值。儘管其稀疏激活,自行托管這種規模的模型仍然是一個基礎設施密集型項目,而不是典型的本地LLM設置。

Kimi K3基準測試:早期數字顯示了什麼

TokenHub模型頁面目前列出了以下來自Artificial Analysis的指標:

基準Kimi K3 分數衡量內容
Artificial Analysis Intelligence Index57.1/100廣泛的模型能力
Artificial Analysis Coding Index76.2/100程式設計與軟體工程
GPQA93.5%研究生層級的科學推理
HLE44.3%廣泛的專家級知識
SciCode58.7%科學 Python 程式設計
AA-LCR74.7%長上下文推理

Moonshot 的發布評測也報告了 Terminal-Bench 2.1 的 88.3 分、BrowseComp 的 91.2 分、DeepSearchQA 的 95.0 分,以及 GPQA Diamond 的 93.5%。這些分數顯示了該模型的預期優勢,但 Kimi K3 通常在最大推理努力下進行測試,且某些模型比較使用了不同的代理框架。請將小幅分數差異視為方向性參考,而非普遍優越性的證明。

如何在 TokenHub 上使用 Kimi K3

對於想在不額外建立特定供應商整合的情況下使用 Kimi K3 的開發者,TokenHub 透過其統一 API 閘道提供此模型。

1. 建立 TokenHub 工作區

開啟 TokenHub 主控台,並使用電子郵件或 Google 驗證建立工作區。

2. 新增使用餘額

TokenHub 在支援的供應商和模型之間使用共享的工作區餘額。為您計畫執行的測試工作負載新增足夠的餘額。

3. 產生 TokenHub API 金鑰

在 TokenHub 主控台中建立閘道金鑰。將金鑰儲存為環境變數,而不是在應用程式中硬編碼。

export TOKENHUB_API_KEY="YOUR_TOKENHUB_API_KEY"

4. 使用 OpenAI SDK 傳送請求

TokenHub 提供與 OpenAI 相容的 API。現有的 OpenAI SDK 程式碼可以透過變更 base URL、API key 和模型 ID 來使用 Kimi K3。

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://us-api.tokenhub.com/v1",
    api_key=os.environ["TOKENHUB_API_KEY"],
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "user",
            "content": "Review this function and identify any concurrency bugs.",
        }
    ],
)

print(response.choices[0].message.content)

在 TokenHub 上,模型識別碼是 kimi-k3. 請勿將其替換為 k3 在某些 Kimi Code 整合中所使用的識別碼,除非端點文件特別指示您這麼做。

TokenHub 也列出了與 Anthropic 相容的 /v1/messages 路由。使用與您應用程式其餘部分匹配的端點和 SDK 風格。

在 OpenCode 中使用 Kimi K3

Kimi K3 可以透過 Kimi 官方 Kimi For Coding 登入或透過 TokenHub。官方路由使用 Kimi API 金鑰和模型 ID k3; 下面的 TokenHub 路由使用 TokenHub API 金鑰和 kimi-k3.

透過 TokenHub 設定 Kimi K3 OpenCode

因為 TokenHub 公開了相容 OpenAI 的端點,所以可以將其新增為自訂的 OpenCode 提供者。首先,請安全地儲存 API 金鑰:

export TOKENHUB_API_KEY="YOUR_TOKENHUB_API_KEY"

然後將自訂提供者新增至 opencode.json:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "tokenhub": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "TokenHub",
      "options": {
        "baseURL": "https://us-api.tokenhub.com/v1",
        "apiKey": "{env:TOKENHUB_API_KEY}"
      },
      "models": {
        "kimi-k3": {
          "name": "Kimi K3",
          "limit": {
            "context": 1048576,
            "output": 131072
          }
        }
      }
    }
  }
}

啟動 OpenCode 並執行 /models 以選擇 TokenHub / Kimi K3. OpenCode 的提供者設定可能會變更,因此如果模型未出現,請在 OpenCode 文件中確認目前的自訂提供者語法。

Kimi K3 社群展示

社群專案比單純的基準測試表更能具體呈現人們嘗試用 Kimi K3 所做的事物。這些範例是展示而非受控評估:原始提示詞、迭代次數、手動編輯、工具和託管工作可能未公開記錄。

前端頁面生成:Windows XP 網頁體驗

一個廣為分享的 由 AB Kuai.Dong 發佈的 X 貼文 突顯了一個基於瀏覽器的 Windows XP 重製版,據稱是使用 Kimi K3 建置的。該貼文連結至 windows-xp.kimi.site 並顯示熟悉的 Windows XP 桌面,帶有互動式視窗。其隨附影片展示了 Grand Theft Auto: Vice City 在網頁體驗中運行,並表示該項目也可以運行 Command & Conquer: Red Alert 2.

該貼文的作者將此項目描述為比另一個社群自製的 macOS 風格網頁更進一步。在檢視時,該 X 貼文顯示約 441,000 次瀏覽、2,489 個讚和 1,013 個收藏,顯示出對 Kimi K3 前端生成能力的濃厚興趣。

本次展示所呈現的內容

  • 重現可辨識的桌面作業系統介面
  • 多層視窗與互動式 UI 狀態
  • 在網頁中整合可遊玩或串流的遊戲體驗
  • 協調視覺設計、應用程式邏輯與大型前端程式碼庫的能力

它無法證明的事

這則公開貼文並未揭露完整的提示詞歷史、原始碼、生成次數、人工修正,或其他模型與工具是否有參與。因此,最好將其視為 Kimi K3 輔助前端開發的社群展示,而非獨立的 Kimi K3 基準測試,也非證明該模型在一次嘗試中生成整個專案。

互動式 3D 場景生成:湖泊環境

另一個 來自 gimu 的社群貼文 展示了一個 3D 湖泊環境,這是作者在 Kimi K3 效能測試期間創作的。影片呈現了一個可瀏覽的景觀,包含反射水面、茂密樹木、周圍山脈,以及一個用於調整環境設定的螢幕氛圍面板。

創作者表示,湖泊、森林和山景的品質超出了他們的預期,並總結說,結果優於同一篇貼文中先前的 Claude Fable 5 湖泊實驗。在檢視時,Kimi K3 貼文顯示約有 212,000 次觀看、1,268 個讚和 555 個收藏。

「比 Fable 5 更好」的結論是創作者的主觀評估。該貼文並未公佈標準化評分方法、完整的提示詞、原始碼、生成設定或涉及的手動工作量,因此不應將其視為受控的 Kimi K3 對比 Fable 5 基準測試。

網頁設計工作流程:從視覺研究到完成的登陸頁面

在一個 由 Viktor Oddy 分享的社群教學,Kimi K3 被用於一個約 13 分鐘的工作流程中,用來建立作者所描述的「獲獎級」網站。影片中顯示創作者收集視覺參考並經歷設計過程,最後呈現出一個精緻的登陸頁面概念,包含醒目的排版、克制的單色插圖、清晰的導覽,以及顯眼的行動呼籲。

這是一個有用的 Kimi K3 網頁設計 展示案例,因為它呈現的不僅是最終截圖。它展示了一個實際的工作流程,從視覺方向和參考收集到頁面生成與迭代,使其與設計師、創意開發者以及使用 AI 進行快速網站原型設計的團隊相關。

在審查時,該貼文顯示約 107,000 次觀看、1,689 個讚和 2,223 個書籤。異常高的書籤數量表明,讀者認為這個教學是一個可重複的工作流程,而不僅僅是一個視覺演示。

Kimi K3 對比 Claude、Fable 5、Opus 4.8 和 GLM-5.2

此表格為評論提供輔助背景資訊。社群示範和基準分數是有用的參考指標,但生產環境的決策仍需在自己的工作負載上進行受控測試。

模型主要定位上下文開放性顯著優勢主要考量
Kimi K3多模態編碼、代理程式與知識工作最高 1M宣布開放權重版本發布長上下文與視覺代理工作流程新模型,長期生產環境實證有限
Claude Fable 5高難度、持續的編碼與專業工作查看目前的存取層級封閉高階知識工作與長期執行任務封閉平台與高階定位
Claude Opus 4.8前沿編碼與推理查閱當前 API 文件已關閉成熟的代理式編碼性能成本與供應商依賴
GLM-5.2開放式長程工程模型1MMIT 授權的權重彈性的投入與開放部署在某些嚴苛的程式設計基準測試上,落後於最強的封閉模型

Kimi K3 vs Fable 5

對於像是 Kimi K3 vs FableKimi K3 vs Fable 5,Moonshot 自家的發表定位表示 Fable 5 整體上仍然較強。當開放權重、有文件記載的 1M 上下文視窗、多模態開發或 API 經濟性更受重視時,Kimi K3 可能更具吸引力;請在目標工作流程上測試兩者,而不是假設其中一個能勝任所有任務。

Kimi K3 vs Claude

「Kimi K3 vs Claude」是一個廣泛的比較,因為 Claude 包含多個模型層級。Claude 擁有成熟的生態系統和已建立的程式設計工作流程,而 Kimi K3 則強調開放權重、原生視覺、1M 上下文,以及長時間執行的代理任務。請比較成功率、延遲、工具可靠性和每項已完成任務的成本——而不僅僅是 token 價格。

Kimi K3 vs Opus 4.8

Kimi K3 對比 Opus 4.8Opus 是進階軟體工程與代理式推理方面更成熟的生產級選擇。Kimi K3 在部分發布基準測試上與之不相上下或領先,但對於優先考慮長上下文、多模態和更高模型開放性的團隊來說,它是較新的選擇。

Kimi K3 對比 GLM-5.2

Kimi K3 與 GLM 5.2 的比較具有相關性,因為兩者都針對長期任務並支援 1M token 的上下文。GLM-5.2 提供 MIT 授權的權重和可選擇的運算等級;Kimi K3 規模大得多,強調原生視覺和更廣泛的知識工作。它們的發布報告分別在 Terminal-Bench 2.1 上列出 81.0 和 88.3,但不同的評測細節使得無法將該差距視為單純的對比結果。

Kimi K3 API 價格:官方 API 對比 TokenHub

Kimi K3 API 的價格取決於模型的存取位置。

存取方式每 1M tokens 的輸入每 1M tokens 的輸出每 1M tokens 的快取輸入/讀取
Kimi 官方 API$3.00$15.00$0.30
TokenHub$2.8571$14.2857$0.2857

TokenHub 目前列出的實際價格略低於官方 Kimi API。價格可能會變動,因此在計算生產預算前,請查看即時模型頁面。

例如,使用 100,000 個未快取輸入 token 和 20,000 個輸出 token 的 TokenHub 請求,費用約為:

  • 輸入:0.1 × $2.8571 = $0.28571
  • 輸出:0.02 × $14.2857 = $0.285714
  • 預估總計:約$0.57

如果相同的 100,000 個輸入 token 以快取讀取計費,則輸入部分將降至約$0.02857. 實際代理成本可能更高,因為推理、工具結果、重試以及長對話歷史會增加 token 使用量。

Kimi K3 優勢

  • 1M-token 上下文,適用於大型儲存庫和文件集合
  • 原生視覺能力,適用於截圖、介面和視覺開發
  • 在編碼、搜尋、推理和長上下文評估方面表現強勁
  • 透過 TokenHub 提供與 OpenAI 和 Anthropic 相容的路由
  • 上下文快取和已公布的開放權重發布

Kimi K3 限制

  • 有限的生產歷史以及對發佈期間評估的顯著依賴
  • 結果會因推理強度、工具和代理程式框架而異
  • 深度推理與長上下文可能會增加延遲和總成本
  • 自行託管一個 2.8T 參數的模型需要大量的基礎設施
  • 長上下文和使用工具的代理程式仍然需要檢索檢查、權限、日誌記錄和人工審查

誰應該測試 Kimi K3?

Kimi K3 最適合以下對象:

  • 處理大型程式碼庫或編碼代理程式的開發人員
  • 綜合長篇文件集的研究人員
  • 根據視覺參考產生程式碼的前端團隊
  • 重複重用已快取上下文的應用程式
  • 透過 OpenAI 相容閘道評估開放權重替代方案的團隊

對於可由較小且較便宜的模型處理的簡短分類、抽取或例行聊天任務,可能並非必要。

常見問題

我該如何使用 Kimi K3?

透過 Kimi 應用程式、官方 API、Kimi Code、OpenCode 或 TokenHub 使用 Kimi K3。在 TokenHub 上,生成 API 金鑰並呼叫 kimi-k3,透過 https://us-api.tokenhub.com/v1

Kimi K3 是免費的嗎?

Kimi 提供免費會員方案,但 K3 的使用是基於點數制,存取限制取決於目前的方案。API 使用並非免費:官方 Kimi API 和 TokenHub 都按 token 計費。TokenHub 要求付費模型請求需有使用餘額,除非另外明確提供促銷或試用點數。

我可以在哪裡取得 Kimi K3 API 金鑰?

若要直接使用 Moonshot,請在 Kimi API 主控台建立 API 金鑰。若要與其他供應商的模型一起使用 Kimi K3,請在 TokenHub 工作區建立 TokenHub API 金鑰。這些金鑰屬於不同服務,不能互換。

Kimi K3 使用什麼模型 ID?

TokenHub 使用 kimi-k3。有些 Kimi Code 和 Kimi For Coding 整合使用 k3。請務必使用您所呼叫端點所記載的識別碼。

Kimi K3 可以搭配 OpenCode 使用嗎?

是的。使用 Kimi For Coding 的官方登入,或將 TokenHub 設定為自訂的 OpenAI 相容提供者,搭配 “kimi-k3 模型 ID。

最終結論:你應該嘗試 Kimi K3 嗎?

Kimi K3 的規格、早期基準測試和社群專案,證明其值得在要求嚴苛的工作負載上進行測試。Windows XP 的展示案例說明了它的前端潛力,但生產環境評估仍應衡量任務成功率、未經證實的宣稱、延遲、token 使用量、工具可靠性,以及所需的人工修正。

在 TokenHub 上試用 Kimi K3 並使用單一整合的 API 金鑰,針對你自己的儲存庫、文件、圖片或代理工作流程來執行。

下一頁GLM 5.2 對比 GLM 5.1:現在升級還是再觀望?