Qwen3.7 Max 詳解:智能體能力、1M 上下文、基準測試與 API 存取

EverydayChicHub

Qwen3.7 Max 是 Alibaba Qwen 面向智能體時代的旗艦模型. 如果您正在評估適用於長期運行的編碼智能體, 辦公室自動化, 試算表推理, 或複雜工具使用工作流程, 它應該列入候選名單.

快速解答

Qwen3.7 Max 是 Qwen3.7 系列中的頂級模型, 於 May 2026 發布, 定位於以智能體為中心的工作. 目前平台列表將它描述為一個文字輸入, 文字輸出 模型 具有 1M-token 上下文窗口, 強大的編碼和生產力基準, 以及對長時程自主執行的支援. 它最適合測試嚴肅的編碼智能體, 辦公室自動化, 以及多步驟工具工作流程的團隊而不是簡單的僅聊天任務.

重點摘要

  • Qwen3.7 Max 是圍繞智能體設計的,特別是在程式編寫、工具使用、辦公生產力和長時間執行方面。
  • 該模型配備 1M 上下文,這使其適用於儲存庫規模、文件密集型和多步驟的工作流程。
  • Together AI 將 Qwen3.7 Max 描述為具有強勁報告分數的專有旗艦模型,包括 69.7 在 Terminal-Bench 2.0-Terminus 上,以及 80.4% 在 SWE-Bench Verified 上。
  • OpenRouter 目前列出的定價為 $1.25 輸入 / $3.75 輸出 每 1M tokens, 而 Artificial Analysis 報告了較高的評估價格概況, 所以買家應核實他們計劃使用的提供者路由.
  • 對於 API 存取, 團隊可以透過提供者如 Together AI, OpenRouter, Alibaba Cloud 路由, 或模型路由層如 TokenHub 來測試它.

什麼是 Qwen3.7 Max?

Qwen3.7 Max 是 Alibaba 的 Qwen3.7 系列中的旗艦模型. 官方 Qwen 結果將其排名為 “Qwen3.7: The Agent Frontier,” 這是一個有助於了解模型定位的線索: 這主要不是一個輕量級聊天機器人模型. 它針對的是需要規劃, 呼叫工具, 編寫程式碼, 在長上下文中操作, 以及長時間持續運作的代理工作流程.

Together AI 的模型頁面清楚地總結了定位: Qwen3.7 Max 是為 “the agent era,” 而建, 在編寫程式碼, 辦公室自動化, 以及長期任務執行方面具有優勢. 這也與目前的 SERP 行為一致. 頂部結果不僅是新聞頁面. 它們還包括 API 定價頁面, 模型列表, 平台整合, 社群討論, 和實作影片.

在實際的 SEO 術語中, 這個關鍵字具有 混合的資訊型與商業型意圖. 搜尋者想要了解 Qwen3.7 Max 是什麼, 但他們也想知道他們是否真的可以透過 API 使用它.

為什麼 Qwen3.7 Max 重要

核心重點不僅僅是「新的 Qwen 模型」。更有用的觀點是,Qwen3.7 Max 被定位並評估為代理骨幹。

這表示當工作負載包含以下項目時,它很重要:

  • 需要儲存庫層級推理的編碼代理
  • 需要多次工具呼叫的軟體工程任務
  • 辦公室自動化,包括試算表和文件工作流程
  • 長上下文研究、規劃與綜合
  • 自主執行,模型必須在多個步驟中保持連貫性

這就是為什麼目前的報導提到外部代理工具框架,例如 Claude Code、OpenClaw、Qwen Code 和自訂工具使用系統。團隊是否應該採用它,與其說取決於單回合聊天品質,不如說取決於它在真實代理迴圈中的表現。

Capability map showing Qwen3.7 Max strengths in Terminal-Bench, SWE-Bench Verified, spreadsheet automation, and long-running autonomous execution.

核心規格與已發布的基準測試

最常被引用的平台頁面強調的是同一組能力:1M 上下文、程式編寫、推理、生產力,以及長時程自主性。

領域目前的公開信號為何重要
模型角色旗艦 Qwen3.7 模型將其作為高階評估目標,而非低成本預設選項。
上下文視窗1M tokens支援長篇程式碼庫、大型文件,以及更深入的代理記憶體。
終端編碼透過 Together AI 列表,在 Terminal-Bench 2.0-Terminus 獲得 69.7 分表示具備強大的終端式編碼與執行能力。
儲存庫任務透過 Together AI 列表,SWE-Bench Verified 達到 80.4%與編碼代理及除錯工作流程相關。
推理透過 Together AI 列表,GPQA Diamond 達到 92.4%顯示在困難問題推理上有優異表現。
辦公室生產力87.0% SpreadSheetBench-v1 透過 Together AI 列表適用於文件、試算表及商業工作流程自動化。
自主性宣稱Qwen 所報告的約 35 小時的自主工作階段這暗示了長時程智能體的定位,但團隊應以自己的任務進行驗證。

這些數字很有用,但卻不應取代您自己的評估。智能體工作負載對提示詞、支架、工具結構、重試邏輯和 token 預算異常敏感。一個模型在公開基準測試中可能得分很高,但在您的產品中仍可能表現不同。

Qwen3.7 Max 對比 Qwen3.7 Plus

搜尋結果也顯示 Qwen3.7 Plus,因此值得將兩者區分開來。

Qwen3.7 Max 是旗艦級、以文字為核心的模型,專為最困難的智能體與推理工作負載而設計。 Qwen3.7 Plus,根據OpenRouter的列表,被定位為Qwen3.7系列中具成本效益的成員,並支援多模態影像輸入。這意味著正確的選擇取決於工作任務。

在以下情況使用Qwen3.7 Max:

  • 任務是文字密集且智能體密集
  • 程式碼品質比影像輸入更重要
  • 長上下文規劃與執行很重要
  • 您正在評估高階推理路線

在以下情況使用Qwen3.7 Plus:

  • 你需要圖片輸入或 GUI 感知
  • 這項任務更偏向多模態,而非程式碼密集型
  • 成本比頂尖推理更重要
  • 你正在建構更廣泛的視覺工作流程

定價與成本注意事項

定價是 Qwen3.7 Max 最混亂的部分之一,因為不同平台顯示不同的商業條款。

OpenRouter 目前列出 Qwen3.7 Max 的價格為 $1.25 每 1M 輸入 tokens$3.75 每 1M 輸出 tokens. 然而, Artificial Analysis, 報告 $2.50 input / $7.50 output per 1M tokens 在其模型分析中. 這些數字可能反映不同的供應商路線, 折扣, 測量窗口, 或有效的定價假設.

有用的要點很簡單: 不要僅根據模型名稱評估 Qwen3.7 Max. 評估你計劃使用的確切路線.

成本也很大程度上取決於輸出的冗長程度. Artificial Analysis 指出 Qwen3.7 Max 在其 Intelligence Index 評估中產生的 token 數量遠高於平均. 對於代理任務, 這很重要, 因為每個計畫, 重試, 工具呼叫說明, 和中間回應都可能累積成更大的帳單.

Qwen3.7 Max 的最佳使用案例

代理式編程

Qwen3.7 Max 是編程代理的有力候選者因為許多公開訊號都指向同一方向: Terminal-Bench, SWE-Bench, 長上下文支援, 和代理測試框架相容性. 如果您的使用案例涉及程式碼庫導覽, 重構, 錯誤修復, 或多檔案推理, 這是最值得測試的第一條路線.

辦公室與生產力自動化

SpreadSheetBench-v1 和辦公室自動化的宣稱使 Qwen3.7 Max 對結合結構化數據, 文件, 公式, 和工具呼叫的業務工作流程很有吸引力. 這比一般的聊天機器人寫作更具差異化.

長期研究與規劃

1M 的上下文視窗讓團隊能夠將更多原始資料保留在視野中。這對於法律審查、研究綜述、技術文件、策略規劃和企業知識工作流程都非常有價值。

Agent 框架實驗

由於 Qwen3.7 Max 被描述為可跨多種代理程式支架進行泛化,因此值得在您現有的框架中進行測試,而不是假設您需要 Qwen 專用的包裝器。真正的問題是它如何與您的工具、您的護欄和您的重試邏輯互動。

如何取得 Qwen3.7 Max API 存取

有幾種實用的途徑,取決於您的團隊目前如何管理模型。

Together AI

Together AI 將模型列為 Qwen/Qwen3.7-Max 並提供常見 SDK 模式的範例。這是透過託管 API 測試模型的直接方式。

OpenRouter

OpenRouter 將模型列為 qwen/qwen3.7-max 並提供一個與 OpenAI 相容的路由層. 當您想要將 Qwen3.7 Max 與其他模型進行比較而無需重寫整個模型客戶端時這很有用.

TokenHub

如果您的技術棧已經使用統一的模型存取層, TokenHub 是另一個將 Qwen3.7 Max 加入評估集的實用場所. 當您想要在單一工作流程中比較模型品質, 延遲, 和成本而不是為每個提供者建立單獨的整合時這特別有用.

Alibaba Cloud 或 Qwen 生態系統路由

Alibaba Cloud 和 Qwen 相關的路由是自然的選擇如果您的團隊已經在 Alibaba 的生態系統中工作. 這些對於希望原生供應商對齊的團隊可能特別相關.

Diagram showing Qwen3.7 Max API access paths through Alibaba Cloud, Together AI, OpenRouter, and TokenHub.

上線前要測試什麼

在將真實生產流量傳送給 Qwen3.7 Max 之前,請在反映實際工作負載的任務上進行測試。

使用一個小型評估套件,包含:

  • 一個儲存庫層級的編碼任務
  • 一個試算表或辦公室自動化任務
  • 一個長文件推理任務
  • 一個帶工具呼叫的代理任務
  • 一次延遲和成本測量回合

追蹤品質、總輸出標記、工具呼叫可靠性、延遲和失敗恢復。對於代理型模型而言,最好的模型很少是能給出一個令人印象深刻答案的模型,而是在混亂的多步驟工作中始終保持有用的模型。

風險與注意事項

這是專有技術

與某些開源權重的 Qwen 版本不同,多個來源將 Qwen3.7 Max 描述為專有技術。這並不代表它不好,但會改變部署與治理的預期。

基準測試宣稱需要工作流程驗證

基準測試分數有助於方向性判斷,但無法取代你的提示詞、工具、安全規則與成本限制。

Token 使用量可能影響實際成本

如果模型傾向產生冗長輸出,帳單金額可能迅速上升。這對長時間運作的代理(agent)尤其重要。

API 路由細節各有不同

OpenRouter、Together AI、TokenHub、阿里雲路由及其他平台可能提供不同的定價、可用性、請求格式或速率限制。請務必驗證你實際要使用的路由。

最終建議

如果你的團隊認真看待代理式工作流程,Qwen3.7 Max 值得測試。它最適合的場景不是閒聊,而是程式碼代理、辦公室生產力自動化、長上下文推理,以及需要模型長時間持續執行的工具密集型工作流程。

如果您只需要簡單、低成本的聊天,Qwen3.7 Max 可能超出您的需求。但如果您正在建置或評估嚴謹的代理系統,尤其是在程式碼、文件和生產力工具方面,它就值得進行結構化的基準測試。

常見問題

什麼是 Qwen3.7 Max?

Qwen3.7 Max 是阿里巴巴 Qwen3.7 系列中的旗艦模型。它定位於代理式編碼、生產力自動化、長上下文推理和長期任務執行。

Qwen3.7 Max 是否支援 1M 上下文?

目前包括 Together AI 和 OpenRouter 在內的平台列表,將 Qwen3.7 Max 描述為具有 1M token 的上下文視窗。

Qwen3.7 Max 是開源的嗎?

目前的公開報導將 Qwen3.7 Max 描述為專有模型。除非阿里巴巴發布官方開放權重,否則請將其視為託管或供應商存取模型。

Qwen3.7 Max 的費用是多少?

OpenRouter 目前列出其價格為每 1M tokens 輸入 $1.25、輸出 $3.75。Artificial Analysis 報告了更高的價格設定,因此請與您計劃使用的確切供應商路線核實價格。

我如何存取 Qwen3.7 Max API?

您可以透過託管 API 平台(例如 Together AI 和 OpenRouter)、在可用的情況下透過阿里巴巴/Qwen 生態系統路徑,或透過模型存取層(例如 TokenHub)來測試它,如果您想要用統一的工作流程來比較多個模型。

來源與延伸閱讀

下一頁終極指南:2026年最佳免費開源 AI 工具