/v1/chat/completionsGLM-5.3-Flash
glm-5.3-flashGLM-5.3-Flash 是智谱 AI(Z.ai)GLM-5 系列首个原生多模态模型,面向快速编程、视觉理解和 Agent 工作流。它采用 320B 参数的 MoE 架构,每个 token 激活 18B 参数,并结合稀疏注意力与线性注意力,以提升长上下文任务的推理效率。你可以通过 TokenHub 调用 GLM API / 智谱 API,查看当前 GLM-5.3-Flash 的价格、模型 ID、支持输入、工具调用、上下文限制和端点,再评估是否用于生产级编程或多模态智能体任务。
最大上下文
1MToken
最大输出
131.1KToken
发布日期
2026年8月26日
模态
GLM-5.3-Flash 价格
| 输入价格 | 输出价格 | 缓存读取 |
|---|---|---|
| $0.1143/M | $0.4/M | $0.0329/M |
如何通过 API 使用 GLM-5.3-Flash?
GLM-5.3-Flash 基准测试
GLM-5.3-Flash
57.5
/100
Artificial Analysis 综合能力指数
Artificial Analysis 综合能力评分
指数分数
71.5
/100
Artificial Analysis 代码能力指数
Artificial Analysis 软件任务评分
指数分数
指标来源 Artificial Analysis
GLM-5.3-Flash 常见问题
了解智谱 AI 的 GLM-5.3-Flash,包括多模态能力、推理模式、适用场景、智谱 API 与 TokenHub 接入方式。
GLM-5.3-Flash 是什么?+
GLM-5.3-Flash 是智谱 AI(Z.ai)GLM-5 系列中的原生多模态模型。它采用稀疏混合专家架构,拥有 3200 亿总参数、每个 token 约激活 180 亿参数,重点面向高效编程、推理、视觉理解和智能体工作流。
GLM-5.3-Flash 最适合哪些场景?+
它适合编程助手、代码仓库分析、视觉调试、文档理解、工具调用智能体和多步骤自动化,尤其适用于同时关注效果与推理效率的生产场景。
GLM-5.3-Flash 支持多模态输入吗?+
支持。作为智谱 GLM 系列的原生多模态模型,GLM-5.3-Flash 可以结合文本与视觉信息,用于截图分析、文档审阅、界面检查和视觉编程工作流。上线前应确认当前 TokenHub 端点支持的具体输入格式。
GLM-5.3-Flash 的主要优势是什么?+
它的优势包括原生多模态理解、高效稀疏激活、编程与智能体能力、面向工具调用的工作流以及可调节的推理行为,适合需要超越基础文本生成能力的智谱 API 应用。
选择 GLM-5.3-Flash 前需要考虑哪些取舍?+
Flash 版本更强调效率,因此对于高难度编程、长周期智能体执行和精度敏感任务,应使用真实工作负载与完整版本 GLM-5.3 对测。多模态结果和工具调用也需要在生产使用前进行验证,尤其是错误操作可能带来业务影响的场景。
如何通过 TokenHub 的 GLM API 使用 GLM-5.3-Flash?+
使用 TokenHub 模型目录中显示的模型 ID,并配置 TokenHub 端点和 API Key。消息、图像、工具调用及推理控制参数应以当前端点文档为准。如果从智谱开放平台或智谱 API 迁移,需先验证请求字段和响应解析,再切换生产流量。
如何评估 GLM-5.3-Flash 的价格和可用性?+
请在 TokenHub 当前模型页面查看输入、输出、缓存或按请求计费的价格,以及可用端点。价格与可用性可能调整,评估成本时应结合真实提示词长度、输出长度、推理档位、并发量和重试率,而不是依赖固定示例。
GLM-5.3-Flash 媒体内容与演示
精选 GLM-5.3-Flash 视频、社区实测、本地部署测试,以及与智谱 GLM-5 系列直接相关的讨论。
X (Twitter)
Reddit
YouTube