适合选择 MiMo V2.5 的情况
- MiMo V2.5 能在一次请求中处理文本、图像、视频和音频,适合客服质检、视频资料理解或多媒体知识库
- 如果输入会包含截图、录屏或音频,先选多模态版本比只比较参数规模更重要
- 它同样支持最高 1M token 上下文,可将长文本资料和多模态内容放入同一 Agent 流程
本页比较 Xiaomi MiMo V2.5 与 MiMo V2.5 Pro:前者适合需要图像、视频或音频理解的多模态工作流,后者面向高难度纯文本 Agent 编程和长周期工程任务。它回答的是“小米 MiMo API 该按输入形态还是能力上限来选”。
综合建议
MiMo V2.5 和 MiMo V2.5 Pro 的分界线是输入形态与任务强度,不是上下文:两者都支持最高 1M token。产品需要看图、理解视频或音频时选 MiMo V2.5;纯文本的高难度 Agent 编程、代码库改造和长周期软件工程,才优先评估 MiMo V2.5 Pro。
名称
模型 ID
数据来源
简介
供应商
发布日期
上下文长度
最大输出 Token
名称
模型 ID
数据来源
简介
供应商
发布日期
上下文长度
最大输出 Token
名称
名称
模型 ID
模型 ID
数据来源
数据来源
简介
简介
供应商
供应商
发布日期
发布日期
上下文长度
上下文长度
最大输出 Token
最大输出 Token
输入
输出
缓存输入
输入
输出
缓存输入
输入
输入
输出
输出
缓存输入
缓存输入
推理
知识
附件
输入模态
输出模态
温度参数
工具调用
推理
知识
附件
输入模态
输出模态
温度参数
工具调用
推理
推理
知识
知识
附件
附件
输入模态
输入模态
输出模态
输出模态
温度参数
温度参数
工具调用
工具调用
综合能力
代码能力
综合能力
代码能力
先看输入:有图片、视频或音频就选 MiMo V2.5;只处理文本、但要完成高难度 Agent 编程或长周期软件工程,再评估 MiMo V2.5 Pro。两者都有 1M 上下文,因此上下文长度不是这次选型的主要分界线。
不应因为名称里有 Pro 就默认它支持更多模态。MiMo V2.5 Pro 的当前定位是纯文本高能力模型;需要图像、视频或音频理解时,应优先使用 MiMo V2.5,并以模型详情页当前发布的模态为准。
不要按参数规模猜价格。应根据 Xiaomi MiMo API 当前目录的输入、输出、缓存读取计费,乘以平均提示词和平均输出;Agent 任务还要把长上下文、重试和多次工具调用带来的 Token 消耗算入预算。