Based On Current Page Data
MIMiMo V2.5Xiaomi MiMo
MIMiMo V2.5 ProXiaomi MiMo
How To Read It
Best For
Multimodal agents using textimagevideoor audio
Demanding agentic codinglong-horizon software engineering
How To Read ItUse-case synthesis from model capabilities and positioning.
Workload Fit
310B/15B MoENative omnimodal1M context
1.02T/42B MoEText model1M context
How To Read ItThe workloads each model is most directly shaped for.
Input
$0.14/MEdge
$0.4286/M
How To Read ItLower is better when prompts or retrieval payloads are large.
Output
$0.28/MEdge
$0.8571/M
How To Read ItLower is better for reasoning-heavy or long-generation traffic.
Context length
1.1M
1M
How To Read ItHigher is better for repositories, retrieval packs, and transcripts.
Input modalities
Audio, Image, Text, VideoEdge
Text
How To Read ItBroader input support reduces the need for separate vision or video models.