MiMo 是小米大模型核心团队(LLM-Core Team,2023 年雷军牵头组建,2025.11 前 DeepSeek 研究员罗福莉加入任大模型负责人)自研的 推理优先(Reasoning-First)开源大模型家族,2025-04-30 首发 MiMo-7B,口号 “Unlocking the Reasoning Potential of Language Model”。核心路线是 不堆参数、靠预训练+RL 联动把小模型推理榨到极致,并深度绑定小米“人 × 车 × 家”全生态(超级小爱、SU7 座舱、Miloco 全屋智能、miclaw 手机 Agent 等)。
一、简介与定位
-
首发:2025-04-30 开源 MiMo-7B(Base / SFT / RL-Zero / RL 四个 checkpoint,Apache-2.0)
-
训练规模:基座 25T tokens 预训练 + 200B 推理专项 token;三阶段数据混合 + MTP(Multi-Token Prediction)目标加速解码
-
关键成绩(MiMo-7B-RL):MATH-500 95.8%、AIME 2024 68.2%、AIME 2025 55.4%、LiveCodeBench v5 57.8% —— 7B 体量反超 OpenAI o1-mini 与阿里 QwQ-32B-Preview
-
演进节奏:7B(2025.4)→ MiMo-VL-7B(2025.6 多模态)→ V2-Flash(2025.12,309B MoE)→ V2-Pro / V2-Omni / V2.5 系列(2026,1T+ 参数、1M 上下文、MIT 许可)
-
许可:早期 Apache-2.0,V2 起全系 MIT(含商用)
-
官方入口:mimo.xiaomi.com | GitHub: XiaomiMiMo/MiMo | HF: XiaomiMiMo
二、核心功能矩阵(Step 系列 → MiMo 系列对照)
|
类别 |
代表模型 |
关键能力 / 指标 |
|---|---|---|
|
推理语言 |
|
数学/代码/长链推理;V2-Flash SWE-Bench 73.4%、≈DeepSeek-V3 级;Hybrid Attention + 3 层 MTP,推理 2–2.6× 加速 |
|
多模态 VL |
|
原生分辨率 ViT + MLP + MiMo-7B;MMMU 70.6、OlympiadBench 59.4、OSWorld-G 56.1(超 UI-TARS);支持 |
|
全模态 |
|
文本+图像+视频+语音统一感知与执行,原生 tool-calling / GUI 交互 |
|
语音 |
|
中英+方言+歌词 ASR;自然韵律 TTS,给 Agent “声音与灵魂” |
|
代码 Agent |
|
终端原生编码 Agent,无限上下文+持久记忆+多 Agent 切换,VS Code/Cursor/Zed 插件 |
|
具身 |
|
机器人抓取(TacRefineNet)、智驾 HAD 强化学习 rollout |
|
C 端/生态 |
超级小爱、miclaw 手机 Agent、Miloco 全屋智能、SU7 座舱 |
端侧 INT4 量化跑在手机/车机/音箱;主动记忆+跨设备编排 |
📌 差异化小结:相比言犀(贴供应链的产业模型)、阶跃(通用多模态+终端 Agent),MiMo 的标签是 “小参数·强推理·全开源·人车家端云一体”,尤其适合数学/代码/长程 Agent/端侧部署场景。
三、用法(Web / API / 本地三条路径)
路径 A:零代码体验
-
网页对话:mimo.xiaomi.com → “Web 体验” 直接聊;多模态、长文档、推理过程可视化
-
C 端落地:小米手机“超级小爱”、SU7 车机、小米全家桶已内置,无需单独接入
路径 B:官方 API(开发者,OpenAI / Anthropic 双兼容)
① 开通:mimo.mi.com 注册 → 开发者控制台建应用 → 拿 MIMO_API_KEY(官方建议环境变量管理,勿进 Git)
② 端点
OpenAI 风格:https://api.xiaomimimo.com/v1/chat/completions
Anthropic 风格:https://api.xiaomimimo.com/anthropic
头部用 api-key: $MIMO_API_KEY 或 Authorization: Bearer ...
③ Python(OpenAI SDK)
from openai import OpenAI
client = OpenAI(api_key="MIMO_API_KEY", base_url="https://api.xiaomimimo.com/v1")
resp = client.chat.completions.create(
model="mimo-v2.5-pro", # 或 mimo-v2-flash / mimo-7b-rl / mimo-vl-7b-rl
messages=[{"role":"user","content":"用 Python 写个带缓存的斐波那契"}],
max_tokens=1024, temperature=0.6, stream=True
)
for c in resp: print(c.choices[0].delta.content or "", end="")
④ 工具调用 / 思考模式(V2.5 起支持返回 reasoning_content + tool_calls,多轮需保留历史 reasoning)
curl https://api.xiaomimimo.com/v1/chat/completions \
-H "api-key: $MIMO_API_KEY" -H "Content-Type: application/json" -d '{
"model":"mimo-v2.5-pro","stream":false,
"messages":[{"role":"user","content":"河北现在天气怎么样?"}],
"tools":[{"type":"function","function":{"name":"get_current_weather",
"parameters":{"type":"object","properties":{"location":{"type":"string"}},"required":["location"]}}}],
"tool_choice":"auto"}'
⑤ 当前主力模型名
-
mimo-7b-rl:边缘/端侧、离线、低延迟首选 -
mimo-v2-flash:309B MoE,长上下文+高吞吐代码/Agent -
mimo-v2.5-pro/mimo-v2.5-omni:1M 上下文、全模态、复杂多步任务(API 约 $1/M input token,闭源旗舰 1/5 价)
路径 C:本地部署(完全开源权重)
显存参考:MiMo-7B FP16 ≈ 14–16G;INT4/GGUF(Q4_K_M) ≈ 4–6G(RTX 4060 8G 可跑 64K ctx)
① Transformers(最简)
from transformers import AutoModelForCausalLM, AutoTokenizer
mid = "XiaomiMiMo/MiMo-7B-RL"
model = AutoModelForCausalLM.from_pretrained(mid, trust_remote_code=True)
tok = AutoTokenizer.from_pretrained(mid)
print(tok.decode(model.generate(**tok("今天", return_tensors="pt"), max_new_tokens=100)[0]))
② vLLM(推荐,支持 MTP 推测解码)
vllm serve XiaomiMiMo/MiMo-7B-RL --trust-remote-code
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" \
-d '{"model":"XiaomiMiMo/MiMo-7B-RL","messages":[{"role":"user","content":"1+1=?"}]}'
③ SGLang(多模态 / VL 推荐)
python3 -m sglang.launch_server --model-path XiaomiMiMo/MiMo-VL-7B-RL \
--host 0.0.0.0 --port 30000 --trust-remote-code
④ Ollama / llama.cpp(消费级显卡)
ollama run hf.co/jedisct1/MiMo-7B-RL-GGUF
# 或 llama.cpp: llama-server -hf XiaomiMiMo/MiMo-V2-Flash-GGUF:Q4_K_M
