大厂出品 文本处理 开发者工具

MiMo

端侧部署能力突出,全场景智能设备联动,全球调用量稳居前列

时间: 2026-08-05

标签:

MiMo​ 是小米大模型核心团队(LLM-Core Team,2023 年雷军牵头组建,2025.11 前 DeepSeek 研究员罗福莉加入任大模型负责人)自研的 推理优先(Reasoning-First)开源大模型家族,2025-04-30 首发 MiMo-7B,口号 “Unlocking the Reasoning Potential of Language Model”。核心路线是 不堆参数、靠预训练+RL 联动把小模型推理榨到极致,并深度绑定小米“人 × 车 × 家”全生态(超级小爱、SU7 座舱、Miloco 全屋智能、miclaw 手机 Agent 等)。

一、简介与定位

  • 首发:2025-04-30 开源 MiMo-7B(Base / SFT / RL-Zero / RL 四个 checkpoint,Apache-2.0)

  • 训练规模:基座 25T tokens 预训练 + 200B 推理专项 token;三阶段数据混合 + MTP(Multi-Token Prediction)目标加速解码

  • 关键成绩(MiMo-7B-RL):MATH-500 95.8%、AIME 2024 68.2%、AIME 2025 55.4%、LiveCodeBench v5 57.8%​ —— 7B 体量反超 OpenAI o1-mini 与阿里 QwQ-32B-Preview

  • 演进节奏:7B(2025.4)→ MiMo-VL-7B(2025.6 多模态)→ V2-Flash(2025.12,309B MoE)→ V2-Pro / V2-Omni / V2.5 系列(2026,1T+ 参数、1M 上下文、MIT 许可)

  • 许可:早期 Apache-2.0,V2 起全系 MIT(含商用)

  • 官方入口:mimo.xiaomi.com | GitHub: XiaomiMiMo/MiMo | HF: XiaomiMiMo

二、核心功能矩阵(Step 系列 → MiMo 系列对照)

 

类别

代表模型

关键能力 / 指标

推理语言

MiMo-7B-RL / MiMo-V2-Flash(309B MoE,激活 15B)/ MiMo-V2-Pro(1T+,激活 42B,1M ctx)

数学/代码/长链推理;V2-Flash SWE-Bench 73.4%、≈DeepSeek-V3 级;Hybrid Attention + 3 层 MTP,推理 2–2.6× 加速

多模态 VL

MiMo-VL-7B-SFT / RL

原生分辨率 ViT + MLP + MiMo-7B;MMMU 70.6、OlympiadBench 59.4、OSWorld-G 56.1(超 UI-TARS);支持 /no_think 关思维链

全模态

MiMo-V2-Omni / MiMo-V2.5-Omni

文本+图像+视频+语音统一感知与执行,原生 tool-calling / GUI 交互

语音

MiMo-V2.5-ASR / MiMo-V2.5-TTS

中英+方言+歌词 ASR;自然韵律 TTS,给 Agent “声音与灵魂”

代码 Agent

MiMo Code

终端原生编码 Agent,无限上下文+持久记忆+多 Agent 切换,VS Code/Cursor/Zed 插件

具身

MiMo-Embodied

机器人抓取(TacRefineNet)、智驾 HAD 强化学习 rollout

C 端/生态

超级小爱、miclaw 手机 Agent、Miloco 全屋智能、SU7 座舱

端侧 INT4 量化跑在手机/车机/音箱;主动记忆+跨设备编排

📌 差异化小结:相比言犀(贴供应链的产业模型)、阶跃(通用多模态+终端 Agent),MiMo 的标签是 “小参数·强推理·全开源·人车家端云一体”,尤其适合数学/代码/长程 Agent/端侧部署场景。

三、用法(Web / API / 本地三条路径)

路径 A:零代码体验

  • 网页对话:mimo.xiaomi.com → “Web 体验” 直接聊;多模态、长文档、推理过程可视化

  • C 端落地:小米手机“超级小爱”、SU7 车机、小米全家桶已内置,无需单独接入

路径 B:官方 API(开发者,OpenAI / Anthropic 双兼容)

① 开通:mimo.mi.com 注册 → 开发者控制台建应用 → 拿 MIMO_API_KEY(官方建议环境变量管理,勿进 Git)

② 端点

OpenAI 风格:https://api.xiaomimimo.com/v1/chat/completions
Anthropic 风格:https://api.xiaomimimo.com/anthropic

头部用 api-key: $MIMO_API_KEYAuthorization: Bearer ...

③ Python(OpenAI SDK)

from openai import OpenAI
client = OpenAI(api_key="MIMO_API_KEY", base_url="https://api.xiaomimimo.com/v1")
resp = client.chat.completions.create(
    model="mimo-v2.5-pro",          # 或 mimo-v2-flash / mimo-7b-rl / mimo-vl-7b-rl
    messages=[{"role":"user","content":"用 Python 写个带缓存的斐波那契"}],
    max_tokens=1024, temperature=0.6, stream=True
)
for c in resp: print(c.choices[0].delta.content or "", end="")

④ 工具调用 / 思考模式(V2.5 起支持返回 reasoning_content + tool_calls,多轮需保留历史 reasoning)

curl https://api.xiaomimimo.com/v1/chat/completions \
 -H "api-key: $MIMO_API_KEY" -H "Content-Type: application/json" -d '{
  "model":"mimo-v2.5-pro","stream":false,
  "messages":[{"role":"user","content":"河北现在天气怎么样?"}],
  "tools":[{"type":"function","function":{"name":"get_current_weather",
    "parameters":{"type":"object","properties":{"location":{"type":"string"}},"required":["location"]}}}],
  "tool_choice":"auto"}'

⑤ 当前主力模型名

  • mimo-7b-rl:边缘/端侧、离线、低延迟首选

  • mimo-v2-flash:309B MoE,长上下文+高吞吐代码/Agent

  • mimo-v2.5-pro / mimo-v2.5-omni:1M 上下文、全模态、复杂多步任务(API 约 $1/M input token,闭源旗舰 1/5 价)

路径 C:本地部署(完全开源权重)

显存参考:MiMo-7B FP16 ≈ 14–16G;INT4/GGUF(Q4_K_M) ≈ 4–6G(RTX 4060 8G 可跑 64K ctx)

① Transformers(最简)

from transformers import AutoModelForCausalLM, AutoTokenizer
mid = "XiaomiMiMo/MiMo-7B-RL"
model = AutoModelForCausalLM.from_pretrained(mid, trust_remote_code=True)
tok = AutoTokenizer.from_pretrained(mid)
print(tok.decode(model.generate(**tok("今天", return_tensors="pt"), max_new_tokens=100)[0]))

② vLLM(推荐,支持 MTP 推测解码)

vllm serve XiaomiMiMo/MiMo-7B-RL --trust-remote-code
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" \
 -d '{"model":"XiaomiMiMo/MiMo-7B-RL","messages":[{"role":"user","content":"1+1=?"}]}'

③ SGLang(多模态 / VL 推荐)

python3 -m sglang.launch_server --model-path XiaomiMiMo/MiMo-VL-7B-RL \
  --host 0.0.0.0 --port 30000 --trust-remote-code

④ Ollama / llama.cpp(消费级显卡)

ollama run hf.co/jedisct1/MiMo-7B-RL-GGUF
# 或 llama.cpp: llama-server -hf XiaomiMiMo/MiMo-V2-Flash-GGUF:Q4_K_M

相关工具推荐