

小米发布开源大模型MiMo-V2.6-Pro,综合智能指数登顶全球开源榜首,能力大幅提升且调用成本仅为GPT、Claude的1/15至1/10;通过创新强化学习训练方法,在代码生成、工具调用、GUI操作等关键任务上逼近顶级闭源模型;其技术突破不仅强化AI竞争力,更支撑手机、汽车、家居等全生态智能体验升级。
9月22日这天,国内做大模型的一众头部玩家,竟然在同一张榜单上,输给了一个“半路出家”的选手:小米。
当天,小米发布并开源MiMo-V2.6系列,其中的旗舰Pro版在Artificial Analysis综合智能指数中拿下46分,超过GLM-5.3、Qwen3.8 Max等模型,登上全球开源模型榜首。

很多人可能没概念,上一代MiMo-V2.5-Pro在这项指数上只有26分。短短几个月,得分就提高了20分。
与此同时,MiMo-V2.6的价格也低得离谱。按小米公布的测算,在同等智能水平下,其调用价格只有海外同类模型的1/20到1/60。能力提升了,API定价却和上一代保持一致。
但实际上,小米专门组建团队做大模型的时间并不长。2023年4月才组建大模型核心团队,2025年4月才发布首个开源大模型。到这次登顶,距离第一次开源还不到一年半。
大部分人对小米的印象,大概率还停留在手机、汽车,和在发布会上神采飞扬的雷军。
怎么突然之间,小米的大模型就上桌了?
其实所谓的开源第一,还只是小米这次成绩的冰山一角。
先看写代码。按照小米公布的评测结果,在考察多步骤、长流程软件工程能力的DeepSWE v1.1中,MiMo-V2.6-Pro拿到71.9分,GPT-5.6 Sol是73分,Claude Opus 5是74分,三者已经相当接近。
而在让AI调用工具、连续完成任务的项目中,小米也有拿得出手的成绩。在考察跨工具协作的Toolathlon-Verified测试中,它拿到76.9分,高于GPT-5.6 Sol的74.9分;在考察通过图形界面操作电脑的OSWorld-Verified中,小米是82分,GPT-5.6 Sol和Claude Opus 5分别是83分、83.4分。
实际上,这些项目比普通聊天更接近我们对AI的期待:给它一个任务,它得学会自己找到工具、执行操作,最后把事情给干了。在连手机都开始引入Agent的今天,只会“耍耍嘴皮子”,已经很难满足用户的期待。
不过,上面这些具体项目的成绩,来自小米公布的评测。再看第三方机构Artificial Analysis统计的任务成本,反差就更明显了。
在这套智能指数评测里,MiMo-V2.6-Pro的加权平均每任务成本是0.13美元,GPT-5.6 Sol(max)是1.99美元。Claude Opus 5.5采用中等推理档位,对应成本也达到1.34美元,指数得分为51分。
或者可以不绕圈子,直接看一组直观的数字:假设按这套评测的任务构成和平均成本,执行一万次任务,小米对应的费用约为1300美元,而Claude约为13400美元,GPT约为19900美元。
这笔账不能直接当成实际业务的报价,但在这套评测口径下,小米的任务成本,确实只有上述Claude版本的约十分之一、GPT版本的约十五分之一。
所以,把模型的能力和成本放到一起,就不难理解,为什么有媒体把小米MiMo-V2.6称为新一代大模型“斩杀线”。

如果模型的综合成绩比小米低,调用成本却比它高,用户为什么还要选你?想卖得更贵,就得在用户需要的任务上,拿出更好的效果、更快的速度,或者更可靠的交付。
只不过,在过去提到大模型的“斩杀线”,大多数是
而且回头看上一代,在小米公布的同一组对比中,MiMo-V2.5-Pro的DeepSWE成绩只有19分,Toolathlon-Verified为49.1分。仅仅过了一代,前面两个成绩却分别提高到了71.9分和76.9分。
成绩大幅提高,API价格却没涨。这才过了几个月,小米到底是怎么做到的?
小米这次让模型进步的一个关键,是强化学习。
可以把训练大模型理解成培养一个程序员:先通过阅读大量资料和代码,学会基础知识;接下来,让他接手项目进行实习,自己尝试解决问题,再根据实际结果调整做法。
而强化学习就像后面这段实习。模型在实际执行任务的时候,训练系统根据它的表现给予奖励,再通过更新模型,让有效的做法更容易在下一次出现。
不过,实习也得讲方法。总做同一种简单任务,练不出处理复杂问题的能力;交上来的东西没人认真检查,就有可能在错误的路上狂奔。
而小米这次主要改进的,就是练多少、练什么,以及怎么判断练得好不好。
首先,是让模型充分尝试。
按照小米披露的训练配置,一次更新包含1568个任务提示,每个提示生成16条执行轨迹。这就相当于同一个任务,让模型尝试多种做法,把操作过程和结果都记录下来,作为后续训练的材料。
用来训练的这些任务也多种多样。有写代码、调用工具、处理视觉信息、解决网络安全问题等等。最终模型不仅能学会完成不同工作,还可以适应不同的工具和执行环境。
不过要说到训练里更加难的地方,就是怎么判断模型做得好不好。
假设两份方案都完成了任务,第一份用到了十几个步骤,第二份一步到位就做好了;如果评分只分“成功”和“失败”,那更迅速、更高效、一步到位的第二份方案,也只能拿到磨磨唧唧的第一份方案同样的奖励。
这显然没法真正鼓励模型用更高效简洁的方案完成任务。
所以小米的办法是,把同一个任务的多份方案放在一起比较。评判系统结合任务要求制定评价标准,区分这些方案的质量,再把更多奖励分给表现更好的方案。这样,即使都做对了,也能继续分出高下,引导模型减少绕路和不必要的消耗。
这里还得防着模型钻空子:找到一种能拿高分的办法,却没有真正完成任务,那也是万万不可的。小米为此加入了对抗评估、异常检测,以及不同验证器之间的交叉检查,尽量避免模型把“糊弄评分系统”练成了本事。
此前罗福莉团队公开展示的训练过程,就让外界看到了这套方法如何运行。
在不到6天的这一轮强化学习中,Flash和Pro各完成30步更新,每个版本处理约75万条任务执行轨迹。随着训练推进,两个版本在训练任务上的平均通过率,分别相对提升了25%和12%。
不过,也正是这不到6 天的时间里,MiMo-V2.6 Flash和Pro的训练成本分别约85万美元和262万美元,合计约347万美元,平均每天超过58万美元,每小时达到了约3 万美元,也就是约 20 万元人民币。
这轮强化训练的效果,也体现在了“练习册”之外的题目上。在没有用于这轮训练的DeepSWE v1.1软件工程评测中,Flash从48.8分提高到65.68分,Pro从58.4分提高到72.57分。
小米探索的自我改进,就这样形成了一个循环:模型尝试完成任务,评判系统比较方案,再把反馈用于下一轮训练。模型继续进步,新的尝试又能为后续训练提供材料。
这次,小米还把技术报告、训练环境和强化学习代码一并开放。外界除了使用模型,也能进一步研究它是怎么练出来的。
所以,现在的小米有了能竞争的模型,也拿出了自己的训练方法和研究工具。那么现在的小米,到底算不算一家大模型公司?
如果只看小米现在做到的,已经算是一家不折不扣的大模型公司了。但对小米来说,它可能并不满足于做一家大模型公司。
毕竟,小米手里除了模型,还有手机、汽车、智能家居,甚至有自己的玄戒芯片。这些东西如果能和MiMo结合,值得想象的产品,就远远不止一个聊天应用了。
而海外最近大热的Muse,则展示了个人Agent的另一种吸引力。按照Meta的介绍,用户可以让它安排出行、处理邮件、协助购物,它会打开浏览器、填写表单,并在需要授权时回来询问用户。用户关掉应用之后,耗时的任务也能继续执行。
一个把AI放进手机系统,一个让AI持续替用户办事。顺着这两个方向想,小米有没有可能做出一部自己的“MiMo手机”,或者一个原生集成在系统里的“小米版Muse”?
MiMo提供理解需求、调用工具和执行任务的能力,小米可以在自己的系统里设计相应功能,再通过手机让用户用上。自研玄戒芯片,则让它有机会进一步针对端侧AI的算力、功耗和内存需求做优化。从芯片到系统,再到模型和整机,其实现在小米能参与的环节已经相当多了。
而且,小米的想象空间还不止手机。
比如一句“明天带孩子出去玩,别太累”,AI能否结合天气、路程和用户偏好,安排目的地与行程,再把确认好的路线同步给车机?用户不用自己在几个应用之间来回切换,也不用把同样的要求向不同设备再说一遍。
如果这样的体验做得足够好,用户选择小米的理由就又多了一个:小米MiMo。
这时,小米做大模型的价值就不一样了。用户购买AI订阅,可以带来收入;用户因为MiMo好用而购买小米手机、汽车或家电,更是个大好事。
别人做大模型,想让你多买一份订阅;小米做大模型,说不定最后会让你多买了一台冰箱。
参考材料:
小米官方发布MiMo-V2.6 系列开源公告
Artificial Analysis 综合智能指数榜单 v4.3.2
百度百科:MiMo-V2.6 词条
百度百科:小米大模型Core团队词条
凤凰网科技:《小米开源 MiMo-V2.6:从规模扩展走向递归自我改进》
腾讯新闻:《观智潮 | 训练MiMo一小时烧掉20万!小米AI的"明牌"与"暗棋"》
深圳商报·读创客户端:《小米发布新一代MiMo大模型,MiMo-V2.6-Pro首次支持全模态》
新浪新闻:《小米MiMoV2.6与顶级闭源模型差距多大?》
封面新闻:《小米MiMo-V2.6模型登顶AA全球开源榜首》
Hugging Face CEO Clément Delangue 社交媒体评价
21世纪经济报道:《小米大模型登顶开源榜:六天训练花了347万美元》
新智元:《 罗福莉带小米登顶全球开源榜首!大规模RL立功,斩杀Grok 4.7》
量子位:《6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官》
本文来自 “蓝字计划”,作者:黄晓彬