首页 > 资讯 > 开源王座易主?小米罗福莉发新模型:工程难度超DeepSeek-R1

开源王座易主?小米罗福莉发新模型:工程难度超DeepSeek-R1

36氪文章 2026-09-22 20:29 7 阅读 查看原文

智东西9月22日报道,今早,小米大模型团队发布并开源了新一代模型Xiaomi MiMo-V2.6系列,包含两款原生全模态模型MiMo-V2.6-Pro与MiMo-V2.6-Flash,小米还将逐步开放MiMo-V2.6-Pro-UltraSpeed,相比MiMo-V2.6-Pro,同等智力水平输出速度提高20倍。 

▲Xiaomi MiMo-V2.6系列模型官宣(来源:X)

此外,小米还同步开源了用于新模型训练的RL环境和框架以及模型技术报告。 

▲Xiaomi MiMo-V2.6系列模型训练框架(来源:Huggingface)

罗福莉早上发文称,MiMo-V2.6押注大规模RL扩展,进行了开源模型迄今最大规模的单次RL训练,团队将其视为探索RSI(递归自我改进)、通往AGI的新一步,她直言MiMo-V2.6的创新和工程难度已经超过了DeepSeek R1。 

▲罗福莉发文(来源:X)

MiMo-V2.6-Pro在Artificial Analysis智能指数上取得46.32分,超过Kimi K3与Qwen3.8 Max,成为该榜单迄今得分最高的开源模型,不过从得分上看总体与顶尖开源模型差距不大,其得分与刚刚发布的Grok 4.7相当。 

▲MiMo-V2.6-Pro在Artificial Analysis智能指数排名(来源:Artificial Analysis)

在主要测试AI网页开发能力的Code Arena WebDev榜单中,MiMo-V2.6-Pro首测拿下1628分,较上一代MiMo-V2.5-Pro的1475分大涨153分,目前排名全球前十、开源权重模型第三。 

▲MiMo-V2.6-Pro在Code Arena WebDev榜单排名(来源:Arena AI)

价格方面,MiMo-V2.6系列维持V2.5系列的API定价,MiMo-V2.6-Pro输入(缓存命中)0.025元/百万tokens,缓存未命中3元/百万tokens,输出6元/百万tokens;MiMo-V2.6-Flash输入(缓存命中)0.02元/百万tokens,缓存未命中1元/百万tokens,输出2元/百万tokens;MiMo-V2.6-Pro-UltraSpeed定价是MiMo-V2.6-Pro的十倍。 

▲MiMo-V2.6系列模型定价(来源:小米)

有网友晒出MiMo-V2.6-Pro与Grok 4.7的价格对比,同等智力水平下,Grok 4.7的价格大约是MiMo-V2.6-Pro的29倍。 

▲网友评论(来源:X)

Xiaomi MiMo-V2.6系列发布的预热方式也非常有趣,9月17日凌晨,罗福莉在社交媒体上发布了两款模型的训练数据实时看板,全网“直播”了小米MiMo-V2.6的训练细节,两轮训练平均每小时烧掉了3.08w美元。 

▲罗福莉发文直播训练过程(来源:X)

有网友评论称这是有史以来最酷的开源发布之一,不仅直播训练过程,还开源了技术细节,性能超强的同时,定价低到离谱。 

▲网友评论(来源:X)

不过也有开发者对模型能力提出了质疑,认为MiMo-V2.6系列至少Flash模型没有达到预期,在OpenCode中会不断循环执行命令和读取文件,执行能力较差。 

▲网友评论(来源:X)

智东西第一时间在OpenCode中对MiMo-V2.6系列模型进行了实测,从实际效果上看,MiMo-V2.6系列模型的多模态能力和编程水平尚可,但存在长时间思考和查找目录文件等问题。 

01.6天30步75万条轨迹:从Coding到3D、科研,持续探索RL扩展

罗福莉所说的大规模RL扩展,在MiMo-V2.6的技术报告里以一串数字的形式呈现,为其6天的直播训练过程中,MiMo-V2.6-Flash与MiMo-V2.6-Pro各自完成了30步,累计覆盖约75万条轨迹,对应训练成本约85万美元和262万美元。经过这一轮训练,两款模型的训练任务平均通过率分别提升25%和12%。 

在DeepSWE v1.1测试中,Flash从48.8分提升至65.68分,Pro从58.4分提升至72.57分,分别增加约17分和14分。 

在RL训练阶段,MiMo-V2.6投入了大量算力,经过大规模、多任务强化学习训练,MiMo-V2.6-Flash与MiMo-V2.6-Pro在多数Agent Benchmark上取得了接近Claude Opus5和GPT-5.6 Sol的分数。 

训练系统方面,RL算力扩展主要体现在训练规模、任务环境和基础设施三个方面。小米采用全异步架构,单次更新1568个样本,训练最高支持100万token上下文,每个RL step消耗约35亿至37亿token。 

训练任务也不再局限于编程,而是覆盖通用Agent、视觉和Cyber等场景,并混合多种Harness,让不同任务产生的训练信号能够共同作用于模型。 

奖励机制也进行了创新,对于长程RL任务,小米采用组内评分机制,将同一任务下不同轨迹的完成情况和质量放在一起比较,再重新分配奖励信号。这样既能区分“完成了任务”和“高质量完成任务”的差异,也能引导模型减少完成单个任务所需的路径和token。 

随着训练规模扩大,稳定性问题也随之出现,小米冻结了MoE Router,以减少训练过程中的模型漂移;针对Reward hacking,则从奖励设计、对抗评估到验证器交叉校验设置了多层防护。在工程层面,小米还统一了轨迹表示和惩罚机制,并针对不同Agent框架进行高并发交互。 

在训练规模扩大之后,MiMo-V2.6的能力覆盖范围也随之扩展。新一代模型处理的任务已经从编程进一步延伸到3D内容、计算机操作、设计、视频和音乐等场景。 

比如在3D游戏开发任务中,模型可以接收一段视频、一张图片或一句提示词,自行拆解任务,协调多个Agent搭建3D场景、实现交互逻辑,并根据渲染结果进行视觉检查和迭代。 

▲MiMo-V2.6演示案例(来源:小米)

在Blender中,它还可以根据文本描述或参考图片生成3D资产,并进一步将其用于动画、3D打印和游戏开发。 

▲MiMo-V2.6演示案例(来源:小米)

通过Computer Use,MiMo-V2.6可以进入具身仿真环境。模型能够接收多视角相机画面,持续进行推理和决策,再通过视觉反馈控制Franka Panda机械臂,完成物体抓取、颜色匹配和精确放置。 

▲MiMo-V2.6演示案例(来源:小米)

设计类任务也在能力范围之内,MiMo-V2.6可以生成完整的前端界面或演示文稿,其中包含版式结构、组件、交互元素和动效,并能够与Figma以及图像、视频生成工具配合。 

▲MiMo-V2.6演示案例(来源:小米)

MiMo-V2.6系列模型还可以进行视频制作,在小米展示的一支产品宣传片中,从视觉设计、镜头与动效编排,到音乐创作和卡点剪辑,都由模型完成。 

▲MiMo-V2.6演示案例(来源:小米)

音乐是新增的能力,小米方面称,MiMo-V2.6强化了音乐理解、审美判断和乐理运用,并首次探索了作曲任务。 

▲MiMo-V2.6演示案例(来源:小米)

小米方面展示的科研案例进一步展现了通用能力的迁移。小米明确表示,这些科研任务并没有经过专门的科研RL训练,更多依靠模型已有的通用能力完成。 

材料科学方面,小米让MiMo-V2.6-Pro设计一种用于吸附全氟和多氟烷基物质(PFAS)的全新金属有机框架(MOF)。在材料专家的引导下,模型完成网络检索、文献与专利梳理、提出假设和新颖性评估,随后调用开源计算工具搭建仿真环境,计算MOF与PFASs之间的结合强度,最终筛选出三种候选框架,再交由湿实验进一步验证。 

▲MiMo-V2.6演示案例(来源:小米)

数学方向则是对Li与Yorke经典论文《周期三蕴含混沌》中主定理进行Lean 4形式化。研究者设计探索策略后,MiMo-V2.6-Pro通过subagent协作推进定理陈述与证明,最终项目包含6000多行Lean代码,并通过Lean内核完成完整验证,没有留下未完成的证明占位符。 

▲MiMo-V2.6演示案例(来源:小米)

02.赛车游戏开发、小米汽车官网设计,容易长考,爱翻目录

智东西首先测试了一下基础的多模态能力,输入一张Hermes Agent应用的截图,让MiMo-V2.6-Pro不依赖工具进行识别,模型很快完成了读图任务,精准度不错,但速度稍慢。 

同样的提示词,更换了模型和截图,我们让MiMo-V2.6-Flash来执行一下这项任务,能看到MiMo-V2.6-Flash仅用了6秒,但返还的结果在内容丰富程度上比Pro模型差很多。 

首先我们用一个网页开发任务来对MiMo-V2.6-Flash的网络搜索、文件操控和前端设计能力进行测试,让MiMo-V2.6-Flash自行搜索信息并开发一个小米汽车官网的Demo。 

在这项任务中,虽然我们给出的提示词对网页开发的要求非常高,但是MiMo-V2.6-Flash作为Flash级别模型,整体的开发时间还是过长,不过网页开发的质量不错,网页的交互流畅程度以及图片嵌入都不错,比如下面这里演示的预约试驾功能。 

不过美中不足的是,MiMo-V2.6-Flash开发的小米汽车官网,虽然文字部分都是小米汽车的性能参数,搜索并嵌入的图片却是奔驰、宝马、奥迪。 

最后智东西输入了一个经典赛车游戏开发提示词,测试一下MiMo-V2.6-Pro的游戏开发能力,提示词如下: 

MiMo-V2.6-Pro花了64分钟完成了游戏开发任务,开发出的游戏效果存在不少问题,赛道本身不清晰,路径没有严格限制好,初始状态下赛车的建模被埋在了下方,做得比较好的地方是游戏操控感和整体的光影效果。 

此外,在测试MiMo-V2.6-Pro游戏开发能力的时候,智东西还输入了一个3D世界游戏开发的提示词,在没有专业游戏开发工具依赖的情况下,MiMo-V2.6-Pro最终交付的3D世界本身的构建还是不错的,功能、下落的雨丝以及人物动作都比较合理,仅存在雨伞不在手上的小问题。 

整体实测下来,MiMo-V2.6系列模型和上一代给我们的感受差不多——主打性价比。模型基础能力是不错的,只是在思考时间上和执行任务的路线上存在一些问题,整体模型在任务交付效率上稍弱一些。 

当然,智东西所做的实测都是基于OpenCode上所提供的模型进行的,不能代表模型小米官方Agent和API中的实际效果,也不能完全代表模型能力。 

03.结语:小米RSI道路新作,但模型能力仍需更多实测验证

从这次发布来看,MiMo-V2.6把重点放在了大规模RL训练的进一步扩展上:6天完成30个RL step、覆盖约75万条轨迹,训练任务也从Coding延伸到Agent、视觉、3D、Computer Use以及科研任务。 

与此同时,小米将RL训练环境、代码和技术报告一并开源,把训练过程中的基础设施、奖励机制等细节也公开出来。 

从Benchmark到实际测试,MiMo-V2.6展现出了较强的基础能力,但不同任务之间仍存在明显差异。尤其在长程任务中,模型的思考时间、工具调用和执行路径都会直接影响最终交付效率,实测过程中的表现也存在很多问题。 

模型最终能走到什么位置,除了榜单分数,后续实际使用中的任务完成质量和效率同样重要。 

小米希望通过持续扩大RL训练规模探索RSI,这条路线能否进一步提升模型的自主任务能力,还需要后续版本和更多实际任务来验证。 

本文来自微信公众号 “智东西”(ID:zhidxcom),作者:毕伟豪,36氪经授权发布。