9 月 22 日,小米 MiMo 团队发布并开源 MiMo-V2.6 系列,包括旗舰模型 MiMo-V2.6-Pro 和侧重效率与成本的 MiMo-V2.6-Flash。与此同时,小米还推出了面向低延迟场景的 MiMo-V2.6-Pro-UltraSpeed,官方称其在保持相同模型质量的情况下,输出速度最高可达到标准 Pro 版本的 20 倍。

小米新发系列旗舰模型
与单纯扩大模型参数不同,MiMo-V2.6 此次强调的是强化学习阶段的计算扩展。小米将其描述为探索 RSI(Recursive Self-Improvement,递归自我改进)路径的一次尝试:在编程、通用智能体、视觉任务和网络安全等具有可验证结果的复杂环境中增加强化学习投入,让模型通过反复探索、环境反馈和结果评估改善任务完成能力。

不过,从目前披露的信息来看,MiMo-V2.6 所体现的“自我改进”,主要发生在由训练系统、任务环境和评估器共同组成的强化学习闭环中,尚不意味着模型已经能够脱离人类设计的训练框架,自主修改自身架构或启动下一轮训练。
据介绍,MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 均采用稀疏混合专家架构,并原生支持文本、图像、视频和音频输入,最长上下文窗口为 100 万 Token。
其中,MiMo-V2.6-Pro 拥有 1.02 万亿总参数,每次推理激活约 420 亿参数;MiMo-V2.6-Flash 总参数为 3090 亿,激活参数约为 150 亿。两款模型使用相同的视觉和音频编码器,并配置五层多 Token 预测模块,用于推测式解码。

从定位上看,Pro 面向复杂编程、长程智能体和研究任务,Flash 则试图以更少的激活参数降低推理成本。两款模型的权重已在 Hugging Face 上以 MIT 许可证发布。
MiMo-V2.6 系列还包含一款由 Qwen 架构蒸馏而来的 90 亿参数模型,但小米此次的主要产品仍是 Pro 和 Flash 两个版本。Hugging Face 的模型集合目前共收录三款 MiMo-V2.6 模型。
模型发布后,小米大模型负责人、前 DeepSeek 研究员罗福莉在 x 上发帖将 MiMo-V2.6 的研发过程概括为“一条艰难的强化学习扩展之路”。
她表示,按计算投入衡量,MiMo-V2.6“很可能是迄今开源模型团队开展的最大规模单次强化学习训练之一”。在算力资源仍然非常紧张的情况下,小米依然选择投入数十人的团队,集中完成这一次大规模 RL 训练。

Benchmark 表现如何?
那么,这系列模型的基准测试表现怎样?
根据小米公布的测试结果,MiMo-V2.6-Pro 在 DeepSWE v1.1 上取得 71.9 分,明显高于上一代 MiMo-V2.5-Pro 的 19 分;Flash 为 67.9 分。在 Terminal Bench 2.1 上,两款模型分别为 89.9 分和 87.6 分。

通用智能体测试中,Pro 在 AutomationBench v1.0.6 上获得 53.1 分,高于对比表中的 Claude Opus 5、GPT-5.6 Sol 和 Claude Fable 5;Flash 为 52.3 分。在 OSWorld-Verified 上,两款模型分别取得 82 分和 80.8 分。
但这些结果也显示,MiMo-V2.6 并未在所有项目上领先。Pro 在 ProgramBench 上取得 26.5 分,低于 Claude Opus 5 的 37 分;Terminal Bench 4.0 得分 34.9,低于 Claude Opus 5 的 49 分。在 Toolathlon-Verified、GDPval-AA 2.1 等测试中,Pro 也不是最高得分模型。
小米还引用 Artificial Analysis Intelligence Index v4.3 的结果称,MiMo-V2.6-Pro 得分为 46.32,并将其描述为当前得分最高的开源模型。

此次发布,MiMo-V2.6 值得关注的一个点是,小米开始尝试把编程能力扩展到更广泛的生产任务。
基准测试结果看起来很强大,实际应用效果如何?小米给我了几组官方案例。
在官方展示的案例中,模型可以根据文本、图片或视频描述,将游戏开发任务拆解给多个智能体,分别完成 3D 场景构建、交互逻辑编写和视觉验证,并根据渲染结果反复修改。小米将这种由自然语言驱动、从软件开发延伸至交互式世界构建的方式称为“Vibe World”。
在 3D 建模场景中,模型可以控制 Blender,根据文字或参考图片生成物体和场景;再比如在具身仿真环境中,模型可以读取多路摄像头画面,通过视觉反馈控制 Franka Panda 机械臂,完成抓取、颜色匹配和物体放置。
MiMo-V2.6 还展示了前端页面、演示文稿、视频剪辑和音乐创作能力。
例如,MiMo-V2.6 可提供端到端的高质量视频创作服务。对于创意和产品宣传视频,它可以根据用户需求处理视觉设计、镜头和动态序列、音乐创作以及节拍同步剪辑。对于教育视频,它可以将傅里叶分解等抽象概念转化为通俗易懂的解释和连贯的动画,并利用 MiMo-V2.5-TTS 生成与画面精准同步的旁白。这实现了从概念分解到最终视频输出的全流程自动化,将复杂的知识转化为观众易于理解的生动内容。
这些案例反映出 MiMo-V2.6 的目标不只是生成代码,而是让代码、视觉理解、工具调用和计算机操作共同服务于一个完整任务。
此外,小米还公布了两个科研案例。
第一个案例涉及材料研究。小米材料专家要求 MiMo-V2.6-Pro 设计一种能够吸附全氟和多氟烷基物质的金属有机框架材料。模型完成了文献及专利检索、假设提出、创新性分析,并调用开源计算工具开展模拟,计算不同材料与目标物质之间的结合强度,筛选进入湿实验阶段的候选结构。
第二个案例是形式化数学证明。在研究人员设计的探索策略和多智能体协作流程下,MiMo-V2.6-Pro 参与完成了经典论文《周期三意味着混沌》主要定理的 Lean 4 形式化。最终项目包含超过 6000 行 Lean 代码,并通过 Lean 内核验证,没有保留未完成的证明占位符。
但需要注意的是,这些工作均不是模型独立完成:材料案例由专业人员经过多轮提示和筛选推进,数学案例同样依赖研究人员设计探索策略,并进行了后续修订与整合。因此,从这个角度来看,它们更能说明模型作为科研辅助工具的潜力,而不是证明模型已经具备自主开展科研的能力。
6 天完成约 150 万条轨迹, 强化学习成本超过 340 万美元
MiMo-V2.6 最值得关注的变化并不是参数规模,而是强化学习训练方式。
有意思的是,在正式发布 MiMo-V2.6 之前,小米 MiMo 团队曾将这轮强化学习的生产训练过程公开直播,对外展示两款模型的训练进度、任务得分和资源消耗。
与发布模型后再披露结果不同,这次直播把一场持续近 6 天的大规模 RL 训练直接摆到外界面前:模型是否持续提升、训练中途是否出现波动,以及算力投入能否换来能力增长,都可以从实时曲线中观察。如今随着模型与技术报告发布,这场直播背后的训练规模和技术细节也进一步浮出水面。
小米披露,MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 分别在不到 6 天的时间内完成 30 个强化学习步骤,每款模型处理约 75 万条轨迹。

Flash 的训练成本约为 85 万美元,Pro 约为 262 万美元,合计约 347 万美元。
其单步训练批次包含 1568 个提示,每个提示生成 16 条轨迹,单步处理约 35 亿至 37 亿 Token,训练上下文最高达到 100 万 Token。
与分别针对编程、视觉或智能体进行独立强化学习不同,小米将编程、通用智能体、视觉和网络安全任务混合在同一轮训练中,希望不同任务中形成的策略能够互相迁移。
在奖励环节,MiMo 团队没有仅使用“通过或失败”的二元信号,而是引入组内比较机制:评估智能体对同一道任务产生的多条轨迹进行横向比较,为已经完成任务的方案进一步区分质量,并将更高奖励分配给路径更短、Token 消耗更少或执行质量更高的结果。
这套方法的直接目的,是解决长程智能体训练中的一个问题:两条轨迹可能都通过测试,但它们在执行效率、步骤合理性和稳定性方面存在明显差异,仅靠最终测试结果无法体现这种差别。
为了控制奖励作弊,小米称其在训练中加入了环境加固、异常检测、对抗性评估及不同验证器之间的交叉检查,并冻结了 MoE 模型的路由器,以减少大规模强化学习过程中专家选择策略发生漂移。
按照官方公布的训练曲线,经过 30 步强化学习后,Flash 和 Pro 在训练任务上的平均通过率分别相对提高约 25%和 12%。
在未直接用于训练的长程软件工程测试 DeepSWE v1.1 上,两款模型分别从 48.8 分和 58.4 分提升到 65.68 分和 72.57 分。
小米据此认为,强化学习带来的提升能够部分迁移到训练分布之外。

小米同时开放了技术报告、训练环境和强化学习代码。相比只发布最终权重,这使外界有机会进一步检查其任务设置、奖励设计与训练过程,但相关结果能否被独立复现,仍有待开发者和研究机构后续验证。
MiMo-V2.6 提升如此快,技术上如何实现的?
从技术报告看,MiMo-V2.6 的性能并不是由某个单点创新带来的,是模型架构、预训练、中期训练、强化学习规模、奖励设计和训练基础设施共同作用的结果。
其中最关键的变化,是小米不再只把计算资源用于增加预训练数据和模型参数,而是将大量算力投入模型与真实任务环境的交互,让模型在一次次执行、验证和纠错中学习如何完成长程任务。
简单来说,MiMo-V2.6 的路线可以概括为:先用大规模预训练建立知识和多模态理解能力,再通过面向智能体的中期训练扩展模型的“探索空间”,最后在可验证的复杂任务上大规模生成轨迹,利用更精细的奖励机制筛选出更好的解决路径。
第一层:混合注意力与稀疏 MoE 兼顾规模和长上下文
MiMo-V2.6-Pro 采用稀疏混合专家架构,总参数为 1.02 万亿,每次推理激活约 420 亿参数。
Flash 总参数约 3100 亿,激活约 150 亿参数。两款模型每层只激活 8 个专家,由此在扩大模型容量的同时,避免让全部参数参与每一次计算。
模型主干采用“滑动窗口注意力+全局注意力”交替排列的混合架构。滑动窗口注意力只处理附近 Token,将计算开销控制在较低水平;周期性插入的全局注意力,则负责重新汇总长距离信息。
这种设计针对的是长程智能体任务中的现实矛盾:模型需要读取代码库、工具返回结果、历史操作和多轮上下文,但如果每一层都对全部 Token 执行全局注意力,100 万 Token 上下文的计算和显存成本会非常高。

MiMo-V2.6-Pro 共包含 70 层,其中 60 层使用滑动窗口注意力,10 层使用全局注意力;Flash 共 48 层,其中 39 层为滑动窗口注意力、9 层为全局注意力。其滑动窗口大小为 128 个 Token。
这使模型可以用大量局部计算处理细节,再由少数全局注意力层完成跨区域信息交换。它并不会消除长上下文的计算成本,但相比全程使用全局注意力,更适合处理代码仓库和长时间智能体轨迹。
视觉编码器也采用了类似思路。MiMo-ViT 在局部滑动窗口层中交替使用行优先和列优先的 Token 排列,让视觉信息能够分别沿水平和垂直方向传播,再通过周期性的全局注意力聚合完整画面。官方称,该视觉编码器使用超过 4 万亿个图像 Token 预训练。
音频部分则先把音频转换成离散 Token,再把连续四帧合并成一个音频 Patch,将输入主模型的音频序列频率从每秒 25 个降至 6.25 个,以缩短序列长度。
因此,所谓“原生全模态”并不是简单地把多个独立模型串联起来,而是将文字、图像、视频和音频编码为统一序列,交给同一套语言模型主干处理。MiMo-V2.6 的模型卡显示,两款模型均支持四种模态及 100 万 Token 上下文。
第二层:预训练之后,先进行一次面向智能体的“中期训练”
技术报告披露,MiMo-V2.6 采用两阶段预训练。
第一阶段只训练语言模型主干,数据包括公开网页、书籍、学术论文、代码和 STEM 材料;第二阶段接入视觉与音频编码器,在图文、OCR、GUI、视频、视觉编程、语音识别和音频描述等数据上联合训练。
MiMo-V2.6-Flash 的预训练数据量为 48 万亿 Token,其中纯文本阶段 26 万亿 Token,全模态阶段 22 万亿 Token;Pro 共训练 30 万亿 Token,其中 270 亿——更准确地说是 27 万亿——来自文本阶段,3 万亿来自全模态阶段。
预训练时,模型上下文窗口从 3.2 万 Token 逐步扩展到 25.6 万 Token。此后,小米的做法是增加了一个面向智能体的中期训练阶段。
这一阶段的数据不仅包括高质量文本、代码、图像和音视频,也包括编程、通用智能体、视觉与科研场景中的真实任务轨迹。模型先在 25.6 万 Token 上下文上训练,最后再扩展至 100 万 Token。
技术报告对这一步的解释是:预训练提供知识,中期训练则在预训练与大规模强化学习之间建立桥梁,让模型提前接触“观察环境—调用工具—读取结果—继续行动”的任务形式。
如果没有这一阶段,模型虽然可能掌握大量知识,却未必能够在强化学习开始时有效探索。大量轨迹可能消耗在格式错误、工具调用失败或者无法维持长程上下文等基础问题上。
小米还在中期训练阶段将部分参数的优化器从 AdamW 切换到 Muown。传统 AdamW 按参数元素调整更新幅度;Muown 则利用权重矩阵的结构,对更新矩阵进行正交化处理。小米认为,在超大批次训练中,这种方式能够维持更好的数据效率。

模型同时接受 MXFP4 量化感知训练,使其在训练期间提前适应低精度计算,为后续 FP4 推理减少质量损失。
第三层:一次强化学习生成 2.5 万条轨迹
MiMo-V2.6 性能提升最直接的来源,是强化学习规模的大幅扩张。
小米在每个强化学习步骤中抽取 1568 个任务,每个任务生成 16 种候选解法,也就是一次产生约 2.5 万条智能体轨迹。这些轨迹合计包含 27 亿至 37 亿个训练 Token,平均每条约 11 万至 15 万个 Token。
这和普通问答式强化学习存在明显区别。MiMo-V2.6 面对的不是一道题、一段回答,是持续数十步甚至更长的智能体任务。一条轨迹可能包括:
• 阅读代码仓库;
• 检索相关文件;
• 修改代码;
• 运行测试;
• 根据报错继续修改;
• 调用外部工具;
• 最终提交结果。
MiMo-V2.6-Pro 和 Flash 均完成 30 个强化学习步骤,分别处理约 75 万条轨迹。Pro 的强化学习成本约为 260 万美元,Flash 约为 90 万美元。

在 Pro 的强化学习支出中,约 43.8%用于模型生成轨迹,43.5%用于参数训练,还有 12.7%用于评估器。换句话说,小米投入的计算资源不只是让模型“多做题”,还用于判断不同答案究竟好在哪里。
根据报告,在这轮强化学习中,Pro 在 DeepSWE v1.1 上的平均成绩由 58.4 分提升至 72.6 分,Flash 由 48.7 分提升至 65.7 分。性能随着累计强化学习投入总体上升,但训练过程中也存在波动。
这组数据支持“增加 RL 计算可以继续释放模型潜力”的判断,但还不能证明性能会随投入无限增长。报告只展示了 30 步训练范围内的变化,没有给出继续扩大至数倍计算量后的收益曲线。
第四层:不再只判断“做对没有”,还要判断“做得好不好”
传统代码强化学习经常使用二元奖励:测试通过记为 1,失败记为 0。
这种方式容易规模化,但存在一个问题:两份代码都通过了测试,不代表它们的质量相同。一份可能只修改必要代码,另一份可能加入大量无关逻辑;一份真正定位了问题,另一份可能通过硬编码或利用测试漏洞获得正确结果。
MiMo-V2.6 引入了两套组内智能体评估机制。

第一套是 Groupwise Reward Synthesis,即组内奖励合成。小米先针对同一任务生成多种解决方案,让评估智能体比较这些方案,并建立两类评分标准:
• 解决方案标准:是否完整满足需求、是否覆盖边界情况、代码修改是否符合原有项目结构;
• 行为标准:模型是否收集了必要证据、是否检查代码改动、是否验证最终结果。
训练时,测试结果、解决方案质量和执行行为三部分相乘。未通过测试的轨迹仍然得不到奖励;通过测试的轨迹则根据实现质量进一步区分。
第二套是 Groupwise Advantage Redistribution,即组内优势重分配。对于同一任务产生的 16 条轨迹,评估器会把成功和失败方案放在一起比较,并从解决思路、实现完整性、修改范围、副作用和代码规范等维度对通过测试的方案排序。
随后,训练系统会从质量较低的正确答案中移走一部分正向奖励,重新分配给质量更高的方案。
它解决的不是“模型能否得到正确答案”,而是“模型能否用更稳定、更简洁、更符合工程规范的方式得到答案”。技术报告显示,加入在线组内评估后,模型在 DeepSWE 上的通过率能够继续增长;缺少这套机制时,后期提升更容易趋于停滞。
第五层:同时训练多个领域和多套 Agent 框架
MiMo-V2.6 没有为代码、视觉和工具调用分别执行独立强化学习,而是在同一次训练中混合多类任务。
其强化学习数据大致由以下部分构成:
• 智能体编程和竞技编程:68%;
• 通用工具调用:12%;
• 视觉与审美设计:13%;
• 上下文遵循:3%;
• 网络安全:4%。
代码任务又同时运行在多种 Agent Harness 上。Harness 可以理解为包裹模型的执行框架,它决定模型能使用哪些工具、如何获得上下文、怎样编辑文件以及如何提交结果。
如果训练始终使用同一套框架,模型可能学会适应该框架的提示词和工具习惯,却无法迁移至其他 Agent 产品。为减少这类过拟合,小米在训练中使用四套轻量级 Harness,并在 Codex、Claude Code 和 mini-swe-agent 三套未参加训练的 Harness 上测试。
报告显示,三套留出框架的 DeepSWE 平均 Pass@1 从约 50%提高到 66%,说明模型学到的部分能力能够跨 Harness 迁移,而不只是记住某一种执行流程。
这也是多任务强化学习的一个重要作用:模型需要学习更通用的任务分解、工具选择和错误恢复策略,而不是依赖固定的提示模板。
第六层:冻结 MoE 路由器,避免专家系统在强化学习中失衡
大规模 MoE 模型进行强化学习时,还会遇到一个容易被忽视的问题:专家负载可能逐渐失衡。
如果路由器继续参与训练,模型可能越来越频繁地把 Token 分给少数专家,导致部分专家过载,另一些专家几乎不再被调用。这样不仅影响模型能力,也会造成通信和显存瓶颈。
小米发现,在允许路由器更新的实验中,专家负载的变异系数从 0.78 升至 2.0,负载最高的专家从平均值的 6 倍升至 16 倍,低负载专家占比则由 0.5%增加到 22%。
研究人员随后恢复了训练前的路由参数,专家负载立即恢复,但模型测试成绩基本不变。这说明问题主要来自路由器漂移,而不是专家权重本身退化。
因此,小米在正式强化学习中冻结了 MoE 路由器,只训练其他参数。冻结后,专家负载指标基本保持稳定,而模型能力仍然继续上升。
这一设计本身不会直接提高基准成绩,但它保证了 1.02 万亿参数模型能够在大规模强化学习中稳定训练,是性能提升能够持续发生的基础条件。
第七层:用 MOPD²补齐难以验证的开放任务
编程任务之所以适合强化学习,是因为代码能否通过测试相对容易验证。但游戏开发、科学研究、具身智能和开放式设计很难找到一个可靠的二元评估器。
MiMo-V2.6 在混合强化学习之后,又使用了 MOPD²,即多前缀、多教师在策略蒸馏。
它首先训练多个领域教师模型,再让学生模型从教师轨迹或高质量示范中的不同中间节点继续生成。教师模型不要求学生从头复制整条轨迹,而是在每个关键决策点,对学生新生成的下一步提供 Token 级监督。
这样做有两个好处:
一是可以把不同领域教师的能力汇总到同一个模型中;二是避免每次都从头重新执行漫长轨迹,降低蒸馏成本。
对于缺乏可靠奖励的开放任务,小米先利用高质量合成数据训练监督微调教师,再从这些示范轨迹的中间状态启动学生模型。这让强化学习获得的代码和智能体能力,可以进一步扩展到游戏开发、科研及具身智能等场景。
目前,MiMo-V2.6-Pro 和 Flash 已接入小米 AI Studio、MiMo Code、MiMo Desktop、MiMo API 平台和 OpenRouter。其中,MiMo Desktop 此次结束早期测试,推出首个正式版本。
小米表示,Pro 和 Flash 的 API 价格维持 V2.5 系列的标准。按每百万 Token 计算:

UltraSpeed 的输入和输出单价均为普通 Pro 版本的 10 倍,换取最高 20 倍的输出速度。由此看,这一版本主要面向实时交互、编程辅助或其他对响应延迟敏感的工作流,而非以最低 Token 成本为目标的大规模离线任务。
实测:很惊艳,但也有幻觉
模型发布后,为了进一步了解 MiMo-V2.6 Pro 的实际表现,AI 前线对模型进行了一轮多模态测试,分别考察其图像识别与 OCR、视频时序理解、音频转写与全模态长任务等能力。
测试不仅关注模型能否识别和概括内容,也重点观察其能否在不同模态之间建立对应关系、准确定位信息来源、识别材料冲突,并在证据不足时避免自行补全或给出过度确定的结论。
测试一:图片理解:OCR、空间关系与细节推理
为了测试模型的图片理解能力,AI 前线上传了一张信息密度较高的真实图片,这是前阵子在蚂蚁外滩大会现场拍摄的一位 keynote 演讲嘉宾的 PPT 照片。

然后给出的提示词如下:
请分析这张图片,完成以下任务:
1、准确提取图片中的标题、关键数字、单位和注释;
2、描述主要元素之间的空间位置和对应关系;
3、总结这张图试图表达的核心结论;
4、指出至少两处容易被误读的细节;
我们想重点观察是否抄错数字、单位和模型名称;能否理解图例与曲线的对应关系;是否把推测写成事实。
输出结果如下:
1. 标题、关键数字、单位和注释
• 主标题:“为什么 AI 还没有 1000 倍的加速科学发现?”
• 副标题(核心论点):科学发现的瓶颈,在于验证(Verification),在于可追溯(Traceability),可重复(Reproducibility)
• 会议标识:inclusion CONFERENCE ON THE BUND 外滩大会
• 左侧栏目标题:大量科学实验不可重复、无法追溯、难以验证,下方引述“Nature 调查显示”,列出三条:70%的科学实验无法重现;50%的实验结果连作者本人都无法重现;当验证变成摇骰子,寻找新发现就变成了盲人摸象
• 右侧图表标题:HAVE YOU FAILED TO REPRODUCE AN EXPERIMENT?(你是否未能复现某个实验?)
• 图表注释:Most scientists have experienced failure to reproduce results.(大多数科学家都经历过无法复现结果的情况)
• 图例:Someone else's(他人实验)、My own(自己的实验)
• 关键数字与单位:70%、50%、1000 倍;图表横轴单位为百分比(0—100%,刻度间隔 20%)
• 图表各学科条形数值:内容中未标注精确数值,只能从坐标轴目测估算,见下方表格(标注为约值)。
2.主要元素的空间位置与对应关系
• 画面顶部为会议名称标识(右上角为 inclusion 外滩大会 Logo),主标题横贯上部,副标题紧随其下,起到统领全图的作用。
• 画面左中部为紫色圆角文本框:左上角配有对话气泡图标,框内自上而下依次是结论句、“Nature 调查显示”引语、三条要点,是对副标题"验证/可追溯/可重复瓶颈的论据支撑。
• 画面右中部为横向条形图,与左侧文本框左右并列,二者是“文字论点(左)+数据证据(右)”的对应关系:左框中的“70%”“50%”与右侧图表同属实验不可复现这一主题,图表按学科细分佐证左侧总括性结论。
• 图表内部:纵向为学科类别(Chemistry、Biology、Physics and engineering、Medicine、Earth and environment、Other),每个学科对应两根条形(红色=Someone else's,浅红=My own),横轴为百分比。
• 画面左下角为演讲者,底部为听众席剪影,属于现场场景元素,与图表内容无数据对应关系。
3.核心结论
这张图试图表达:AI 尚未带来“1000 倍”的科学发现加速,瓶颈不在提出想法,而在于验证(Verification)、可追溯(Traceability)、可重复(Reproducibility)——大量科学实验不可重复、无法追溯、难以验证。据 Nature 调查,70%的科学实验无法重现,50%的实验结果连作者本人都无法重现;正如图中所言,“当验证变成摇骰子,寻找新发现就变成了盲人摸象”,各学科科学家普遍遭遇过实验无法复现的情形。
4. 容易被误读的细节(至少两处)
第一处,统计口径易混淆:左侧的“70%”“50%”说的是实验无法重现的比例;而右侧图表的百分比是 科学家(受访者)中经历过复现失败的人的比例(“HAVE YOU FAILED TO REPRODUCE AN EXPERIMENT?”)。两组数字单位含义不同,不能互相换算或混读。
第二处,两根条形的含义易读反:红色较长的条是 Someone else's(复现他人实验失败),浅红色较短的是 My own(复现自己实验失败),不能误读为“成功率”或“实验质量评分”;浅红条也不代表“自己实验的失败率”,而是“自己未能复现自己实验的科学家占比”。
第三处,图表数值无精确标注:图中条形未标数字,任何具体百分比都只是目测估算,不能当作精确数据引用。
第四处,“1000 倍”是设问而非结论:标题中的“1000 倍”出现在疑问句中,图中并未给出 AI 实际加速倍数的数据,不可读作“AI 已加速 1000 倍”或任何具体加速数值。
综合模型的以上输出,AI 前线认为,模型整体表现不错,属于“能够直接辅助处理图片材料”的水平。模型不仅完成了 OCR,还正确理解了图表、文字与演讲现场之间的关系,没有出现明显幻觉。
测试二:视频理解:时间顺序与因果关系
这道题希望测试下模型的视频理解、时间定位、动作追踪、事件顺序和因果推理方面的表现。
AI 前线上传了一段 7 月份在上海 WAIC 期间拍摄的 30 秒左右的视频。
给出的提示词如下:
请完整观看这段机器人做饭的视频,并完成以下任务:
1、列出机器人使用的食材、厨具和设备,并说明它们分别在什么环节被使用;
2、找出至少两个体现机器人操作能力的细节,例如抓取精度、力度控制、双臂协同、工具使用或对环境变化的响应;
3、判断视频中是否出现操作失误、停顿、重复动作的情况,并提供时间戳和画面证据;
用 150 字以内总结机器人最终做了什么、完成度如何。
输出结果如下:
1. 食材、厨具与设备及其使用环节
• 食材:锅中的虾(橙红色,约数十只)——全程处于翻炒环节;旁白提到“东方美食”,但未指明具体菜名与调味料种类,具体调料内容中未提及相关信息。
• 厨具/设备:
• 炒锅(黑色平底锅):置于电磁灶上,承载食材翻炒;
• 锅铲(浅色硅胶铲,左手持):翻炒、拨动虾的主要工具;
• 调料/油瓶(右手持的透明尖嘴瓶):在翻炒过程中向锅内倾倒液体(油或调味液);
• 电磁灶(黑色灶台,对应展板"全域精准控温"):加热控温;
• 金属圆罐(台面左侧):旁置容器,视频中未展示其被使用的明确环节;
• 白色圆盘(台面右侧):备用于装盘环节;
• 刀架与刀具(右后方)、绿色抹布(左侧):环境配置,视频中未见被机器人使用。
2. 体现操作能力的细节(两处以上)
• 双臂协同:左手持锅铲翻炒的同时,右手持瓶向锅中倾倒液体调味,两臂并行作业、互不干扰(约 00:02–00:06)。
• 工具使用与抓取稳定:机器人能分别稳定握持锅铲与尖嘴瓶两种不同形状的工具,并完成"倾倒—回正—继续翻炒"的工具切换动作(00:02–00:15)。
• 力度与轨迹控制:翻炒动作幅度小而连续,锅内虾始终留在锅中,未见食材飞溅或锅具位移(全片)。
3. 操作失误、停顿与重复动作判断
• 明显失误:未观察到掉落工具、打翻容器等失误。
• 重复动作:翻炒动作为规律性往复重复(如 00:07–00:13 连续多次铲动虾),属于烹饪本身的正常往复,未见无意义的机械重复或卡顿。
• 停顿:00:00–00:02 起始阶段动作略有起步停顿,随后即连续作业;其余时间未见明显中途停滞。画面证据:各时间段手臂均处于运动轨迹中,锅铲持续与锅内食材接触。
总结(150 字以内)
视频中,双臂烹饪机器人在电磁灶上用锅铲翻炒锅中的虾,右手持瓶加入油与调味液,双手协同完成调味与翻炒,动作连贯平稳、无明显失误,基本完成炒虾菜肴的烹制至装盘前环节,完成度较高;旁白同时介绍了其构建"智慧食安生态"、融合科技与东方美食的产品理念。
第二轮测试中,我们向 MiMo-V2.6-Pro 提供了一段约 22 秒的机器人炒菜视频,考察其动作识别、时间定位、物体追踪和异常判断能力。
模型准确识别出机器人正在用锅铲翻炒虾,并辨认出炒锅、电磁灶、餐盘和抹布等场景元素,也没有把正常的往复翻炒误判为机械卡顿。但在关键动作上,它出现了明显幻觉:视频中的透明尖嘴瓶始终放在台面上,模型却称机器人右手持瓶向锅中加入调味液,并进一步虚构了“倾倒—回正—继续翻炒”的动作及时间戳。
此外,模型没有按要求区分可确认事实与合理推断,也没有完成食材状态追踪和自主性判断。
相比静态图片,MiMo-V2.6-Pro 在连续视频中的物体追踪和时序理解仍不够稳定,尤其容易把场景中“存在的物品”误写成“被执行的动作”。
测试三:跨模态信息对齐与核验能力
为了测试模型的跨模态信息对齐与核验能力,我们向模型输入了一段带有现场解说的篮球比赛现场视频,要求模型同时读取比赛画面、解说音频和屏幕比分,判断三类信息是否指向同一结果,并识别其中可能存在的时间差或矛盾。
给出的提示词如下:
请同时核对视频中的比赛画面、解说音频和屏幕比分信息,回答以下问题:
1、哪支球队完成了投篮,投进了几分?
2、投篮前后的比分分别是多少?
3、解说内容、画面结果和比分变化是否一致?
4、如果三者存在冲突,请指出具体冲突及时间点;如果一致,也请说明证据。
请区分“可以直接确认的事实”和“无法确认的信息”,不要根据常识或外部资料补充球员身份。
输出结果如下:
1、哪支球队完成了投篮,投进了几分?
• 可以直接确认的事实:完成投篮的是达拉斯队(DAL,绿色/黄色球衣方),投进了 3 分(三分线外出手命中,屏幕比分为 81→84 增加 3 分;解说也说 “knocks down the three”)。
• 无法确认的信息:出手球员的姓名、号码等身份信息无法仅凭内容确认(解说称其为 “Bueckers”,但这属于解说音频中的称呼,内容中未提供球衣号码等画面佐证的对应关系)。
2、投篮前后的比分分别是多少?
• 可以直接确认的事实:投篮前 DAL 81 — 81 PHX(第四节,时间约 42.0 秒至 32.6 秒区间);投篮命中后 DAL 84 — 81 PHX(屏幕显示 32.6 秒时为 84-81,DAL 领先 3 分)。
3、解说内容、画面结果和比分变化是否一致?
一致,三者互相印证:见下方证据。
4、一致性证据(无冲突)
• 画面:球从三分线外出手入框(约 00:10–00:12),随后达拉斯替补席欢庆、观众鼓掌。
• 解说:解说在球进后说 “Bueckers... knocks down the three”(命中三分),之后又提到 “Fourth 30-point game for Bueckers”。
• 比分牌:比分由 81-81 变为 84-81,变化值恰为 3 分,与"三分球命中"的画面和解说一致;时间由约 42.0 秒走至 32.6 秒,与进攻推进过程吻合。
补充说明(无法确认的信息)
• 比分牌上的罚球数据(DAL 12-19,63%;PHX 24-28,85%)在本次进攻前后未发生变化,与本次三分球无关,内容中未提及其对本次进攻的影响。
• 该球员本场得分是否确为 30 分,仅有解说表述("Fourth 30-point game"),屏幕未显示球员个人数据,无法从画面直接确认。
结论:这轮跨模态测试表现较好,基本可以给 9 分。模型准确将比赛画面、解说中的“knocks down the three”和比分从 81:81 变为 84:81 对应起来,确认达拉斯命中三分。它也注意到球员姓名来自解说,而个人得分没有画面数据佐证,证据边界较清楚。
小问题是将 41.6 秒约写成 42 秒,球衣颜色描述也不够准确。整体看,模型在多重信息相互印证的任务中,比单纯追踪连续动作更稳定。
综合几组测试来看,MiMo-V2.6-Pro 对静态图片的文字识别、图表理解,以及有比分牌和解说相互印证的跨模态核验表现较稳,能够主动区分事实、推断和无法确认的信息;但在连续视频的细粒度动作追踪上仍有明显短板,曾把始终放在桌面的调料瓶误判为机器人拿起并倒入锅中,还为这一不存在的动作生成了时间戳。
由此看,这款模型已经能够“看懂大意”并整合多种模态证据,但面对快速动作、遮挡和物体状态变化时,仍可能一本正经地补全不存在的细节,多模态能力距离稳定可靠还有差距。
参考链接:
https://mimo.xiaomi.com/zh/mimo-v2-6
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
本文来自微信公众号 “AI前线”(ID:ai-front),作者:冬梅,36氪经授权发布。