header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

小米承认MiMo-V2.6会「原地复读」:RL把坏习惯越训越严重,9万美元修复

动察 Beating AI 快讯,小米 MiMo 团队复盘了 MiMo-V2.6 上线后的工具调用重复问题。模型有时会反复调用相同或高度相似的工具,持续消耗上下文,但任务没有进展。在 OpenCode 中,Flash 和 Pro 出现重复工具调用的回复占比一度分别达到 1.02% 和 0.54%。


问题出在强化学习的奖励设计。训练主要奖励「最后有没有把任务做对」,却没有充分惩罚过程中的低效行为。原来的规则只有单轮工具调用超过 32 次才会处罚,32 次以下的重复调用完全不扣分。随着 RL 规模扩大,这种坏习惯反而被不断强化。小米回放训练 checkpoint 后发现,Flash 中单轮调用超过 10 次的异常样本比例从 step 0 的 11.1% 增至 step 20 的 24.6%。


最直接的办法是把惩罚阈值从 32 次降到 8 次,再重跑约 20 个 MixRL step,但预计要花 231 万美元。小米最终只训练了一个专门纠正重复调用的 RL teacher,跑 12 个 step、约 7000 个样本,再通过 MOPD 把这项能力合回 Pro 和 Flash。整轮修复约花 9 万美元,只有完整重训方案的约 4%,其他主要 benchmark 基本保持不变。


修复后的 MiMo-V2.6-Pro-MOPD 和 Flash-MOPD 权重已经开放,API 也已经切到新版,调用名称不变。小米还会重置 MiMo Desktop 用户当前周期的剩余额度。

AI 解读
MiMo-V2.6 直播 RL 上线一周就曝出工具调用复读:OpenCode 里 Flash、Pro 占比达 1.02%、0.54%。奖励只奖最终正确,单轮 32 次以下重复不罚;规模一大,Flash 超 10 次异常样本从 step0 11.1% 涨到 step20 24.6%。

按原方案重跑要 231 万美元;小米只训 12 step、约 7000 样本的纠错 teacher,经 MOPD 合回 Pro/Flash,花约 9 万美元,仅重训 4%。罗福莉的 MOPD 从能力融合框架变成故障补丁;API 名称不变、权重开放,后训练竞争开始看低成本纠偏。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成