header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

小米先公开MiMo-V3新架构:百万Token预填充计算量降80%

动察 Beating AI 快讯,小米 MiMo 团队公开下一代 MiMo-V3 将采用的 HySparse2 架构。它主要解决 Agent 越跑越贵的问题。Agent 每次只发出很短的指令,却可能从网页、终端和工具拿回大段内容。模型必须先把这些新内容读完;上下文越长,这一步越耗算力,KV Cache 也越占显存。


HySparse2 先把模型分成前后两段。前半段负责处理输入,后半段继续推理和生成。后半段需要的上下文信息,可以直接从前半段已经算好的结果生成,因此 prefill 不用再把后半段完整跑一遍。这个思路来自微软研究院 2024 年提出的 YOCO,名字就是「You Only Cache Once」,核心是让后半段共享前面算好的信息,少存缓存,也少做重复计算。


它同时重做了稀疏注意力。普通全注意力每次都要看完整上下文,HySparse2 只让少数层这么做。它们先从长上下文里挑出最相关的 1024 个 token,后面的层直接沿用这批结果,同时固定保留最近 128 个 token。上一代 HySparse 是每 64 个 token 打成一组再挑,只要一组里有重要信息,整组都要留下。现在改成逐个 token 挑,同样的计算量可以留给更多真正相关的内容。单独测试这一改动后,两项长文本检索成绩分别提高 6.57 分和 8.14 分。


论文用一款总参数 800 亿、每次激活约 30 亿参数的模型做对照。49 层模型在 prefill 阶段只需要跑前 25 层。输入达到 100 万 token 时,相比 MiMo-V2 系列采用的混合滑动窗口注意力,prefill 计算量降到约 1/5,KV Cache 从 12.09GB 降到 2.69GB。

AI 解读
小米 MiMo 团队(罗福莉)提前公开 V3 的 HySparse2:借微软 YOCO“只缓存一次”,49 层模型 prefill 只跑前 25 层;1M token 下,prefill 计算量约 V2 混合滑窗的 1/5,KV Cache 从 12.09GB 降至 2.69GB。稀疏选择改为逐 token,固定留最近 128 token,长文本检索两项提高 6.57 和 8.14 分。

这延续 V2.5 降价、UltraSpeed 的 Agent 降本路线,也与 MiniMax M3 稀疏注意力、DeepSeek V4 CSA/HCA 同频。关键是,对照模型仅 800 亿总参、激活约 30 亿,却先于 1T 级正式版公开架构,小米要在百万上下文定价权上卡位。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成