动察 Beating AI 快讯,清华大学副教授代季峰创办的 NaiveAI 发布 Naive-N0.5-Flash,并开放模型权重。模型基于小米 MiMo-V2.5 Base 改造,使用 MIT 协议开源。
NaiveAI 保留了原有的 MoE 架构,重点改了注意力机制。团队把全局注意力换成滑动窗口注意力和 DeepSeek 稀疏注意力,再继续训练 3.25 万亿 tokens。改造后的模型原生支持 100 万 token 上下文,可以减少处理超长文本时的计算量。
AI 也直接参与了研发。它负责写代码、跑实验、分析结果和继续优化,研究员负责定方向和做关键决定。以推理系统 NaiveRT 为例,团队 6 天跑了 151 轮优化实验,其中 63 轮被采用。
官方公布的最高推理速度为 2122 tok/s,但测试条件比较特殊:使用 8 张 GPU,关闭思考模式,不计算输入处理时间,而且取的是 41 次请求中表现最好的一秒。标准模式下,官方给出的速度约为每位用户 50 tok/s。