动察 Beating AI 快讯,清华大学副教授代季峰创办的 NaiveAI 刚发布首款模型 N0.5-Flash。公司主打「AI 参与研发 AI」,称模型参与了架构设计、代码编写和推理优化。官方公布的单流推理峰值达到 2122 tok/s。
月之暗面研究员杨新宇随后公开质疑这套宣传。他认为,2000 tok/s 本身完全可能做到,但 NaiveAI 选的对比基线太弱。它拿 SGLang 的 300 多 tok/s 做参照,小米此前已经让参数更大的 MiMo-V2.5-Pro 跑到 1000 tok/s 以上。基线选得低,最后的提升幅度自然更显眼。
杨新宇也不认可 NaiveAI 对架构创新的描述。N0.5-Flash 基于小米 MiMo-V2.5 Base 改造,把原来的全局注意力换成 DSA。NaiveAI 最后用了 DSA + GQA。杨新宇认为,这更多是基于现有底模做出的工程取舍,还会损失 GPU 利用率,算不上多大的架构突破。
他认为 NaiveAI 证明了模型可以靠继续训练和工程优化变快,但目前还没证明「AI 参与研发」本身带来了人类团队做不到的突破。