动察 Beating AI 快讯,过去几个月,国产模型第一的王座被 Kimi 和智谱轮着坐。Artificial Analysis 最新第三方榜单中,Kimi K3 和 GLM-5.3 分别拿到 44 和 45 分,DeepSeek V4 Pro 0813 只有 36 分。
现在 DeepSeek 拿 V4.1 Flash 杀了回来。按官方公布的评测,在与 Kimi K3 都有成绩的 16 项测试中,V4.1 Flash 赢了 13 项;与 GLM-5.3 都有成绩的 13 项中,赢了 11 项。优势主要集中在 Coding、终端操作和 Agent 自动化。
而且这可能还只是前菜,要知道 Kimi K3 是 Kimi 当前最强的 2.8T 模型,GLM-5.3 也是智谱旗舰;V4.1 Flash 却只是 DeepSeek 新架构系列里最小的一款。
国产模型头名在 Kimi K3 与 GLM-5.3 之间轮转刚成常态,DeepSeek 用 V4.1 Flash 直接改写排序:与 Kimi K3 重合的 16 项赢 13 项,与 GLM-5.3 重合的 13 项赢 11 项,优势压在 Coding、终端操作与 Agent 自动化。更值得留意的是体量差——Kimi K3 是 2.8T 旗舰、GLM-5.3 也是智谱主力,V4.1 Flash 只是新架构序列里最小的一款,赢面来自架构而非堆参数。
另一处被低估的是时间线:9 月 9 日官方宣布 V4 Pro 请求自动切 Flash,开发者反弹后 9 月 10 日改为 9 月 14 日 12:00 统一切换并按 Flash 计费,同日 App 把「快速/专家/识图」三档合一。一个月前 GLM-5.3-Flash 还以更低价格在 Terminal-Bench 2.1 压过 V4-Flash,如今 Flash 层级的对位已经换手。