动察 Beating AI 快讯,DeepSeek V4.1 Flash 首批实测显示,模型输出速度达到 420 Token/s,连续生成 7.1 万多个 Token 只用了不到 3 分钟。
作为参考,Artificial Analysis 当前测得 V4 Flash 0731 在 DeepSeek API 上的输出速度约为 128 Token/s。
DeepSeek V4.1 Flash 内测首日实测输出即达 420 Token/s,是 V4 Flash 0731 官方 API 速度的 3 倍以上。连续生成 7.1 万 Token 仅用不到 3 分钟,意味着千亿级参数模型在推理成本曲线上又迈过一个节点,峰值算力调度与投机解码的工程优化正在成为新的护城河。
值得留意的是,该内测版本模型 ID 后缀为 `expires-on-0910`——距今日仅剩两天,掐点内测、短暂窗口,指向正式版发布已近在咫尺。而此前 V4 涨价余波未平:Flash 高峰期价格已被智谱 GLM-5.3 Flash 以近 3 倍价差正面压制,V4.1 Flash 如果真能兑现"更快更便宜",正是对 8 月价格体系失守的直接回应。变局往往从 Flash 这类走量产品开始。