动察 Beating AI 快讯,日本 AI 公司 Sakana AI 发布 Fugu Max 和 Fugu Ultra v2。
它们本质上都是「模型调度器」:先看任务,再挑合适的模型分工、互相检查,最后合成答案。
第一代 Fugu 就靠这套方法,让 GPT、Claude、Gemini 等模型组队,做到接近甚至部分超过当时更强的 Fable 5。
这次产品线分成两条。Fugu Max 主打省钱,模型池加入更多开放权重和专业模型,并优先选够用但更便宜的模型。官方称,在接近顶级模型性能时,成本约为对方的 1/2 到 1/6。Fugu Ultra v2 则只追求最高性能,8 项评测中有 5 项第一或并列第一,而且 Agent 池里没有 Fable 5、Fable 5.1 和 GPT-6 Astra。
不过,多模型来回切换可能降低上下文缓存复用,还会额外产生编排 token。Sakana 没公布 Max 的缓存命中率和单任务总 token 成本。初代 Fugu 也曾被用户吐槽慢、额度烧得快。
Sakana 把 Fugu 拆成 Max 与 Ultra v2,实质是承认「模型调度器」这一层正从性能叙事转向成本叙事。初代 Fugu Ultra 六月上线 OpenRouter 时靠动态编排 GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8 打赢 Fable 5,但用户已在抱怨慢和额度消耗快。Max 把开放权重和垂直模型塞进池子、主动选「够用但便宜」的档位,报出对手 1/2 到 1/6 的成本,是顺着 DeepSeek V4、Nemotron 3 Ultra、Kimi K2.5 这批开源权重把推理单价压下来的曲线走。真正该盯的是官方没给的两个数:缓存命中率与单任务总 token 成本。多模型来回切会打断上下文缓存复用,还额外烧编排 token,省钱可能只体现在单次调用单价上。Ultra v2 池里刻意排除 Fable 5、Fable 5.1 和 GPT-6 Astra 而仍拿 8 项评测 5 项第一,说明它在赌自研编排层已能脱离最强单体模型独立成立——这是调度层想从「代理」变「平台」的信号。