header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

Grok4.7临门延期:马斯克称训练把回答长度罚过头

动察 Beating AI 快讯,马斯克确认 Grok 4.7 还要再等几天。9 月 2 日他曾说「10 天后发布」,原本指向 9 月 12 日左右。现在临近上线,xAI 发现模型碰到高难度任务时会过早收尾,连本来能完成的任务也会提前放弃,对答案的检查也不够严格。


马斯克怀疑,问题出在强化学习阶段。训练时可能对回答长度罚得太重,把模型推向更短、更快结束的回答,复杂任务需要的推理也跟着被压缩。不过他自己也加了「可能」和「或类似原因」,说明 xAI 还没完全确认根因。

AI 解读
Grok 4.7 的延期不是算力或数据问题,而是后训练奖励设计的自伤。2.1T 参数版本原定 8 月 7 日前后随 4.6 之后几周推出,马斯克 9 月 2 日给出「10 天后」的窗口,如今在临门一脚处发现模型对高难度任务过早收尾——他归因于 RL 阶段对回答长度的惩罚过重,把模型推向短答,复杂推理被一并压缩。这一诊断值得注意:Grok 4.6 与 4.5 同为 1.5T,升级重点本就押在后训练,4.7 才扩参。若长度惩罚确为根因,说明 xAI 在 token 效率与推理深度之间的权衡尚未收敛,而马斯克此前承诺的「完成任务所需 token 更少」正与此冲突。时间线上,SpaceX 全量数据接入训练、Cursor 代码数据灌入、年底开源 4.2 基座,xAI 一边扩数据一边压成本,4.7 延期暴露的是这套激进后训练路线的调试成本。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成