header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

信息一改再改,大模型就乱了:表现最好的GPT-5.5也只能答对59.3%

动察 Beating AI 快讯,腾讯混元等团队发布 EvolveScaler,专门测试大模型能不能跟上不断变化的信息。它会在长文本里不断加入修改、撤回、补录和作废的信息,再让模型根据最新状态回答问题。


比如先给模型看 40 天游戏记录,再问:「如果第 7 天没打那个小 Boss,最后还能不能打赢?」这会连带改变后面的装备、血量和战斗结果。模型得从第 7 天开始,把后面几十天重新推一遍,原文里没有现成答案。


团队设计了 117 类任务、159 种问题,最长约 1200 个事件。14 个模型配置包括 GPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Preview Pro、GLM-5.2 和 Qwen3.5 Plus。最难档里,成绩中位数只有 11.3%;表现最好的 GPT-5.5-xhigh 也只有 59.3%。


这套数据也能拿来训练模型。一个内部 A3B 模型加入 6000 条这类数据后,在 8 个外部测试上全部提升,平均提高 5.25 分。

AI 解读
腾讯混元等团队发布 EvolveScaler,把长文本评测从“记得住”推向“跟得上状态变更”:在 40 天游戏记录中注入修改、撤回、补录与作废,让模型重推第 7 天分支后的装备、血量和战斗结果。117 类任务、最长约 1200 个事件,最难档中位数仅 11.3%,GPT-5.5-xhigh 也只有 59.3%。动态一致性仍是模型层硬伤。

更值得注意的落点在训练:内部 A3B 加入 6000 条该数据后,8 个外部测试全部提升,平均 +5.25 分。此前 7 月 LHTB 测 Agent 持续执行、8 月 Hy4 开源 1M 上下文,混元正把评测、长上下文和数据合成串成闭环。基准正变成后训练数据供应链的上游入口。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成