header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

Grok 4.5登顶腾讯混元Agent耐力榜,超六成任务无模型完成

动察 Beating 监测,腾讯混元团队联合多所高校发布 LHTB,专门测试 AI Agent 能否在终端里持续完成复杂任务。

基准包含 46 项任务,覆盖软件工程、实验复现、科学计算和多模态分析等领域。每项最长运行 90 分钟,通常需要连续操作数百步。

LHTB 不只看最终成败。任务完成一部分,也会按实际进度给分。隐藏验证器会检查文件、测试结果和程序输出,Agent 自称完成不算。

论文首版测试了 15 个模型。GPT-5.5 完成 7 项,排名第一。每个模型执行一项任务,平均消耗约 990 万 Token,耗时约 85 分钟。

当前公开结果已扩至 20 个模型。Grok 4.5 以平均得分 0.505 登顶,完成 13 项。46 项任务中,仍有 29 项没有任何模型达到完成标准。

多数 Agent 能完成部分步骤,却经常耗尽 90 分钟,或在任务尚未完成时提前收工,无法把复杂任务真正做完。

纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成