header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

腾讯T1专攻Agent长任务:连续操作300多轮,跑分涨20分

动察 Beating AI 快讯,腾讯把 Qwen3.5-122B-A10B 专门拿去练终端 Agent,做出了 T1。它主要处理 Linux 终端里的复杂任务,单个任务最多能连续调用工具 300 多轮。Terminal-Bench 2.1 得分从底模的 43.8% 升到 64.0%,涨了 20.2 分。


这 20.2 分里,大头来自强化学习。SFT 只把分数拉到 49.4%,后面的强化学习又涨了 14.6 分。团队准备了约 1.5 万个终端任务,每个任务都配有自动测试。Agent 没把整个任务做完,只要完成了其中一些要求,也能拿到相应奖励。


长任务还有一个麻烦。Agent 真正干活和之后拿这段经历训练时,同一句内容可能被重新切成不同 token,MoE 也可能换一批专家处理。T1 会把当时生成的 token 和选中的专家都记下来,训练时直接照着重放,把这种训推偏差压低了约三分之一。

AI 解读
腾讯把 Qwen3.5-122B-A10B 单拎出来练终端 Agent,做出 T1,Terminal-Bench 2.1 从 43.8% 拉到 64.0%,其中 14.6 分来自强化学习,SFT 只到 49.4%。这延续了 7 月混元联合高校发布 LHTB 的思路——不只看终局成败,按进度给分,与 T1 的"部分完成也给奖励"同源。值得注意的是训推偏差这一层:记录生成时的 token 切分与 MoE 专家路由,训练时重放,偏差压低约三分之一。这是把 Agent 当作可复现的训练对象,而非一次性推理产物。同期 Perplexity 用同一底模做搜索 Agent 后训练、蚂蚁 Ling-3.0 切小模型本地 Agent,终端长任务这条赛道的后训练配方正在被各家分别验证。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成