header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

Holo4发布:千问底座,专门强化Computer Use

动察 Beating AI 快讯,法国 AI 公司 H Company 发布 Computer Use 模型 Holo4,包括 27B 和 35B-A3B 两个版本。前者基于 Qwen3.8 dense 架构,后者基于 Qwen3.5 MoE 架构继续做后训练。


H Company 主要强化了电脑操作和长任务执行能力,把原本的通用模型进一步训成面向 Computer Use 的 Agent 模型。


监督微调阶段,H Company 一共用了 1270 亿 tokens,其中约四分之三是成功完成任务的 Agent 操作轨迹,覆盖桌面、网页、手机、MCP 和 API。随后又做强化学习,分别训练「桌面和网页」与「终端、MCP 和 API」两类专家能力,再合回同一个模型。公司还自己生成了约 1 万个软件操作任务,用来训练跨应用和长流程工作。


H Company 还重做了 Agent harness,让模型在数百步任务里持续记住前面的操作,并可以直接调用电脑上的 shell。


效果主要体现在长任务上。Holo4 27B 在 OSWorld 2.0 得到 61.7%,Qwen3.8-27B 官方成绩为 48.0%;在普通 OSWorld 上,Holo4 为 85.2%,Qwen3.8-27B 则为 84.3%。不过这些成绩的 harness、任务版本和评测设置并不完全一致,不能当成严格的同条件对照。

AI 解读
法国 H Company 发布 Holo4,底座 Qwen3.8/Qwen3.5,27B/35B-A3B。四月 Holo3 电脑操控 78.9%;Holo4 转向长任务,1270 亿 SFT tokens 中四分之三是成功操作轨迹,RL 分专家再合流,改 harness 后能记数百步并调用 shell。

Holo4 27B 在 OSWorld 2.0 达 61.7%,Qwen3.8-27B 官方 48%;普通 OSWorld 仅 84.3%到85.2%。跃升集中在新基准,评测设置不一致,不能同条件对照。壁垒移向轨迹数据、harness 与 shell 权限。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成