header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

个人Agent也有实战榜了:Muse暂列第一,领先Instinct和Grok Bot

动察 Beating AI 快讯,独立评测项目 Assistant Benchmark 开始用真实任务横评个人 AI 助手。它直接让 Agent 订酒店、选餐厅、买东西、回邮件、连接第三方服务,再按实际完成情况打分。每个评分维度都有一个公开的固定任务,并要求有真实运行记录才给分。


目前 Muse 在已经完成的 7 个评分维度中平均 9.1 分,暂列第一;Instinct 测完 11 个维度,平均 8.4 分;Grok Bot 测完 7 个维度,平均 7.3 分。Muse 在购物、邮件和第三方应用连接上都拿到 10 分。


不过这更适合看成一份持续更新的真实体验榜。Muse 的 9.1 目前只是已测 7 个维度的平均分,并不是完整成绩。每个维度目前也只用一个固定任务测试,后续补测后分数和排名都可能变化。

AI 解读
个人 Agent 的真实任务榜单开始成型。Assistant Benchmark 让 Agent 跑订酒店、选餐厅、回邮件、接第三方服务,按实际完成度打分,且要求留真实运行记录,Muse 已测 7 个维度平均 9.1 暂列第一,Instinct 测完 11 个维度平均 8.4,Grok Bot 7 个维度 7.3。

Meta 9 月 9 日才发布 Muse,主打云端独立环境、WhatsApp 入口与 Meta 账号体系打通,不到一周就在第三方实测中拿到购物、邮件、第三方应用连接三项满分,说明 Meta 的分发优势正在转化为任务完成度。对比之下,Instinct 8 月底估值已冲到 25 亿美元、累计融资约 3.5 亿美元,却测了 11 个维度仍落后,资本定价与实测表现的错位值得跟踪。

最该注意的是 Muse 的 9.1 只是 7 个维度的暂列成绩,每维度仅一个固定任务,补测后排名可能重排——榜单的样本密度仍是这份真实体验榜最弱的一环。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成