header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

AI实习7个月后超过真人:Fable 5.1会计岗成功率72%

动察 Beating AI 快讯,AI Agent 创业公司 NeoCognition 发布 ApprenticeBench,专门测 AI 能不能像新人一样,入职后自己学会一份工作。第一版让 Agent 进入一家模拟的加州建筑公司做应付账款。它先读半年历史账单、公司手册和 Odoo 教程,再连续处理 7 个月的 100 张账单,期间还会遇到规则变化和主管反馈。


Fable 5.1 最终成功率达到 72%,GPT-6 Astra 为 68%,最佳人类测试者只有 51%。任务除了录发票,还包括发现错误、分配成本码、联系供应商、走审批,以及从历史记录和反馈里学会公司的内部规则。两款模型直接操作 GUI 的成绩甚至略高于调用 API,过去 Computer Use 常见的性能损失基本消失。


不过,「超过人类」只成立于这一个模拟岗位,而且真人样本只有 2 个。成本也更高,Fable 5.1 平均每个任务要 18.23 美元,人类约 7.21 美元。人类越做越快,Agent 反而会因为记的东西越来越多而变慢。

AI 解读
NeoCognition 的 ApprenticeBench 把评测从「会不会」推到「学不学得会」:模拟加州建筑公司应付账款岗,Fable 5.1 以 72% 成功率压过 GPT-6 Astra 的 68%,最佳人类 51%。OpenAI 与 PwC 的财务 Agent 已在真实企业内跑出 5 倍合同处理量,NeoCognition 补的是入职后自学这一环,与企业级财务 Agent 落地形成同一方向的延展。

真正值得注意的是成本曲线:Fable 5.1 每任务 18.23 美元,人类 7.21 美元,且人类越做越快,Agent 反而因记忆累积变慢。benchmark 上的「超过人类」仍只成立于单一模拟岗、真人样本 2 个,短期更像能力展示而非可量产的经济性拐点——同一周 Cognition 用 Kimi K3 炼出的 SWE-2 以四分之一成本逼近头部,成本才是下一阶段的真正战场。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成