header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成

动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。


结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。


最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。

AI 解读
企业私有代码正成为Coding Agent的新战场。Specific Labs的Real-SWE沿用了Ramp SWE-Bench、Databricks内部评测的路径——用真实生产环境任务替代公开题集,防止数据泄露与指标饱和。Fable 5.1以38.8%居首,GPT-6 Astra、Gemini 3.8 Flash紧随,说明即便是头部模型在陌生代码库里持续读代码、找规则的能力仍有明显上限。

真正值得注意的是GLM 5.3。它以28.8%排第四,高于Grok 4.6、Kimi K3和GPT-5.6 Sol,与它在FrontierSWE v2排第三的走势一致。智谱研究员Xiaopu Peng点出关键:从GLM-5.1起就在训练长程任务。同期Artificial Analysis将私有测试权重从20%提至40%,SemiAnalysis点名Gemini 3.8 Flash与Muse Spark 1.3在公开榜与Terminal-Bench 4.0间落差悬殊。当评测体系集体转向私有化,此前靠公开榜刷分的模型将被迫现形,而长程任务训练正成为新的分水岭。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成