header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

OpenScience自测75.7%超过Codex:科研Agent开始自己循环跑实验

动察 Beating AI 快讯,Y Combinator 2026 冬季批次(YC W26)公司 Synthetic Sciences 正式发布开源科研 Agent OpenScience。它能查论文、处理数据、写代码和调用科研数据库,新加入的 Autoresearch 还能让 AI 自己连续跑实验。


比如训练一个模型,研究者只需要告诉它「把验证集 loss 降下来」。OpenScience 会先跑基线,再自己提出修改方案,一轮轮执行实验。结果变好就保留,变差就回退,再根据前面的结果决定下一步试什么。用户也可以提前限制运行次数、总时长和停止条件,或者规定「接下来只改优化器」。


OpenScience 把原本需要研究者反复盯着做的实验迭代自动化了:提出方案、执行实验、比较指标、淘汰失败方案,再继续下一轮。实验可以在本机运行,也可以交给远程 GPU、SSH 服务器和 Slurm/PBS 集群。每轮实验的代码、结果和判断都会留下记录,方便后续检查。


它还支持直接登录 ChatGPT/Codex 订阅,也可以接入自己的 API Key、本地模型,或使用官方按量付费的 Ace。


官方自测中,OpenScience 在 70 道 Terminal-Bench Science 任务中完成 53 道,得分 75.7%。作为对比,Codex + GPT-6 Astra 的公开成绩为 68.1%。

AI 解读
科研 Agent 正从单点工具转向自动实验闭环。4月摩根士丹利 AlphaLab、5月哈佛与 Broad 等开源的 AutoScientists,已把假设—执行—比较—回退产品化;YC W26 的 Synthetic Sciences 以开源 OpenScience 进场,其 Autoresearch 可连续跑实验,并接入本机与 GPU 集群。

更值得看的是它支持直接登录 ChatGPT/Codex 订阅,同时保留 API Key、本地模型与按量付费 Ace。模型订阅成了 Agent 执行燃料,应用层先吃存量额度、再谈单独计价,绕开按量 API 的路径更关键。OpenScience 在 70 道 Terminal-Bench Science 完成 53 道,自测 75.7%,高于 Codex + GPT-6 Astra 的 68.1%;复现、客户与推理成本决定其能否从 YC 演示走向科研基础设施。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成