header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

OpenAI、Anthropic产品负责人互相阴阳:你家模型也就刚追上我家

动察 Beating AI 快讯,Claude Code 负责人 Boris Cherny 发帖称,GPT-6 Astra 的提示词注入防护已经和 Gemini Flash、Claude Opus 4.8「差不多」,还顺手夸了自家 Claude 模型大约两个月前已「在实践中解决」这个问题。提示词注入就是把恶意指令藏进网页、文档等内容,诱导 Agent 泄露数据或执行危险操作。


Boris 还称,公开评估并点名其他实验室,是推动它们训练出更安全模型的好办法,「我们会继续这样做,直到其他实验室更加重视安全」。


帖子很快被 X 加上 Community Note 反驳。Gray Swan 的独立评测显示,没有任何受测模型完全免疫提示词注入,Claude 同样存在攻击成功案例。另一名安全研究员还用特制网页攻击 Claude Code Opus 5 Auto Mode,在小规模测试中取得 60%–80% 的成功率。


OpenAI 核心产品负责人 Thibault Sottiaux 随后直接照着 Boris 的句式反写了一遍。他称自己也很高兴看到 Claude Code 新出的后台电脑操作终于追上 Codex,「而且是我们今年 5 月的版本」。


Boris 后来承认,原帖「比自己想要的更阴阳」,强调自己确实是在认真肯定 Astra 的进步。他同时澄清,所谓提示词注入已经「解决」,指的是 Claude 模型、注入检测机制和 Auto Mode 组合起来后的产品效果,不是模型本身已经免疫。

AI 解读
两大模型厂商的产品负责人公开互踩,表面是提示词注入防护和Agent能力的口水仗,实则是Agent安全标准定义权的争夺。Boris Cherny将「解决」限定为模型、检测机制与Auto Mode组合后的产品效果,承认模型层并未免疫,这一澄清把讨论从模型能力拉回到工程系统层面,与Claude Code源码泄漏后外界对其harness工程的关注形成呼应。

更有意思的是Thibault Sottiaux的反击点:Claude Code后台电脑操作刚追上Codex今年5月的版本。两个月代差在Agent赛道已算显著,说明Anthropic的Agent产品节奏并未保持此前优势。真正的信号是,OpenAI选择在安全辩论中回应产品能力,而非安全本身,暗示Codex在提示词注入防护上并无底气接战。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成