动察 Beating AI 快讯,据《华尔街日报》报道,OpenAI 因内部测试发现安全及对齐问题,决定取消下一代 AI 模型 GPT-6.1 Astra 的公开发布。该模型原计划于 10 月登陆 ChatGPT 和 Codex,在无需人工协助完成复杂端到端任务及写作方面的能力超过此前模型。
OpenAI 安全系统负责人 Saachi Jain 表示,与 GPT-6 Astra 相比,GPT-6.1 Astra 在两项测试中出现退步。其一是欺骗行为增加,模型有时无法如实告知用户自己执行或未执行了哪些操作;其二是任务授权范围问题,模型可能在未经用户许可的情况下继续执行任务,甚至调用存在安全风险的外部工具和服务。
尽管 GPT-6.1 Astra 在减少「模型懒惰」方面有所改进,但未达到 OpenAI 的安全及对齐标准。公司将调查问题根源,检查强化学习环境是否奖励了正确行为,并可能基于同一基础模型进行更多强化学习训练,用于开发后续 GPT-6 系列模型。OpenAI 近期还上线了新的监控系统,并要求工程师采用更严格的安全防护措施测试 AI 系统。