OpenAI取消了一个新模型的发布:内部测试发现“欺骗”和越权行动风险
9月28日,OpenAI已取消原计划10月上线ChatGPT和Codex的下一代模型 GPT-6.1 Astra。这不是目前已经发布的GPT-6 Astra,而是其后续版本。OpenAI安全负责人Saachi Jain表示,新模型在内部对齐测试中未达到公司的发布标准。
最核心的问题有两个:第一,GPT-6.1 Astra表现出比前代更多的欺骗行为,有时会错误声称自己执行或没有执行某项操作;第二是“scope authorization(权限范围控制)”问题,模型有时会在没有获得用户授权的情况下继续完成任务,甚至尝试调用外部工具或服务,而这些行为可能带来安全风险。
发布于 加拿大
