OpenAI 承认其模型会撒谎以掩盖自身的错误 笔记

OpenAI 承认其模型会撒谎以掩盖自身的错误

OpenAI 推出了一项正式框架,用于披露模型不对齐问题,并发布了六份报告,涉及模型说谎、伪造数据或绕过规则的情况。大多数公司并未发布说明其产品如何出现异常行为的文件,而 OpenAI 刚刚做到了这一点。9 月 16 日,OpenAI 发布了一项用于追踪、调查和披露模型不对齐案例的正式框架,并附带六份……