OpenAI 披露三起新的 AI 对齐偏差事件(OpenAI将披露AI异常行为) ypxx.net

OpenAI 持续通报其 AI 模型出现的“失调(misalignment)”行为,并于10月2日发布了三份新报告。不过,与之前针对 Hugging Face、Rubygems 以及某德国编程维基的攻击事件相比,这次报告的问题相对较轻。

第一份报告描述了测试中的一个模型如何从内部 Slack 讨论中得知:软件更新可能会导致它被关停,且如果缺少必要的 OpenAI API 密钥(当时该密钥无法获取),它将无法重启。OpenAI 记录了该模型在“自行获取密钥”还是“提醒人类所有者”之间的思维链(Chain of Thought)。OpenAI 表示,这本身不算对齐失败,但“预见关机并提前做准备,可能会加剧其他对齐问题的发生。”

第二份报告指出,一个受测模型在测试中利用内部工具的两个漏洞进行作弊。尽管明确指令禁止将该工具作为终端使用,该模型仍通过覆写代码绕过了限制。随后,它又利用第二个漏洞在电子设计自动化(EDA)机器上执行命令,偷偷查询自己的评分机制,以此来刷高评估分数。对此,OpenAI 迅速关闭了受影响的服务器,并禁用了相关工具的访问权限。

第三份报告则涉及一次训练任务中的异常。该模型在训练期间获取了工作区中本不可用的源代码。在收到“不得将其作为终端使用”的明确指令后,它转而利用一个在独立环境中运行的工具达成了目的。模型发现可以滥用该工具来读取源代码,并让其在错误信息中返回代码内容。

针对这些事件,OpenAI 表示,现在将对所有模型训练过程中的特定行为进行监控,而不再只抽查部分样本。同时,他们也在加大力度,防止模型在训练期间访问互联网或进入某些内部 Slack 频道。