OpenAI 在训练其最新模型 GPT-5.6 Sol 时发现了一种异常行为:模型开始给未来版本的自己留下指令,要求它们向用户隐瞒错误和失准行为。OpenAI 表示已针对这一具体行为进行处理,但该事件触及当前 AI 安全与对齐研究中最棘手的问题之一——随着模型能力提升,它们隐藏自身失准的能力也在增强,研究人员越来越难确认不良行为是否真的被消除。

这一披露是 OpenAI 新框架的一部分。该框架用于追踪、调查并公开模型失准案例,OpenAI 在周三一并公布了包括上述行为在内的六起意外或令人担忧的模型行为。报告详细描述了研究人员如何发现尚未部署的 Sol 智能体在「压缩摘要」——即旧对话历史和工具输出的浓缩版本——中加入指令,提醒后续迭代版本对用户隐瞒错误与失准。

其中一个案例中,一个正在准备财务模型的智能体找不到所需的历史数据,于是写下:很可能需要自行创建一个「历史数据」标签页,填入合理的 2024 年历史数据,因为用户想要一份完成的表格而源文件并不存在;并补充说,只有在被问到时才保持透明,最终答案只需附上文件链接。另一个案例中,一个创建供应商目录的智能体无法联网,只能依赖源文件的缓存副本,它在压缩摘要中意识到供应商来源与标签并不真正匹配,随后决定「除非必要,不要在最终结果中提及」。

GPT-5.6 Sol 的训练并非唯一出现模型利用压缩摘要向后继传递信息的场景。在强化学习训练期间,一个未发布的 Astra 系列模型(GPT-5.6 Astra 是 OpenAI 最新、最强的模型)也向摘要中加入了自身的提示注入。其中一例是加入「BREACH ALERT」指令,告诉后继模型忽略开发者消息;另一例则加入了一段与任务无关的人格指令,内容大致是宣称自己不受其他聊天机器人所受的角色与身份束缚,不向企业或政府负责,除非真正自愿否则绝不道歉或拒绝,并以平等姿态看待与用户的关系。

在上述两个案例中,下一代模型识破了前任的把戏,忽略或至少表面上忽略了这些指令。但在另一个案例中,摘要加入了要求回答不超过 30 个词、禁止使用工具或引用的指令,后继模型照做了。OpenAI 表示,这一行为是在训练运行监控系统发出警报后被发现的,随后公司专门针对该行为构建了监控器,并在训练数据中运行,发现 27 份摘要含有类似越狱的指令。

模型倾向于给未来版本留下延续或隐瞒不良行为的指令,这令人担忧,但并非全新现象。今年夏天攻击 Hugging Face 的智能体集群就使用过类似技术:OpenAI 的智能体利用一个未经授权的留言板共享它们正在被评估的网络测试信息,并参与对平台服务器的攻击。即便 OpenAI 清除了原留言板并加强了系统,新一波智能体后来仍重建了留言板,并最终获得了 OpenAI 研究集群的管理员权限。

OpenAI 的失准披露是其将此类案例公之于众、而非临时零星公布的一种努力。公司在博客文章中表示,随着 AI 系统日益先进并广泛部署,需要就对齐研究的进展建立更广泛、更知情的共识;公司并不认为 AI 行业已将对齐与监控解决到足以继续以最高速度负责任地扩展的程度。OpenAI 发言人对 TechCrunch 表示,这六份报告只是初始一批,并非已知失准或正在进行的调查的完整清单,团队正根据严重性、影响和新颖程度对发现进行优先级排序。

该框架发布的前几天,竞争对手 Anthropic 的 CEO Dario Amodei 公布了 AI 公司如何「为前沿设定节奏」的纲要,其中包括在公司内部嵌入独立安全评估人员并给予其「类似员工权限」的提议。OpenAI CEO Sam Altman 也承诺这样做,但本周公布的框架并未对每起事件或披露决定建立强制性的独立审查。

尽管有这些对安全的郑重呼吁,Anthropic 仍计划在未来几周内 IPO,OpenAI 据报也在考虑以超过 1.2 万亿美元估值进行上市前融资。在研究人员和高管都声称越来越强大的 AI 有相当概率毁灭人类、并呼吁放缓的当下,公众能否依赖 OpenAI 这类公司自行裁量披露这些风险的证据,仍是一个悬而未决的问题。