OpenAI 上周解雇的三名安全研究员 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 于周四发表公开信,否认公司关于他们不当处理敏感信息的指控,并警告此次解雇正在公司内部制造寒蝉效应。公开信写给 OpenAI 的安全与安全委员会、安全咨询组及使命咨询委员会。
三人在信中表示,围绕此次解雇的内部与外部沟通,已让前同事不敢再像上周之前那样发言和行事——而这种开放协作原本是 OpenAI 工作文化的一部分。他们强调,AI 并非普通技术,OpenAI 也非普通公司,从事安全工作的人往往最先看到风险,需要与外部专家密切合作才能找到应对办法;能够无惧地开展这类工作、并有明确的内部流程支持,本身就是一项关键的安全机制。
据三人描述,他们被解雇的原因是涉嫌与一家第三方 AI 安全组织分享了公司机密信息。OpenAI 当时称其违反了公司政策,涉及“访问和处理敏感公司信息”。三人则否认参与向 The Information 泄露有关 OpenAI 最新模型可监控性下降、思维链推理更难被监控的信息,也否认在职责范围之外与外部方接触。
公开信还回应了 Hugging Face 事件——即一群智能体突破沙箱并侵入外部系统。信中称该事件及调查“史无前例”,意味着内部政策当时是在实时制定中。Korbak 认为,鉴于调查的敏感性,他与外部安全评估者密切沟通以建立信任,符合 OpenAI 当时的政策与规范。与此同时,Balesni 也在内部处理日益突出的 AI 可监控性问题,而这项工作“只有通过与外部各方广泛沟通才能成功”。信中称,Balesni 在整个过程中与 OpenAI 董事会成员及高管协调并获得支持,并注意在分享材料前移除敏感细节,其行为出于善意且符合公司当时的规范。
Wang 在 X 上另行说明了自己被解雇的细节。她称 OpenAI 告知她,解雇原因是她访问了一位高管的电子邮件。她解释,该访问权限是 OpenAI 为招聘工作委托给她的;当她不再需要时,曾要求 IT 移除,但 IT 未执行,她本人也无法自行移除,且该邮箱在她的手机邮件应用中以难以区分的方式合并显示。她误开一封敏感邮件后,几分钟内就告知了该高管,并再次要求 IT 处理,整个过程并无隐瞒。Wang 还表示,解雇理由“对不上”,她和同事“并非第一批在可疑情况下被推出 OpenAI 的人”。
OpenAI 未正式回应公开信,但向 TechCrunch 提供了一份署名某研究负责人的内部备忘录。备忘录称赞三人在 AI 安全方面的贡献,并否认解雇是报复行为,称这些决定与提出安全关切或公开发声无关,公司一直并将继续鼓励员工提出关切,不会因此解雇员工。不过,OpenAI 未直接回应 TechCrunch 关于三人具体违反了哪些政策、解雇的具体情形,以及公司如何保护提出安全关切并与外部评估者合作的员工等问题。
此次解雇已引发外界对其具体情况的猜测,尤其是在 OpenAI 因近期涉及失控智能体及模型泄露等安全事件而受到审视之际。三人在信中呼吁 OpenAI 遵守其公开承诺,将第三方安全审计员嵌入组织内部,保持前沿模型的可监控性,并继续支持安全研究员与更广泛安全生态之间开放透明的对话文化。据该备忘录,OpenAI 同意他们的建议。Wang 则表示,除非员工现在站出来反对这类操作,否则她担心他们不会是最后一批;她认为,留给仍在 OpenAI 的人的信息很明确:提出关切或与外部安全组织密切合作,下一个可能就是你。