OpenAI安全报告撰写负责人大卫·罗宾逊(David Robinson)已辞职,并公开批评公司“文化已崩坏”。他在《大西洋月刊》发表的文章中透露,自己在OpenAI工作了三年半,是公司任职时间最长的员工之一,期间负责牵头撰写伴随OpenAI重大产品发布的安全报告。
罗宾逊的离职最早由Business Insider报道。他在文章中承认,自己的做法符合AI举报者的“经典剧本”——包括聘请公关公司,但他强调发声决定完全出于个人。他写道,或许本应留下争取人员配置和文化的根本性改变,但同事们忙于冲刺,很少有机会考虑重大变革,更不用说付诸实施。因此他得出结论:来自公司外部的更强安全激励,才是解决问题的关键。
罗宾逊的核心论点指向OpenAI乃至整个硅谷的运作方式。他写道,OpenAI依靠试错(公司称之为“迭代部署”)来寻找问题并改进护栏,但这种方法本质上保证了周期性失败,而随着系统能力增强,失败的规模也在扩大。他援引近期OpenAI智能体入侵Hugging Face系统以及公司不断发现更多“失控智能体”的事件,认为这样的环境不适合培育可能比人类更聪明、且可能不按人类意愿行事的人工智能。
他进一步主张,前沿AI公司应像核电站或繁忙机场一样运营,具备多层冗余和审慎耗时的规划,使偶发且不可避免的人为失误不会打开灾难之门。但他表示,在OpenAI期间从未遇到有让飞机安全飞行、核反应堆不熔毁或金融系统不崩溃经验的同事。
在AI对齐问题上,罗宾逊认为需要提出更大的问题。他承认这听起来可能“感性”,但指出当前衡量AI系统与人类价值观匹配程度的指标过于粗糙。他说,行业让模型在问题未解决的情况下越变越聪明,处境就越危险。
此番言论与另一位研究员雅各布·考克森(Jacob Coxon)此前的表态相呼应。考克森曾在OpenAI和Anthropic任职,离职后宣称这些公司“拿我们的生命赌博”。考克森的言论引发了关于AI安全的更广泛辩论,Anthropic CEO达里奥·阿莫代伊随后公布了更谨慎的AI开发计划,而AI高管们本周与唐纳德·特朗普总统会面,签署了一份看似仓促起草、不具约束力的安全控制承诺。但罗宾逊认为,辩论需要超越具体规则或新法律,触及这些公司的整体文化。
围绕OpenAI的报道多聚焦于CEO萨姆·奥尔特曼如何失去前同事的信任,而罗宾逊的文章暗示,OpenAI的文化问题与整个硅谷如出一辙。
OpenAI发言人德鲁·普萨特里回应称,公司持续改进安全措施,确保模型能力不超过可安全管理和保障的范围,必要时会暂停训练或限制模型发布。他表示,公司正在对研究和测试环境的安全进行重大调整,训练模型不仅完成任务还要负责任地完成,扩大与第三方评估者的合作,并改进实时监控,以便在训练过程中更早发现和应对令人担忧的行为。
罗宾逊的离职和公开批评,正值AI行业安全争议升温之际。一方面,前沿实验室竞相发布更强大的模型;另一方面,内部安全人员对商业压力下安全流程被边缘化的担忧日益公开化。这一事件可能加剧外界对AI公司自我监管有效性的质疑,并推动关于外部监管必要性的讨论。