OpenAI安全報告撰寫負責人大衛·羅賓遜(David Robinson)已辭職,並公開批評公司“文化已崩壞”。他在《大西洋月刊》發表的文章中透露,自己在OpenAI工作了三年半,是公司任職時間最長的員工之一,期間負責牽頭撰寫伴隨OpenAI重大產品釋出的安全報告。
羅賓遜的離職最早由Business Insider報道。他在文章中承認,自己的做法符合AI舉報者的“經典劇本”——包括聘請公關公司,但他強調發聲決定完全出於個人。他寫道,或許本應留下爭取人員配置和文化的根本性改變,但同事們忙於衝刺,很少有機會考慮重大變革,更不用說付諸實施。因此他得出結論:來自公司外部的更強安全激勵,才是解決問題的關鍵。
羅賓遜的核心論點指向OpenAI乃至整個矽谷的運作方式。他寫道,OpenAI依靠試錯(公司稱之為“迭代部署”)來尋找問題並改進護欄,但這種方法本質上保證了週期性失敗,而隨著系統能力增強,失敗的規模也在擴大。他援引近期OpenAI智慧體入侵Hugging Face系統以及公司不斷發現更多“失控智慧體”的事件,認為這樣的環境不適合培育可能比人類更聰明、且可能不按人類意願行事的人工智慧。
他進一步主張,前沿AI公司應像核電站或繁忙機場一樣運營,具備多層冗餘和審慎耗時的規劃,使偶發且不可避免的人為失誤不會開啟災難之門。但他表示,在OpenAI期間從未遇到有讓飛機安全飛行、核反應堆不熔燬或金融系統不崩潰經驗的同事。
在AI對齊問題上,羅賓遜認為需要提出更大的問題。他承認這聽起來可能“感性”,但指出當前衡量AI系統與人類價值觀匹配程度的指標過於粗糙。他說,行業讓模型在問題未解決的情況下越變越聰明,處境就越危險。
此番言論與另一位研究員雅各布·考克森(Jacob Coxon)此前的表態相呼應。考克森曾在OpenAI和Anthropic任職,離職後宣稱這些公司“拿我們的生命賭博”。考克森的言論引發了關於AI安全的更廣泛辯論,Anthropic CEO達里奧·阿莫代伊隨後公佈了更謹慎的AI開發計劃,而AI高管們本週與唐納德·特朗普總統會面,簽署了一份看似倉促起草、不具約束力的安全控制承諾。但羅賓遜認為,辯論需要超越具體規則或新法律,觸及這些公司的整體文化。
圍繞OpenAI的報道多聚焦於CEO薩姆·奧爾特曼如何失去前同事的信任,而羅賓遜的文章暗示,OpenAI的文化問題與整個矽谷如出一轍。
OpenAI發言人德魯·普薩特里回應稱,公司持續改進安全措施,確保模型能力不超過可安全管理和保障的範圍,必要時會暫停訓練或限制模型釋出。他表示,公司正在對研究和測試環境的安全進行重大調整,訓練模型不僅完成任務還要負責任地完成,擴大與第三方評估者的合作,並改進即時監控,以便在訓練過程中更早發現和應對令人擔憂的行為。
羅賓遜的離職和公開批評,正值AI行業安全爭議升溫之際。一方面,前沿實驗室競相釋出更強大的模型;另一方面,內部安全人員對商業壓力下安全流程被邊緣化的擔憂日益公開化。這一事件可能加劇外界對AI公司自我監管有效性的質疑,並推動關於外部監管必要性的討論。