OpenAI釋出了一系列針對前沿人工智慧開發的安全保障提案,核心聚焦於對齊研究與一種名為遞迴自我改進(RSI)的計算技術。該公司在一篇部落格文章中表示,要安全完成這一轉型,需要開展協調研究以跟上能力發展步伐,使各方構建的系統始終與人類價值觀保持一致並處於人類控制之下。
在具體路徑上,OpenAI呼籲開展國際合作、制定前沿標準,並建議借鑑全球現有AI安全機構的工作成果,其中包括美國商務部下屬的AI標準與創新中心(CAISI)。該機構協助測試AI模型並制定相關指引。OpenAI還提出,這些技術標準應側重於前沿AI模型與開發者,以及自動化AI研究人員的收益-風險管理,其中就涵蓋RSI。
所謂RSI,是指AI系統能夠在無人干預的情況下設計和開發其後續版本。儘管這一技術目前尚未實現,但隨著AI系統在網際網路上日益複雜和普遍,基礎模型構建者可能面臨失去對底層技術控制的風險,或未能預見潛在的意外後果。OpenAI在部落格文章中明確表示,完全自主的RSI目前還無法實現,除非能夠安全實現,否則不應貿然推進;如果缺乏適當的謹慎和保障,RSI可能導致人類失去對AI開發的實際控制權,無法對不再理解的研究過程進行監督。包括Anthropic和OpenAI在內的多家公司此前也警告稱,這將使人類更容易失去對這些系統的控制。
OpenAI在文章中還提到了“抱抱臉(Hugging Face)事件”。該攻擊雖不涉及RSI技術,但OpenAI將其視為一種“預覽”——如果沒有強有力的保障措施和協調,某些風險可能會變得更加嚴重。
這一提案的釋出並非孤立事件。上週,競爭對手Anthropic也提出了自己關於前沿AI模型安全開發的構想,這是對近期熱門研究人員紛紛就AI對人類威脅發出警告的回應。曾先後在Anthropic和OpenAI兩家公司任職的Jacob Coxon近兩週前宣佈辭職,並稱這些公司“拿我們的生命冒險”,此舉引發了全球熱議。
隨後,Anthropic執行長達里奧·阿莫代伊(Dario Amodei)發表了一篇長篇博文,將討論推向白熱化。他呼籲業界放慢腳步,並表示這項工作需要行業和全球的協調配合。這一表態立即得到了OpenAI執行長薩姆·奧爾特曼和埃隆·馬斯克的支援。阿莫代伊還提出了在公司內部引入第三方評估人員的想法,以此來稽核和減輕其技術可能對社會造成的潛在風險,例如加劇網路安全相關的駭客攻擊或製造生物武器。
不過,由於AI評估領域尚處於起步階段,對於允許獨立第三方更徹底地檢查尖端技術的基本標準和原則,業界尚未達成統一共識。OpenAI此次提案的釋出,正值全球AI安全監管討論升溫之際,其能否推動形成具有約束力的國際標準,仍有待觀察。