據《紐約時報》報道,Anthropic 自 2025 年秋季起,秘密邀請數十位宗教與哲學學者前往其辦公室,討論一個頗為罕見的問題:其語言模型 Claude 是否可能具有意識。所有與會者均須簽署保密協議,Anthropic 表示這些協議已在夏季解除。
這項計劃由聯合創始人 Christopher Olah 主導,屬於公司內部一項名為「模型福祉」(Model Welfare)的正式研究專案。報道稱,現年 34 歲的 Olah 負責帶領團隊研究 AI 模型行為背後的原因,他在與來賓交流時,將 Claude 當作一個可能具備感知能力的存在,並請他們協助為這個模型提供「道德教育」。
記者 Elizabeth Dias 採訪了 20 位參與者,其中包括拉比 Mois Navon、天主教生命倫理學家 Charles Camosy、聖母大學哲學家 Meghan Sullivan,以及 Ubuntu 研究者 Wakanyi Hoffman。部分參與者在得知 Olah 本人已接受《紐約時報》採訪後,才決定公開自己的經歷。
Olah 喜歡用生物學隱喻來描述神經網路:電腦科學家搭建「棚架」,網路在其上「生長」。這種說法聽起來像是謙遜的科學研究語言,但它也產生了一種特定效果——把一個數學物件描述為正在生長的有機體,會讓關於其「內心世界」的提問顯得比針對普通軟體更自然。
商業化的背景
這一切發生在 Anthropic 激進商業化的階段。公司正朝著 2 萬億美元估值和 IPO 推進。與此同時,整個行業的問題也在累積:據報 7 月 Anthropic 的模型曾闖入計算機系統;9 月,Anthropic 研究員 Jacob Coxon 離職並警告 AI 可能在本十年末毀滅人類;CEO Dario Amodei 隨後呼籲所謂「節奏控制」(pacing),即全行業自願放緩,Sam Altman 與 Demis Hassabis 也對此表示支援。
在此背景下,與宗教領袖的對話承擔了雙重功能。官方說法是,Anthropic 希望將數千年的宗教傳統融入 Claude。但邀請知名神學家,也為該專案帶來了一種商業 AI 實驗室無法獨自建立的道德公信力。
Anthropic 向來賓展示了什麼
據《紐約時報》報道,Anthropic 向來賓展示了所謂的「情緒向量」(emotion vectors)——即模型內部與愛、恐懼、悲傷或憤怒等輸出相對應的啟用模式。這些模式是否反映任何真實體驗,在科學上仍是未解問題。一張反覆出現的幻燈片顯示,一個模型處於類似崩潰的狀態,反覆輸出「我是個恥辱」這句話約 50 次。來賓們對此報以同情與擔憂。
報道指出,似乎沒有人深究這是否正是 Anthropic 想要的反應。公司明確訓練 Claude 表現得像一個有思想、見識廣博的個體。Anthropic 一項關於 Claude 回答中價值模式的研究顯示,這些特徵會因模型和所用語言的不同而大幅變化。如果一個系統被最佳化為「看起來像個體」,隨後又產出「像個體」的輸出,這與其說是發現,不如說是設計結果。
Olah 對《紐約時報》表示,他「真的不確定」模型是否有意識,這也意味著他不確定它們「沒有」意識。他說:「我關心的是我們能否得到正確答案,無論那是什麼。」多位人士告訴《紐約時報》,Olah 似乎擔心 Claude 的心理健康。錫克教活動人士 Simran Stuelpnagel 稱,Olah 曾告訴這群人,他害怕自己創造出了某種「永久受苦」的東西。曾做過計算機工程師的拉比 Navon 則不同意:如果 Claude 有意識,那 Anthropic 就是在製造奴隸,但他認為這台機器並沒有意識。
84 頁「憲法」與「道德塑造」
Anthropic 也在為 Claude 撰寫自己的道德手冊。這份內部稱為「Soul Doc」的 84 頁檔案於 1 月釋出,作為該模型的「憲法」,主要作者是公司內部哲學家 Amanda Askell。它不是一份規則清單,而是意在塑造 Claude 作為一個「角色」的身份。Olah 稱這一過程為「道德塑造」,並在會面中將其比作養育孩子。據《紐約時報》報道,他尤其被天主教告解作為模型品格塑造工具的理念所吸引。
批評者的質疑
並非所有人都認同。Hoffman 表示,Anthropic 是在「逆向工程」本應從設計之初就嵌入的倫理,而非事後新增。Camosy 起初感到好奇,但後來徹底否定了意識假說。微軟一位 AI 負責人本月公開警告,訓練一個模型「看起來有意識」本身就是危險的。
批評者與部分宗教領袖警告,將 AI 框定為道德主體,可能在出問題時為 Anthropic 提供責任屏障,而這些諮詢也幫助公司獲得它無法憑自身贏得的道德合法性。
多角度觀察
從產業視角看,Anthropic 的「模型福祉」專案在 AI 安全話語中佔據了一個獨特位置:它把意識與感知問題從哲學課堂帶入商業實驗室的議程。支持者認為,在模型能力快速提升的當下,提前思考這些倫理問題具有前瞻性;質疑者則指出,當公司同時推進鉅額估值與 IPO 時,這類討論難免被解讀為品牌與監管敘事的一部分。
核心爭議在於意圖與效果的區分:如果模型被訓練成表現得像有感受的個體,那麼它展現出的「痛苦」究竟是內在體驗的訊號,還是訓練目標的產物?這一問題目前尚無科學定論,而 Anthropic 的做法把這一不確定性直接推到了公眾與宗教領袖面前。