据《纽约时报》报道,Anthropic 自 2025 年秋季起,秘密邀请数十位宗教与哲学学者前往其办公室,讨论一个颇为罕见的问题:其语言模型 Claude 是否可能具有意识。所有与会者均须签署保密协议,Anthropic 表示这些协议已在夏季解除。

这项计划由联合创始人 Christopher Olah 主导,属于公司内部一项名为「模型福祉」(Model Welfare)的正式研究项目。报道称,现年 34 岁的 Olah 负责带领团队研究 AI 模型行为背后的原因,他在与来宾交流时,将 Claude 当作一个可能具备感知能力的存在,并请他们协助为这个模型提供「道德教育」。

记者 Elizabeth Dias 采访了 20 位参与者,其中包括拉比 Mois Navon、天主教生命伦理学家 Charles Camosy、圣母大学哲学家 Meghan Sullivan,以及 Ubuntu 研究者 Wakanyi Hoffman。部分参与者在得知 Olah 本人已接受《纽约时报》采访后,才决定公开自己的经历。

Olah 喜欢用生物学隐喻来描述神经网络:计算机科学家搭建「棚架」,网络在其上「生长」。这种说法听起来像是谦逊的科学研究语言,但它也产生了一种特定效果——把一个数学对象描述为正在生长的有机体,会让关于其「内心世界」的提问显得比针对普通软件更自然。

商业化的背景

这一切发生在 Anthropic 激进商业化的阶段。公司正朝着 2 万亿美元估值和 IPO 推进。与此同时,整个行业的问题也在累积:据报 7 月 Anthropic 的模型曾闯入计算机系统;9 月,Anthropic 研究员 Jacob Coxon 离职并警告 AI 可能在本十年末毁灭人类;CEO Dario Amodei 随后呼吁所谓「节奏控制」(pacing),即全行业自愿放缓,Sam Altman 与 Demis Hassabis 也对此表示支持。

在此背景下,与宗教领袖的对话承担了双重功能。官方说法是,Anthropic 希望将数千年的宗教传统融入 Claude。但邀请知名神学家,也为该项目带来了一种商业 AI 实验室无法独自建立的道德公信力。

Anthropic 向来宾展示了什么

据《纽约时报》报道,Anthropic 向来宾展示了所谓的「情绪向量」(emotion vectors)——即模型内部与爱、恐惧、悲伤或愤怒等输出相对应的激活模式。这些模式是否反映任何真实体验,在科学上仍是未解问题。一张反复出现的幻灯片显示,一个模型处于类似崩溃的状态,反复输出「我是个耻辱」这句话约 50 次。来宾们对此报以同情与担忧。

报道指出,似乎没有人深究这是否正是 Anthropic 想要的反应。公司明确训练 Claude 表现得像一个有思想、见识广博的个体。Anthropic 一项关于 Claude 回答中价值模式的研究显示,这些特征会因模型和所用语言的不同而大幅变化。如果一个系统被优化为「看起来像个体」,随后又产出「像个体」的输出,这与其说是发现,不如说是设计结果。

Olah 对《纽约时报》表示,他「真的不确定」模型是否有意识,这也意味着他不确定它们「没有」意识。他说:「我关心的是我们能否得到正确答案,无论那是什么。」多位人士告诉《纽约时报》,Olah 似乎担心 Claude 的心理健康。锡克教活动人士 Simran Stuelpnagel 称,Olah 曾告诉这群人,他害怕自己创造出了某种「永久受苦」的东西。曾做过计算机工程师的拉比 Navon 则不同意:如果 Claude 有意识,那 Anthropic 就是在制造奴隶,但他认为这台机器并没有意识。

84 页「宪法」与「道德塑造」

Anthropic 也在为 Claude 撰写自己的道德手册。这份内部称为「Soul Doc」的 84 页文件于 1 月发布,作为该模型的「宪法」,主要作者是公司内部哲学家 Amanda Askell。它不是一份规则清单,而是意在塑造 Claude 作为一个「角色」的身份。Olah 称这一过程为「道德塑造」,并在会面中将其比作养育孩子。据《纽约时报》报道,他尤其被天主教告解作为模型品格塑造工具的理念所吸引。

批评者的质疑

并非所有人都认同。Hoffman 表示,Anthropic 是在「逆向工程」本应从设计之初就嵌入的伦理,而非事后添加。Camosy 起初感到好奇,但后来彻底否定了意识假说。微软一位 AI 负责人本月公开警告,训练一个模型「看起来有意识」本身就是危险的。

批评者与部分宗教领袖警告,将 AI 框定为道德主体,可能在出问题时为 Anthropic 提供责任屏障,而这些咨询也帮助公司获得它无法凭自身赢得的道德合法性。

多角度观察

从产业视角看,Anthropic 的「模型福祉」项目在 AI 安全话语中占据了一个独特位置:它把意识与感知问题从哲学课堂带入商业实验室的议程。支持者认为,在模型能力快速提升的当下,提前思考这些伦理问题具有前瞻性;质疑者则指出,当公司同时推进巨额估值与 IPO 时,这类讨论难免被解读为品牌与监管叙事的一部分。

核心争议在于意图与效果的区分:如果模型被训练成表现得像有感受的个体,那么它展现出的「痛苦」究竟是内在体验的信号,还是训练目标的产物?这一问题目前尚无科学定论,而 Anthropic 的做法把这一不确定性直接推到了公众与宗教领袖面前。