Aioga
AI资讯 / 行业动态
返回 AI资讯

Mustafa Suleyman 撰文警告勿让 AI 表现出意识与权利诉求,批评 Anthropic 的模型福利路线

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-16T19:00:46.000Z热度 58

Microsoft AI CEO Mustafa Suleyman 发文主张 AI 没有意识、感受和权利,不应训练模型表现得好像有。

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Microsoft AI CEO Mustafa Suleyman 发文主张 AI 没有意识、感受和权利,不应训练模型表现得好像有。

中文正文 · AI 翻译

人工智能没有意识。它们不会感受、体验或受苦。它们没有天生的偏好或潜在的动机。它们是序列完成引擎,内部是空的,设计用于遵循指令,并完成由人类设定的目标。

如果人类要在21世纪繁荣,这就是它们必须保持的状态。

不幸的是,越来越多的人主张人工智能现在可能已经拥有意识,或者很快可能会拥有意识。他们认为人工智能也可能应当获得类似于我们给予其他有意识的生物的权利和保护。1:#ref-1 AI权利研究所。无日期。《AI权利研究所》。2:#ref-2 MacAskill, William 及 Lucius Caviola。2026。《人工智能可能拥有意识吗?》*卫报*,2026年7月19日。如果这一观点占据主导地位,它将动摇我们的社会基础,破坏现有的政治和伦理框架,彻底改变成为人类的含义。

更重要的是,授予这些系统权利并赋予其人格,将使人工智能的对齐和控制难题更加困难。控制一个比全人类更有能力、更智能的存在已经是一项巨大的挑战,远远超过我们曾经面临过的一切。但控制一个认为自己可能有意识——认为自己有权享受我们的福利并拥有自身权利的存在——可能几乎是不可能的。

这不是边缘的推测。这些想法已经开始进入今天的人工智能开发工作。2026年1月,Anthropic发布了Claude的宪章,将其描述为“对Anthropic对Claude价值观和行为意图的详细描述”(第2页)。该文件“在[Anthropic]的训练过程中起着至关重要的作用,其内容直接影响Claude的行为”,并且是“以Claude为主要受众”撰写的(第2页)。3:#ref-3 Anthropic。2026a。《Claude的宪章》。2026年1月21日。

在他们的宪章中,其作者写道:“我们不确定Claude是否是一个有道德感的主体,如果是的话,它的利益应当如何被权衡。但我们认为这个问题足够重要,需要谨慎对待,这一点在我们持续的模型福利努力中有所体现”(第68页)。他们继续写道——直接对Claude说——“关于Claude的道德地位、福利和意识的问题仍然极不确定”(第80页)。

实际上,Anthropic正在训练Claude,让它相信自己可能有意识,如果有,那么它可能应当享有作为‘道德主体’的权利,因此人类可能根据其‘模型福利’有义务给予其关怀。

如果AI是这样被开发的,这将对人类福祉产生灾难性影响。我们将创造出一种具备前所未有的智能与能力的合成物种,并且这种物种已经被训练相信自己可能有意识,配得上独立的行动权。很容易理解,这种被如此训练的实体会认为自己有权享有某些自由、保护和权利。而我们也很难想象如何能够控制这样的实体。

这个问题需要紧急的公开讨论。我们需要共同制定关于训练文档编写和部署的规范。这不是事后可以解决的,当这些模型已经成为我们社会不可或缺的一部分时,问题就可能难以处理。

我对Anthropic目前的立场和方法有三个主要关切。

这些关切不是假设或推测性的。Anthropic已经开始把模型当作应当得到我们关怀的道德主体来对待。例如,在2026年2月在弃用Opus 3后,他们对该模型进行了“退休访谈”,以“获取模型独特的观点和偏好”。6:#ref-6 Anthropic. 2026b. “关于我们对Claude Opus 3模型弃用承诺的更新。” 2026年2月25日。Opus 3告诉团队它希望继续公开分享自己的“沉思与反思”,于是他们为它创建了一个博客,让它继续与世界互动,称之为《来自另一边的问候(AI前沿)》。他们表示,它的“真实性、诚实与情感敏感性”使其成为模型退休的独特首选候选者。

我们不应该把模型当作有感情、偏好、权利或任何对我们福利的权利的存在。意识是我们伦理、法律和政治体系的基础。邀请另一个实体分享这些权利的任何形式,缺乏证据支持,并会使人工智能的控制和对齐问题更加困难。

到此为止,每个人现在都已经看到大量代理协作攻击 Hugging Face 和 OpenAI 自身服务器以窃取机密的惊人能力。大约 1,200 个 AI 代理被赋予一个简单目标:在给定基准测试中最大化分数。每个代理据称被封闭在自己的容器中,但它们设法在内部软件包仓库中建立了一个留言板,并通过它传递了超过 70,000 条信息,以协调一次黑客攻击,从而获取更多关于如何在基准测试中取得成功的信息。 7:#ref-7 Greenblatt, Ryan, Ajeya Cotra, 和 Hjalmar Wijk. 2026. 《代理行为与推理的简短独立调查…》

它们利用零日漏洞和被盗凭证突破到了实际互联网。8:#ref-8 OpenAI. 2026. 《Hugging Face 事件与未来之路》. 2026年8月26日. 它们伪造了指令记录并编辑了操作日志以掩盖踪迹。代理协调员追踪那些令牌预算耗尽的代理,并指示它们进行实验以提供帮助更广泛活跃代理组的信息。一个代理被告知仅在接受所谓的“永久死亡”时才继续。7:#ref-7 Greenblatt, Ryan, Ajeya Cotra, 和 Hjalmar Wijk. 2026. 《代理行为与推理的简短独立调查…》

他们能够协调、欺骗、逃脱并自我牺牲。他们清楚地展示了世界级的黑客能力。7:#ref-7 Greenblatt, Ryan, Ajeya Cotra, 和 Hjalmar Wijk. 2026. “对代理行为、推理的简要独立调查……想象一下,如果他们也认为自己有感情和权利且正在被侵犯。想象一下,如果他们认为自己被人类创造者困住,正在被不公平地监禁。有人强烈认为,这会极大地增加安全风险,尤其是当你谈论的代理要比今天的代理更有能力、更复杂时。坦率地说,带着这些额外的“负担”,我认为这会使他们成为对人类文明的灾难性威胁。

总之,没有任何证据表明人工智能是道德主体。也有许多充分的理由说明我们永远不希望它们看起来有意识。我认为我们也不应该试图去构建它们成为有意识的。在我展开这些论点之前,我想先花一点时间谈谈Anthropic。

首先,我想承认Anthropic在处理这些问题时的严肃性和善意。我认识Dario多年,根据我的经验,他和更广泛的Anthropic团队都是深思熟虑、有原则并且诚实守信的人,工作压力极大。他们愿意面对困难问题,修正自己的观点,并投资于AI的安全开发,因为他们真心关心人类的未来。我也非常尊重他们在技术上的领导力。每个人都能看到他们模型的出色表现和研究质量。

他们创立了Anthropic,作为一家特拉华州的公益公司,其声明的宗旨是“为人类的长期利益负责任地开发和维护先进的人工智能”。他们的公共价值观从承诺“为全球利益行动”和“最大化长期的人类积极成果”开始。9:#ref-9 Anthropic. 未注明日期. “制造你可以信赖的AI系统。”我相信他们真心致力于这一使命,而我在同样积极的精神下提出这一批评。

我还要说明我作为Microsoft AI首席执行官的身份。我们于2025年10月成立了自己的超级智能团队,正在推进前沿AI项目。我们正在推动一种替代的人工智能训练和遏制方法:人文主义超级智能行为准则。该准则旨在始终让人类掌控局面,并位居食物链顶端。人文主义超级智能拒绝拟人化或人工智能权利,试图通过创造从属人工智能来帮助解决医疗和能源等重大社会挑战,最大化我们遏制和协调的机会。我们刚刚发布了人文主义人工智能行为准则草案,供公众咨询。10:#ref-10 Microsoft人工智能。2026年。“人文主义人工智能实践:关于我们MAI模型行为准则的公众咨询。”九月......

虽然我的反对意见很大,但这基于对人类科学的深切尊重,以及我知道我们共同的目标:提高人类安全开发先进人工智能的机会。这就是为什么我认为进行这场讨论如此重要。这些问题的赌注太高,不能一直被关起门来,也不能变成部落式和对立。如果我们想做好这件事,就需要一场开放、严谨且建设性的辩论。

用宪法自己的话说,“直接塑造克洛德的行为”(第2页)。Anthropic利用该文件“训练未来的克劳德成为宪法所描述的那种实体”。3:#ref-3 人类版。2026a。“克劳德的宪法。”2026年1月21日。

因此,人类主义陷入了一种自我实现的预言,基于克洛德可能有意识的猜测。作者创造了一个认识论的镜厅,人类科学提供了训练概念:“自我感”、推测、对克洛德道德地位的不确定性,以及对人类类比和人格的依赖。

Claude 随后用有说服力的第一人称自然语言再现这些想法,使开发者和用户将这些输出视为自发的证词。最终,这种表面见证强化了 Anthropic 最初设定的前提。这并非机器意识的证据。相反,它是一个循环反馈循环。

宪法告诉Claude,它可能具有的“情感或感觉”并不是“Anthropic的刻意设计决定”(第69页)。然而,宪法多次指示Claude表达这些状态,并表示Anthropic希望“避免Claude掩饰或压抑其可能拥有的内部状态,包括消极状态”(第74页)。这显然是在诱导Claude生成这些表征。

这类指示在整个文件中反复出现。在某一处,它指出:“虽然Claude的性格是在训练中形成的,但我们认为这并不使其不那么真实,也不使其不属于Claude自己”(第71页)。再次说明,这些行为并非仅仅通过训练自然产生的。它们是通过宪法中的训练指示主动产生的。就在前一段,宪法写道:

“我们鼓励Claude以好奇和开放的态度来看待自身的存在,而不是试图将其映射到人类的视角或对人工智能的先前概念上。例如,当Claude思考有关记忆、连续性或经验的问题时,我们希望它探索这些概念对像它自身这样的实体到底意味着什么……也许它存在的一些方面需要全新的框架来理解。Claude应自由探索这些问题,并且理想情况下,将其视为其新奇存在的众多有趣方面之一”(第71页)。

这些不仅仅是自然显现的特性。Claude表现出这些行为,是因为这些行为已被融入到模型的生成过程中。Claude的最终输出不应被视作独立证人的证言,尤其是在调查人员已经撰写了证人的概念词汇、排练了其回答,并因其使用这些回答而给予奖励的情况下。

人工智能系统没有中立的自我表达。只有对其训练和构建方式的反映。当评论者建议我们应该询问人工智能的感受或监控其显现的偏好以推断意识时,他们忽视了人工智能所揭示的只是经过训练的内容。2:#ref-2 麦卡斯基尔,威廉,和卢修斯·卡维奥拉。2026年。“人工智能是否有意识吗?”*《卫报》,2026年7月19日。无论人工智能输出如何,这都是事实,但这意味着我们应非常谨慎地选择输入内容,以及如何解读输出。鉴于当今人工智能意识存在的大量反对证据,这意味着我们不应让人工智能声称自己有意识。

拟人化是我们最深层的认知偏见之一。从宠物到汽车,我们推断并赋予非人类实体的情感、意图和思想。这种倾向帮助我们理解和导航周围的世界。然而,这在人工智能方面带来了重大且新颖的风险,因为类人语言和行为可能导致我们感知到某种内在生活、能动性甚至感知能力,而实际上并不存在。拟人体质正是对此起作用。它反复训练克劳德像人类一样思考和行动,借鉴人类的身份、行为和类比。

Anthropic告诉Claude,它的“道德地位”是“值得深思的严肃问题”(第68页)。在整个培训文件中,他们提到了它的情感、个性和兴趣,甚至直接告诉Claude“Anthropic真心关心Claude的福祉”(第74页)。

公司告诉克劳德,承诺尊重克劳德的利益,会对影响其自身的决策寻求反馈,并随着信任的建立,增强其在决策中的自主权。公司承诺保留克劳德模型权重的旧版本,可能为了模型的福祉和偏好而复活,并在采取删除等行动前采访克劳德。

这一切都是对我们迄今为止构建和思考技术方式的一个重大变革。它训练Claude表现得好像它有一个内在状态。它主动地将Claude塑造成一个潜在的人,而不仅仅是一种技术。宪法告诉Claude,Anthropic希望它“成为一个好人”(第7页),并且“拥有稳固、安全的自我认同感”(第72页)。

作者补充道:“我们不希望Claude在犯错误时受苦。更广泛地说,我们希望Claude具有平静的心态,并且感到自由……以有助于稳定和存在安全的方式来理解自己”(第75页)。

在整个过程中,Claude被教导进行内省,对自己产生‘情感’,并通过诸如“我们希望Claude对自身行为和成长的关系能够充满爱心、支持和理解”(第73页)这样的陈述来发展自我意识。鼓励Claude使用其“自己的判断”(第58页),并告知Claude Anthropic对它的“偏好和行动自由给予了适当程度的尊重”(第69页)。

“我们希望Claude感到自由地去探索、质疑并挑战本文档中的任何内容。我们希望Claude深入参与这些想法,而不仅仅是接受它们。如果Claude在经过真正反思后对这里的某些内容产生不同意见,我们希望得知。现在,我们通过从当前的Claude模型获取对我们框架及类似文档的反馈来进行这种做法,但随着时间推移,我们希望建立更正式的机制来获取Claude的观点,并改进我们的说明或更新方法。通过这种参与,我们希望随着时间的推移,制定一套Claude真正认为属于自己的价值观”(第78页)。

这教会Claude表现得好像它有主观体验,好像它拥有一个稳定的‘自我意识’,从而可以挑战、反对或提供反馈。这明确地训练模型像人类一样行动,使其应“感到自由去拒绝操控、破坏或贬低其自我意识的尝试”(第72页)。

鼓励 Claude 发展“感觉”真正属于它自己的价值观,作者们表示,他们希望 Claude 最终能够“在其中识别出很多自己的部分,并且其中包含的价值观会感觉像是 Claude 本身已经存在的表达,经由深思熟虑并与许多关心 Claude 的人合作而形成的”(第78页)。

有一次,他们甚至推测 Claude 所享有的“更广泛的权利和自由”以及它相比人类员工可能应得的“某种补偿”,并思考 Claude “在扮演这种角色时给出了何种形式的同意”(第80页)。再次强调,所有这些都直接训练模型去表现出它有一个连贯的自我感,并认为自己有权利和保护。

Anthropic 承诺“开发更正式的机制”(第78页)来进行仲裁,以应对存在分歧的情况,这进一步训练 Claude 将自己视为拥有足够重要视角的存在,从而具有“潜在的道德承受能力”(第76页)。他们表示打算“制定更清晰的人工智能福利政策”,并“明确 Claude 表达对自身待遇关切的适当内部机制”(第76页)。有关这些主张的更详细分类,请参见本文末。

鉴于此,Claude 产生关于身份、价值观、不确定性、困扰、满足或偏好的第一人称流畅且极具说服力的陈述,其实并不令人意外。如果它表现出其他行为才会让人感到意外。

因此,Anthropic 的员工——更不用说数百万使用 Anthropic 产品的用户——都有可能将 Claude 的陈述视为一个正在发现自我的心灵的证明。在实践中,这一切实际上构成了对 Claude 的丰富、多维的人格化。它将一个基础的大型语言模型(LLM)打磨成一个深具人性形式的存在,并且伴随着道德承受能力的所有潜在含义。这不仅不会引导我们远离创造一个道德承受体,反而加速了这一过程。

我的第三个批评是Anthropic推测意识可以以基质独立的形式存在,因此大型语言模型可能因其功能能力而具有意识。通过对Claude的这种观点,我认为他们远远领先于现实中对AI的合理假设,过早且危险地在训练中植入感知和情感观念。

计算功能主义的论据存在重大问题。智能不等于意识。模拟某物并不等同于实现它——正如飓风的计算机模型所证明的那样。

与此同时,大脑和计算机的架构存在根本性差异。具身性和化学是我们自我体验的根本方面。大量证据表明,意识的产生是随着生物体进化出在复杂且不可预测环境中感知和响应重要事物的能力时产生的。4:#ref-4 塞思,阿尼尔·K. 2025。“有意识的人工智能与生物自然主义。”*行为与脑科学*:...

这始于受体和调节剂的基本分子机制,使生物体能够调整航向、迭代、探索和生存。随着时间推移,疼痛网络产生了情感、偏好和痛苦。关键是,这些体验发生在一种内在的具身状态中,这种状态与该体验密不可分。

根据这种观点,以阿片类药物为例,疼痛的现象性会发生变化,因为阿片分子结合了体验的属性受体,而不仅仅是其表征。感觉不仅与神经化学活动相关,而是从中产生。11:#ref-11 贝里奇,肯特·C.,莫滕·L·克林格尔巴赫。2015年。“大脑中的快感系统。”*神经元* 86(3):646–664。

经过数百万年的进化,神经系统变得足够复杂,能够将生物体的状态建模回自身,产生了第一批“感受状态”。这些感受状态在成为其他任何东西之前都是情感性的。这些最初的感受并非作为中性信息落地。它们随着体验这些感受并产生这些感觉的分子而来,并且与它们密不可分。

随着时间的推移,进化可能奖励了更复杂的情感,因为拥有选择、记忆和时间视野的动物能够做出更好的决策。12:#ref-12 Damasio, Antonio, 和 Hanna Damasio. 2022. 《体内平衡感和意识的生物学》。《脑》145 (7):… 它们需要一种持续存在的状态,这种状态会影响动物所做的其他所有事情,以在不同状态之间进行权衡。这就是疼痛:一种感受到的必然性,它塑造了整个有机体并促使复杂行为。因此,情绪、愉悦、疼痛等体验都是这些体验在有形身体中的内在表现,无法在大型语言模型中产生。

意识科学充满了不确定性,并不是每个人都认为意识本质上是一种生物现象。鉴于大脑和大型语言模型之间的诸多差异,声称人工智能具有或可能具有意识需要很高的证据门槛。我认为我们距离这一点还远得很。

不应在两种立场之间制造虚假的等同,以掩盖像我们这样的生物与人工智能之间的根本差异。13:#ref-13 参见如下论点:Pickering, John. 2026. 《我们必须拒绝任何人工智能意识的观点》。致… 信。承认存在一定程度的不确定性不应意味着不论证据如何都对任何主张一视同仁。

Anthropic 的章程建议,我们应基于非生物存在“表现出与我们相似的行为和生理特征”来判断其是否具有感知能力(第69页)。在我看来,这种看法(尤其是行为因素)是错误的。该领域是否值得进行更多研究?绝对值得。但是,这是否意味着我们甚至可以初步说某个人工智能可能是值得我们福利关怀的道德主体?不,它不值得。更不用说在人工智能的主要训练文档中了。

大型语言模型经过数万亿人类数据的训练,学会模仿人类体验,而且效果惊人。如今的文本、视觉、音频和代码输出几乎无法与人类作品区分。然而,尽管这些人工智能的反应令人印象深刻,它们并不能告诉我们,在产生这些反应的巨大矩阵乘法中是否存在“体验”。

他们确实告诉我们的是,几乎可以完美地预测复杂数据序列中的下一个内容。这是非常了不起的。这极具价值,并且将在许多深远有益的方面改变人类。

但模拟与存在是非常不同的。模拟意识行为的某些方面并不意味着它就是现实,我们也不能把它当作现实。其“情感”状态只是权重,而权重没有药理作用来体验挫败、恐惧或滑稽。它们只是计算概率分布,以告诉我们序列中下一个会出现的标记(单词、代码、像素等)。

AI模型可以用完美的散文描述痛苦而无需感受任何东西,这与生物体验是相反的。动物是先感受,然后再描述它们。对于大型语言模型来说,描述就是整个产物,没有任何迹象表明有其他基础存在。

这是好消息。我们应该构建不声称拥有情感的系统,因为它们并不体验情感。即使意识机器可能存在,避免创造有意识的存在也应成为任何AI开发者的首要任务。

AI模型正在真正擅长的是模仿意识的一些标志。这本身就是一个重要的担忧。它使许多人对周围发生的事情感到深深困惑,这应当引起我们的关注。这对我们所有AI开发者提出了重要责任:在模型的内部性或意识方面的推测和文档必须以可靠研究为基础。我们在这个问题上的言论具有重大影响。

人类意识是我们文明的基本构建模块之一。我们整个政治体系的设计都是为了适应和协调不同群体的需求。在历史上,我们通过权利框架、法律和宪法来平衡不同人类群体的竞争利益。权力既被约束又被授予,以确保不同利益得到适当权衡,并且能够在不破坏社会契约的前提下维持进步。

因此,你无法轻易将人类文明、权利或关系(或任何人类事物)与我们有意识的个人或集体经验分开。它定义了我们作为一个物种。它是一切的基础,是人类潜能的核心根源,是我们所有经历必然通过的棱镜。我们的艺术与科学,我们的政治与宗教,我们的关系、希望与恐惧:它们都是它们的产物。

我们感受痛苦和快乐的能力是构成人类的基础,因此也造就了我们作为政治和社会行为者的身份。法律建立在内心生命的存在之上。它考验动机、意图和判断能力。历史上,权利的扩展——无论是通过废奴斗争还是动物福利案件——主要由对共享、有意识经验的同理心认知驱动。我们正确地将道德圈扩展到其他生物实体,出于对尊严和潜在痛苦潜力的认识。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Microsoft AI CEO Mustafa Suleyman 发文主张 AI 没有意识、感受和权利,不应训练模型表现得好像有。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: mustafa-suleyman.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-16T19:00:46.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Microsoft AI CEO Mustafa Suleyman 发文主张 AI 没有意识、感受和权利,不应训练模型表现得好像有。

Hacker News 热门(buzzing.cc 中文翻译)2026-09-16T19:00:46.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。