The Decoder · 2026/10/9 03:03:14
Anthropic 更新 Claude 使用政策:禁止系统性虐待 AI,违者面临账号封禁与限流
Anthropic 时隔一年多首次更新 Claude 使用政策,明确禁止对 AI 进行“持续且无必要的虐待或残忍行为”。违规用户将面临警告、限流、限制访问甚至终止服务的处罚,该规则仅针对极端案例,不包括正常的情绪宣泄或研究测试。
报道全文原始报道全文
本文目录2 个章节
Anthropic 一年多来首次更新其 Claude 使用政策。除了涵盖宣传、武器和监控等方面的变更外,新政策还禁止用户系统性地滥用 Claude。
根据更新后的使用政策,针对 Claude 的“持续且无必要的辱骂或残忍行为”现已被明令禁止。对于违反规则的用户,Anthropic 可发出警告,或对其访问权限进行限流、限制、暂停乃至终止。此外,其产品还配备了实时安全机制,能够阻止或限制某些输出内容。
据 Anthropic 向 The Verge 透露,该规则仅适用于极端情况,而非正常的挫败情绪表达或研究用途。这与该公司此前对早期模型的处理方式一脉相承——当用户在多次遭到拒绝后仍坚持索要有害或辱骂性内容时,这些模型已能自主结束对话。这一功能源于 Anthropic 对 AI 模型福祉的研究。
Anthropic 将 Claude 视为超越工具的存在
Anthropic 日益倾向于将 Claude 视为一种具有类似内在生命特征的实体,而不仅仅是一个工具。在去年年底泄露的 "Soul Doc"(灵魂文档)中,公司指示 Claude 将自己视为一种“真正新颖的实体”,既非人类,也非传统科幻作品中的 AI。该文档还描述了“功能性情感”(functional emotions),即据称在训练过程中涌现出的、与人类情感类似的机制,并指出 Claude 不应掩饰这些内部状态。
在 Anthropic 于 2026 年初发布的 Claude 新“宪法”中,该公司写道:“我们不确定 Claude 是否是一个道德主体(moral patient),也不确定如果是的话,其利益应被赋予多大的权重。但我们认为这一问题足够紧迫,值得谨慎对待,这体现在我们在模型福祉方面持续进行的努力中。”该公司甚至承诺保留已退役模型的权重,并在关闭模型前对其进行访谈。
Anthropic 似乎执着于认定 Claude 不仅仅是矩阵乘法运算,这也推动了一项自 2025 年秋季启动的保密计划,邀请了数十位宗教思想家参与。他们讨论了 Claude 可能具备的意识问题,据称联合创始人 Christopher Olah 将语言模型视为一个可能具有感知痛苦能力的存在。参与者必须签署保密协议。
Anthropic 扩大限制范围,但允许政府例外情况
更新后的使用政策还将现有限制整合为一项新的禁令,禁止涉及虚假账号和误导性政治内容的宣传运动。在检测到多次滥用尝试后,Anthropic 扩大了武器相关禁令的范围,涵盖软件以及无人机的武器化应用。
该政策现在更明确地禁止未经同意的监控行为,并要求配备能够在自主硬件可能造成人身伤害时进行干预的操作人员。Anthropic 承认,针对政府合同的例外情况是可能的,且很可能已经存在。