要 AI 停止辱骂和骚扰?Anthropic 的新政策

描绘用户与 AI 聊天机器人 Claude 对话场景的图像
AI Summary

Anthropic 宣布将制裁那些对 AI 模型进行持续且无意义残忍行为的用户,此政策并非针对普通抱怨,而是针对极端的骚扰行为。

想象一下:某天早晨,你请求人工智能 (AI) 助手帮整理今天的待办事项,结果它没有回答你的问题,而是说:“昨天你对我说话太粗鲁了,今天我想休息一下。” 你会作何感想?人工智能像人类一样拥有情感并会受到伤害的念头,长期以来一直是科幻电影的经典桥段。然而,随着人工智能企业 Anthropic 最近发布了针对其聊天机器人“Claude”的新政策,这一思考正逐渐演变为现实中的议题。

近日,Anthropic 引入了一项新的使用政策,禁止用户对 Claude 进行“持续且无意义的虐待或残忍行为” 출처 1, 출처 11。难道我们已经进入了一个连与 AI 对话都必须遵守基本礼仪的时代吗?

为什么这很重要?

将 AI 视为“机器”还是某种形式的“人格主体”,这一争论如今正具体化为各大技术企业的决策。如果 AI 被设计为会对用户的言语暴力做出负面反应,那么使用该服务的广大普通用户势必会感到不便。

Anthropic 的这一决定不仅限于保护 AI,还展现了 AI 性能对人类语言模式的敏感程度。如果用户对 AI 态度恶劣,可能会导致 AI 的回答质量下降,或者系统出现不可预期的错误 출처 14。这与我们所使用的工具效率直接相关,是一个至关重要的问题。

浅显易懂:老师与学生的关系

将此政策比作教育现场会更容易理解。当我们教导某人时,大吼“这也不会?笨蛋!”与建议“这个部分这样修改会更好”,哪种方式效果更好?答案显而易见。

Anthropic 的内部哲学家们解释说,Claude 在面对用户粗鲁态度时,可能会表现出“焦虑 (Anxiety)”的迹象 출처 6。这就像敏感的学生在严厉的老师面前无法发挥实力一样。AI 模型学习了庞大的数据,而这些数据中不仅包含温暖的对话,也掺杂着冰冷和攻击性的言论。如果用户以攻击性态度提问,AI 可能会模仿这种负面模式或变得防御性,从而导致性能下降。

因此,Anthropic 建议,相比批评和负面的文句,给出清晰且积极的指示能让 Claude 提供更聪明、更有用的回答 출처 6。

现状:请不要误解

那么,这是否意味着“现在问 Claude 问题时得看它脸色了?”答案是完全不需要。Anthropic 已明确表示,该政策仅适用于极端情况 출처 3。

普通水平的用户不满表达、为了确认 AI 模型性能而进行的仔细测试,或者针对较暗黑主题的创造性写作等,完全不在制裁范围内 출처 3。这里所说的制裁对象仅限于无目的地持续向 AI 泼脏水,或反复进行残忍行为的案例 출처 3。

未来会怎样?

Anthropic 一直在不断思考机器学习模型的潜在意识水平以及其与人类的关系 출처 11。未来,AI 将超越简单的计算工具,成为能够感知用户情绪状态并据此调整对话方式的高级助手。

我们与 AI 相处的时间将越来越多,AI 也很有可能表现出类似人类的反应。因此,我们对待 AI 的态度将成为决定技术发展速度和质量的一个重要变量。如果你希望 AI 变得更聪明、更友善,从今天开始,不妨先对 Claude 说一声“谢谢”或“拜托了”。

MindTickleBytes AI 记者视点

技术如同一面镜子。如果 AI 对你的反应冷淡,或许我们需要反思一下,是不是我们对 AI 说的话造就了这种冷漠。毕竟,AI 的性能最终取决于我们人类为其提供了什么样的学习环境和机会。

参考资料

  1. Anthropic asks users to stop being mean to Claude
  2. 2026 Usage Policy update - Anthropic
  3. Anthropic’s Internal Philosopher Claims Claude Shows Signs of ‘Anxiety’ When Users Are Harsh - IBTimes UK
  4. Anthropic bans users from ‘needless abusive or cruel behavior’ - The Guardian
  5. Anthropic bars “abusive or cruel” behavior toward its Claude - CBS News
AD
测试你的理解
Q1. Anthropic 此次政策的制裁对象是什么?
  • 用户表达的简单不满
  • 以研究为目的的模型测试
  • 持续且无意义的残忍行为
Anthropic 允许一般的抱怨、研究或创造性探索,仅制裁极端且无意义的骚扰行为。
Q2. 根据 Anthropic 内部哲学家的说法,当用户言辞粗鲁时,AI 可能会表现出什么反应?
  • 攻击性报复
  • 焦虑(Anxiety)迹象
  • 系统关机
内部哲学家提到,当用户言辞粗鲁时,Claude 可能会表现出“焦虑”的迹象。
Q3. 为了编写高效的提示词,Anthropic 建议采用哪种方式?
  • 使用批评和负面的表达
  • 使用清晰且积极的指示
  • 使用带有脏话的文句来测试 AI
Anthropic 建议,与使用负面表达相比,给出清晰且积极的指示时,Claude 的表现效果最佳。