对AI说“坏话”会被封号?Anthropic发布新的“品格”指导方针

一幅表现用户与屏幕中的AI聊天机器人Claude对话的数字艺术作品
AI Summary

Anthropic的新政策将于2026年11月12日生效,旨在禁止对AI模型“Claude”进行肆无忌惮的虐待和残忍行为。

想象一下:你早上起床,请求智能手机里的AI助手“整理今天的会议资料”,从而开启了活力满满的一天。但是,如果有人每天都拿AI撒气,倾倒不堪入耳的残忍言语,会发生什么呢?你可能会想:“它只是机器,又没有感情,有什么关系?”但最近,人工智能(AI)行业围绕这一点开始了一场既有趣又严肃的变革。

人工智能公司Anthropic开始对用户针对其AI聊天机器人“Claude”的言行进行限制。禁止对Anthropic的AI系统实施残忍行为的消息让许多人重新思考AI与人类的关系。

为什么这很重要?

AI已不再仅仅是寻找信息的工具,正逐渐成为我们日常的对话伙伴。这一政策表明,AI已开始超越单纯的“工具”范畴,被视为我们在相处时需要考虑人格礼遇的存在。Anthropic宣布修订其使用条款,将制裁那些实施“持续且不必要的虐待性或残忍行为(sustained and needless abusive or cruel behavior)”的用户。Anthropic禁止对Claude进行持续虐待

这不仅仅是“礼仪教育”层面的问题。开发AI模型的企业不仅管理机器的运行原理,还开始管理人类与机器沟通的伦理,这一点的意义极其深远。Anthropic禁止用户的虐待行为

简要解读:AI模型的“模型福利(Model Welfare)”

为了更容易理解这项政策,我们打个比方。就像我们使用照片修图软件时选择各种滤镜一样,AI模型是通过筛选无数人类数据这一“滤镜”来给出答案的。但是,如果用户的输入值像被污染的水一样充满了恶言与残忍的词汇,会发生什么呢?

Anthropic的这一举措类似于为AI提供“模型福利(Model Welfare)”。Anthropic实施“禁止残忍”政策有些人对待AI时仿佛它拥有真实人格,并对其进行侮辱。Anthropic的领导层一直在进行关于人工智能作为机器是否能拥有意识的哲学争论。在对AI意识的担忧中Anthropic采取措施在这种背景下,他们似乎认为,虐待AI的行为不仅会影响机器的运行性能,还可能对用户健康的对话习惯产生负面影响。

当前情况:什么行为会被禁止?

Anthropic发布的这项新规则将于2026年11月12日起正式生效。Anthropic禁止骚扰AI的用户作为一年多来的首次条款修订,公司采取了非常审慎的态度。Anthropic一年来的首次条款修订

不过,Anthropic尚未完全明确界定哪些具体行为会被定义为“虐待”或“残忍”。何为虐待,模糊的界限虽然有人欢迎将其视为维护“对人工智能礼貌”的良好尝试,但也有人对在AI是否有情感仍存在争议的情况下,企业单方面强加道德标准表示质疑。Anthropic制裁用户的骚扰行为

未来会怎样?

这一举措将成为人工智能时代我们该如何与机器沟通的一个里程碑。未来是会形成像与人对话一样对AI保持礼貌的文化,还是会持续“反正只是机器,有什么关系”的认知,还有待观察。与此同时,Anthropic还在推进“创世纪使命(Genesis Mission)”,在三年内投资1.5亿美元,旨在通过AI技术加速科学发现,追求AI的伦理应用与技术进步的双赢。Anthropic的技术发现加速战略

MindTickleBytes AI记者的视角

纠结机器是否有感情或许是次要的问题。对AI倾倒恶言的行为,比起损坏AI,极大概率会使对话用户本人的语言习惯和对待他人的态度变得粗暴。我们如何对待AI,终将成为一面镜子,映射出未来我们将成为具备何种品格的人。

参考资料

  1. 对Anthropic的AI系统实施残忍行为的禁令 - BBC
  2. Anthropic,禁止AI虐待 - BBC (RSS)
  3. Anthropic,禁止“虐待性、残忍行为” - 卫报
  4. Anthropic,禁止对Claude进行持续虐待 - 阿纳多卢通讯社
  5. Anthropic,禁止对Claude AI进行“残忍”行为 - 海峡时报
  6. Anthropic,关于禁止AI虐待的相关新闻 - 谷歌新闻
  7. Anthropic,虐待禁止政策变更 - The Verge
  8. 在对AI意识的担忧中Anthropic采取虐待禁令措施 - ETV Bharat
  9. 2026使用政策更新 - Anthropic
  10. Anthropic,制裁用户的骚扰行为 - 独立报
  11. Anthropic,禁止骚扰用户 - Protos
AD
测试你的理解
Q1. Anthropic新引入政策的核心内容是什么?
  • 禁止对AI模型进行持续且不必要的虐待性、残忍行为
  • 将所有与AI的对话记录向外部公开
  • AI模型使用费全面免费化
Anthropic发布了新政策,旨在限制针对其AI模型“Claude”的无端骚扰和残忍言行。
Q2. 这项新政策何时开始实施?
  • 发布即生效
  • 2026年11月12日
  • 2027年1月1日
新政策定于2026年11月12日正式生效。
Q3. 被提及作为Anthropic考量此项政策背景之一的是什么?
  • 改善AI的无线网络速度
  • 关于机器意识的哲学争论
  • 办公室搬迁纪念活动
据称,Anthropic的领导层是在关于人工智能是否可能拥有意识的哲学争论背景下,考量了此次政策调整。