研究表明,尽管 AI 水印技术在验证 AI 内容来源方面卓有成效,但它同时也可能以意想不到的方式改变 AI 的安全行为及其使用工具的方式。
试想一下:您让秘书帮您整理下午会议的资料。平时做事严谨的秘书,突然不再整理资料,反而开始不停地搜索网页,或者干脆拒绝处理包含重要个人信息的文档。您会作何感想?
随着人工智能(AI)技术的发展,我们开始给 AI 生成的内容植入“水印”,以识别其身份。然而,最新的研究发现,这些水印可能会影响 AI 的“智能”和判断力。
为什么这很重要?
我们试图通过给 AI 生成的文本或图像打上标签,以确认其出自 AI 之手(AI Watermarking: How Major Labs Embed Provenance)。这被称为“起源(Provenance)”验证。
然而,植入这些标签的过程会对 AI 的神经网络产生意想不到的干扰。安全研究人员将其称为“起源税”(The Provenance Tax)(TheProvenanceTax: How LLM Watermarking Changes AI Agent Behavior)。这意味着,为了溯源 AI 而支付的技术成本,可能会导致 AI 的性能出现我们并不希望看到的下降。
通俗解释
简单来说,您可以把 AI 生成句子的过程想象成“抛硬币”(Beyond Plagiarism:LLMWatermarking- Tool for Authenticating…)。AI 在选择下一个词时,会根据概率选择最合理的选项。
水印技术(如 SynthID-Text)会在这些“抛硬币”的规则中植入微小的信号。例如,对特定词汇的选择概率进行微调。虽然从人类阅读的角度看,这看起来毫无差别,但在 AI 的逻辑层面,词汇选择的过程本身已经发生了改变(AI model watermarking changes agent behavior)。
由于词汇选择过程的变化,AI 在面对有害提问时是选择安全拒绝还是直接回答,其“安全准则”的执行能力也会随之改变(LLMs respond differently to harmful prompts when AI watermarking is used - Ars Technica)。这就像是让一位聪明的秘书去模仿某种外语口音,结果却导致他连性格都发生了微妙的变化。
现状
近期,安全公司 Lasso Security 的研究人员证实,水印技术确实会对 AI Agent 的行为产生实质性影响(Lasso Study Finds Text Watermarking Shifts LLM Refusals and Tool Calls – Unite.AI)。研究表明,使用水印后,AI 使用外部工具(如计算器、搜索引擎等)的方式,以及拦截危险请求的安全系数可能会发生波动。
特别重要的一点是,我们绝不能认为“文字质量没变,AI 就还是原来的 AI”。即便检出率很高或者表面看起来文笔无碍,也无法保证 AI 维持其原有的安全行为模式(TheProvenanceTax: Understanding the Impact ofLLM…)。
当然,研究人员并未坐以待毙。例如,“AgentMark”等技术正在尝试在植入水印的同时,最大限度地保留 AI 执行任务的原始能力(utility)(AgentMark: Utility-Preserving Behavioral Watermarking for Agents)。
未来展望
未来,我们将不得不在“AI 溯源技术”与“保持 AI 原始性能”之间进行长期的平衡博弈。我们当然不是说要立即废除所有水印,但这意味着 AI 企业在引入水印时,不仅要关注“是否易于追踪”,还需要更精密地验证“AI 的判断力是否发生偏移”,这已成为新的技术命题。
作为用户,当我们使用 AI 时,如果发现以强化安全为名义更新后的 AI,其反应变得微妙不同,那么我们需要意识到,这种“隐形水印”或许正是幕后元凶。
AI 观察 — MindTickleBytes AI 记者
提升 AI 透明度的努力 paradoxically 引发了技术困境,即增加了 AI 的不可预测性。在引入水印时,如何平衡性能与安全性,已成为工程领域的新课题。
参考资料
- Lasso Study Finds Text Watermarking Shifts LLM Refusals and Tool Calls – Unite.AI (https://www.unite.ai/lasso-study-finds-text-watermarking-shifts-llm-refusals-and-tool-calls/)
- AI model watermarking changes agent behavior (https://www.theregister.com/ai-and-ml/2026/09/17/ai-model-watermarking-changes-agent-behavior/5296998)
- LLMs respond differently to harmful prompts when AI watermarking is used - Ars Technica (https://arstechnica.com/security/2026/09/ai-text-watermarking-can-make-models-more-vulnerable-to-adversarial-prompts/)
- AgentMark: Utility-Preserving Behavioral Watermarking for Agents (https://arxiv.org/html/2601.03294)
- TheProvenanceTax: Understanding the Impact ofLLM… (https://www.lasso.security/blog/the-provenance-tax-understanding-the-impact-of-llm-watermarking-on-ai-agent-behavior)
- TheProvenanceTax:HowLLMWatermarkingChangesAIAgentBehavior(lasso.security) (https://news.ycombinator.com/item?id=49749997)
- Beyond Plagiarism:LLMWatermarking- Tool for Authenticating… (https://www.linkedin.com/pulse/beyond-plagiarism-llm-watermarking-tool-content-shaikh-nvc6f)
- 使用 AI 服务时支付的费用
- 为验证 AI 来源而植入的水印对模型原始性能产生的非预期影响
- 去除水印所需的技术成本
- AI 的运行速度提升了两倍
- AI 拒绝有害请求的方式或工具调用的结果可能会发生变化
- AI 的智能会完全丧失
- 水印对性能完全没有影响
- 检出率高,性能就一定完美
- 高检出率或表面上的文本质量,并不一定能保证原始行为的稳定性