人工智能教育

什么是AI水印?

AI水印是一种通过操纵大型语言模型(LLM)的生成方式来实现的AI检测策略。了解其工作原理、应用场景、失效原因,以及它与Pangram之间的关联。

2026年9月14日

水印技术是一种检测AI生成内容的方法,其原理在于分析大型语言模型(LLM)使用特定词汇的频率变化。通过检测这些词频变化,可以判断一段文本是否由特定的AI模型生成。

水印是如何工作的?

大型语言模型(LLM)的工作原理是:输入一组单词,然后输出在句子中可能紧跟在这些单词后面的单词列表。这就是人工智能的写作方式:它读取一个句子,并生成一个可能出现在句子后面的单词列表。每个单词都会被赋予一个概率值,表示LLM希望将其放在下一位的可能性。 随后,LLM会从该列表中选择一个词作为实际的后续词,但并不一定(甚至通常不会)选择概率最高的那个词——如果面对任何句子,例如“我遛我的……”,LLM总是选择概率最高的词“狗”,那么每当被问到同样的问题时,LLM给出的答案就会千篇一律。

因此,你手头有一个不完整的句子,以及一份可供选择的可能后续词汇列表。大语言模型(LLM)选择下一个词的过程正是“水印”发挥作用之处:它会微调这些后续词汇选择的概率。

换一种说法如下。考虑一个大型语言模型(LLM)可能使用的词汇集合——即人工智能模型可能说出的任何词汇。我们将此称为该LLM的词汇表。水印技术的工作原理是:从词汇表中伪随机地选取一个子集,并对其得分应用一个微小的调整因子,从而提高某些词汇被选中的概率。

对大型语言模型(LLM)词汇表中通过伪随机方式选取的子集进行水印处理对大型语言模型(LLM)词汇表中通过伪随机方式选取的子集进行水印处理

因此,当大型语言模型(LLM)生成潜在词汇的排序列表时,修饰词会使其在列表中的排名比原本略高一些,从而更可能被选中。

带有水印的单词在LLM的下一个单词排序列表中排名略有上升带有水印的单词在LLM的下一个单词排序列表中排名略有上升

水印的检测是通过分析输出文本,并确定带有水印的词汇出现频率来实现的。如果这些词汇在文本中的出现频率高于标准英语中的出现频率,则被视为阳性结果,水印检测器会判定该文本由人工智能生成。

AI水印长什么样?

AI水印是不可见的,研究表明,AI水印技术不会降低输出结果的质量。这似乎有悖常理:如果水印改变了某些词在大型语言模型(LLM)输出中出现的概率,人类难道不应该能察觉到吗?就像我们能察觉到LLM使用“delve”这样的词时一样?

这是因为水印词表是在处理每个词元时生成的。也就是说,被选中作为水印的词汇子集会随着句子中每个新词的出现而变化。这意味着词汇的变异性要比水印词集是一个固定且预先确定的词汇集合时所预期的要大得多。

AI水印有哪些优势?

水印在AI检测中具有多重优势。首先,水印技术仅需相对较少的词汇即可实现较高的确定性,尽管与Pangram类似,随着片段变短,确定性会随之降低。 水印检测结果还具有模型特异性——虽然全字母句(Pangram)只能判断文本是否由AI生成,但水印检测能够精确指出是哪种AI模型生成了该文本。不过,水印检测的阳性结果同样具有模型特异性:如果将ChatGPT生成的文本输入到Claude水印检测器中,系统会返回阴性结果,因为该水印仅出现在Claude生成的文本中。

对于人工智能公司而言,水印技术也易于实现:水印的实现成本相对较低,且无需重新训练模型即可使用。

人工智能水印能被破解吗?

水印技术较为脆弱,很容易被Pangram能够有效抵御的算法策略(如“人性化处理”技术)所突破。只需将单词替换为同义词,就能轻松绕过AI水印检测器,因为水印正是嵌入在词汇选择中的。 水印技术还具有二元性:Pangram的检测器能够区分AI辅助生成和人类与AI混合生成的内容,而水印技术只能告诉你,一段文本在传到你手中之前,是否作为最后一步经过了大型语言模型(LLM)的处理。

虽然水印技术可以告诉你一段文本是否由某个模型生成,但水印检测器得出的阴性结果并不能说明该文本不是由AI生成的,甚至不能说明它不是由该特定模型生成的:它仅仅表明该模型的水印并未出现在文本中。 该文本很可能由另一个模型生成,或者经过“人性化处理”程序(humanizer)或其他类似程序的处理,将文本中的某些词替换为同义词。

Claude 是否实现了 AI 水印技术?

是的,目前,Claude 模型采用 AI 水印技术以符合欧盟法规:正如 Anthropic在其博客中宣布的那样,该公司已于 2026 年 8 月 2 日开始对 Claude 的输出结果添加水印。

服务提供商文字水印已签署的《欧盟行为准则》谁可以检查一下
Gemini(谷歌)是的,自2024年起,Gemini已支持SynthID-Text功能是的谷歌的SynthID检测器(访问受限)
克劳德(Anthropic)是的,自2026年8月2日起是的Anthropic 检测 API(私有预览版)
ChatGPT(OpenAI)不是的无文本检查器
Meta AI(Meta)不是的无文本检查器
Copilot(微软)不是的无文本检查器
米斯特拉尔不是的—
Grok (xAI)不不—
开放权重模型(Llama、DeepSeek 等)不——

目前,ChatGPT 尚未实现 AI 水印功能,且尚无针对 ChatGPT 生成的文本的可靠 AI 水印检测器或验证工具。

水印会影响“全字母句”吗?

AI水印技术对Pangram的AI检测影响不大。因为水印只是微妙地调整了大语言模型(LLM)所用单词的概率得分,因此带有水印的大语言模型输出仍可被Pangram检测出来。

归根结底,水印技术只能标记那些最明显且未经修改的AI生成的内容——即完全没有试图掩盖AI使用痕迹的情况。我们的目标是实现更精细的区分,能够区分AI辅助生成的文本、AI与人类混合生成的文本,以及完全由AI生成的文本。此外,与水印检测器不同,我们对用于生成文本的模型不作任何假设。

我们认为人工智能水印技术是对Pangram的补充。我们也认为,在人工智能创作归属方面提高透明度,总体上对世界是有益的。

常见问题解答

ChatGPT 上有水印吗?

不,ChatGPT 不会在文本中添加水印。OpenAI 曾在 2024 年开发了一套文本水印系统,但从未发布过。

什么是 SynthID?

SynthID 是谷歌自 2024 年起在 Gemini 模型中使用的水印。

如何检查一段文字中是否含有AI水印?

AI水印检测器由开发该模型的公司发布,因此要对文本进行水印检测,需要该公司提供用于生成水印的私钥访问权限。截至2026年9月14日,尚无任何AI公司公开发布过针对文本的AI水印检测器,尽管Gemini已推出了一款公开的图像检测器。

“Pangram”能检测到AI水印吗?

Pangram 目前不支持 AI 水印检测功能。


安娜米卡·阿茨

安娜米卡是 Pangram 的一名技术撰稿人。

查看安娜米卡·阿茨的更多内容