Le « watermarking » par IA est une stratégie de détection basée sur l'IA qui consiste à modifier la manière dont les modèles de langage de grande envergure (LLM) rédigent leurs textes. Découvrez comment cela fonctionne, qui l'utilise, pourquoi cette technique peut échouer et quel est son lien avec Pangram.
Le « watermarking » est une méthode permettant de détecter les contenus générés par l'IA qui repose sur la manipulation de la fréquence à laquelle un modèle de langage de grande envergure (LLM) utilise certains mots. Il est alors possible de détecter ces variations de fréquence et de déterminer si un texte a été rédigé par un modèle d'IA spécifique.
Les LLM fonctionnent ainsi : on leur fournit une série de mots, puis ils génèrent une liste de mots susceptibles de suivre ces mots dans la phrase. C’est ainsi que les IA écrivent : elles lisent une phrase et produisent une liste de mots pouvant venir ensuite dans la phrase. À chacun de ces mots est attribuée une probabilité indiquant dans quelle mesure le LLM souhaite le placer ensuite. Ensuite, le LLM choisit dans cette liste un mot à insérer, mais pas nécessairement (ni même généralement) le mot le PLUS probable – si, pour n’importe quelle phrase, par exemple « Je promène mon… », le LLM choisissait toujours le mot le plus probable, à savoir « chien », les LLM répondraient toujours la même chose chaque fois qu’on leur poserait la même question.
Vous disposez donc d'une phrase incomplète et d'une liste de mots possibles parmi lesquels choisir. C'est dans le processus par lequel le LLM choisit le mot suivant que le « watermark » entre en jeu : il ajuste les probabilités associées à ces choix de mots suivants.
On peut également l'exprimer ainsi : considérons l'ensemble des mots qu'un LLM pourrait utiliser, c'est-à-dire tous les mots qu'un modèle d'IA pourrait éventuellement prononcer. Nous appellerons cela le « vocabulaire » du LLM. Le « watermarking » consiste à sélectionner de manière pseudo-aléatoire un sous-ensemble de ce vocabulaire, puis à appliquer à son score un minuscule modificateur qui augmente la probabilité que certains mots soient choisis.
Un sous-ensemble du vocabulaire du LLM, sélectionné de manière pseudo-aléatoire, est marqué d'un filigrane
Ainsi, lorsque le LLM établit une liste classée de mots potentiels, le modificateur fait en sorte que ceux-ci apparaissent légèrement plus haut dans la liste qu'ils ne le seraient autrement, et qu'ils aient donc plus de chances d'être choisis.
Les mots marqués d'un filigrane remontent légèrement dans le classement des mots suivants établi par le LLM
Le filigrane est détecté en analysant le texte de sortie et en déterminant la fréquence d'apparition des mots comportant le filigrane. S'ils apparaissent plus fréquemment dans le texte que dans un texte anglais de référence, le résultat est considéré comme positif, et le détecteur de filigrane indique alors que le texte a été généré par une IA.
Les filigranes générés par l'IA sont invisibles, et des études indiquent que cette technique n'altère pas la qualité des résultats. Cela peut sembler contre-intuitif : si les filigranes modifient la probabilité d'apparition de certains mots dans la sortie d'un modèle de langage de grande envergure (LLM), cela ne devrait-il pas être perceptible par un être humain, tout comme on remarque lorsque les LLM utilisent des mots tels que « delve »?
Cela s'explique par le fait que la liste des mots marqués est générée à chaque token. En d'autres termes, le sous-ensemble de mots du vocabulaire sélectionnés pour être marqués change à chaque nouveau mot de la phrase. Il en résulte une variance bien plus importante au sein du vocabulaire que ce à quoi on pourrait s'attendre si l'ensemble des mots marqués était un ensemble fixe et prédéterminé.
Les filigranes présentent plusieurs avantages pour la détection par IA. Tout d’abord, le filigranage permet d’atteindre un haut degré de certitude avec un nombre relativement faible de mots, même si, comme avec Pangram, ce degré de certitude diminue à mesure que les segments raccourcissent. Les filigranes sont également spécifiques à chaque modèle : alors que Pangram se contente d’indiquer si un texte a été généré par une IA, le filigrane permet de déterminer exactement quel modèle d’IA a produit ce texte. Cependant, un résultat positif obtenu avec un filigrane est lui aussi spécifique au modèle : si vous soumettez un texte généré par ChatGPT à un détecteur de filigrane Claude, vous obtiendrez un résultat négatif, car le filigrane n’apparaît que dans les textes rédigés par Claude.
Le tatouage numérique est également facile à mettre en œuvre pour les entreprises spécialisées dans l'IA : les tatouages numériques peuvent être intégrés à un coût relativement faible et ne nécessitent pas de réentraînement du modèle pour être utilisés.
Le tatouage numérique est fragile et peut être facilement contourné par des stratégies algorithmiques auxquelles Pangram résiste, comme les « humaniseurs ». Il est facile de déjouer un détecteur de tatouage numérique basé sur l’IA en remplaçant des mots par des synonymes, car le tatouage est intégré dans le choix des mots. Le tatouage numérique est également binaire : le détecteur de Pangram peut distinguer les contenus générés par IA de ceux mixtes (humain/IA), tandis que le tatouage numérique se contente d'indiquer si un texte est passé par un modèle de langage (LLM) en tant qu'étape finale avant de vous parvenir.
Si le tatouage numérique permet de déterminer si un modèle a rédigé un texte, un résultat négatif obtenu avec un détecteur de tatouage numérique ne signifie pas pour autant que le texte n'a pas été généré par une IA, ni même qu'il n'a pas été généré par le modèle en question : cela indique simplement que le tatouage numérique propre à ce modèle n'y figure pas. Le texte pourrait très bien avoir été rédigé par un autre modèle, ou avoir été traité par un « humaniseur » ou un programme similaire qui a remplacé certains mots du texte par des synonymes.
Oui, à l'heure actuelle, les modèles Claude utilisent un filigrane généré par IA afin de se conformer à la réglementation européenne : Anthropic a commencé à apposer un filigrane sur les résultats de Claude le 2 août 2026, comme l'entreprise l'a annoncé sur son blog.
| Prestataire | Filigrane textuel | Code de bonnes pratiques de l'UE signé | Qui peut vérifier cela ? |
|---|---|---|---|
| Gemini (Google) | Oui, SynthID-Text est disponible sur Gemini depuis 2024 | Oui | Détecteur SynthID de Google (accès restreint) |
| Claude (Anthropic) | Oui, depuis le 2 août 2026 | Oui | API de détection anthropique (aperçu privé) |
| ChatGPT (OpenAI) | Non | Oui | Pas de vérificateur de texte |
| Meta AI (Meta) | Non | Oui | Pas de vérificateur de texte |
| Copilot (Microsoft) | Non | Oui | Pas de vérificateur de texte |
| Mistral | Non | Oui | — |
| Grok (xAI) | Non | Non | — |
| Modèles à poids ouvert (Llama, DeepSeek, etc.) | Non | — | — |
À l'heure actuelle, ChatGPT n'utilise pas de filigrane IA, et il n'existe aucun détecteur ou outil de vérification fiable permettant de repérer les filigranes IA dans les textes générés par ChatGPT.
Le tatouage numérique par IA n'a pas beaucoup d'effet sur la détection par IA de Pangram. En effet, comme le tatouage numérique ne fait que modifier subtilement les scores de probabilité des mots utilisés par les modèles de langage grand échelle (LLM), les résultats générés par ces modèles et comportant un tatouage numérique resteront détectables par Pangram.
En fin de compte, le marquage ne permet d’identifier que les résultats d’IA les plus évidents et non modifiés, pour lesquels aucun effort n’a été fait pour dissimuler l’utilisation de l’IA. Notre objectif est d’adopter une approche beaucoup plus fine et de faire la distinction entre l’assistance par l’IA, les textes mixtes (IA/humain) et les textes entièrement générés par l’IA. Contrairement aux détecteurs de marquage, nous ne nous intéressons pas au modèle utilisé pour générer le texte.
Nous considérons que le tatouage numérique par IA est complémentaire à Pangram. Nous pensons également qu'il est globalement bénéfique pour la société d'avoir davantage de transparence concernant la paternité des contenus générés par l'IA.
ChatGPT comporte-t-il un filigrane ?
Non, ChatGPT n'appose pas de filigrane sur ses textes. OpenAI a développé un système permettant d'apposer des filigranes sur les textes en 2024, mais ne l'a jamais commercialisé.
Qu'est-ce que SynthID ?
SynthID est le filigrane de Google utilisé dans les modèles Gemini depuis 2024.
Comment puis-je vérifier si un texte comporte un filigrane généré par l'IA ?
Les détecteurs de filigranes basés sur l'IA sont mis à disposition par l'entreprise qui a développé le modèle ; par conséquent, pour vérifier la présence d'un filigrane dans un texte, il faut que cette entreprise donne accès à la clé privée qu'elle a utilisée pour générer le filigrane. Au 14 septembre 2026, aucune entreprise spécialisée dans l'IA n'avait encore rendu public un détecteur de filigranes basé sur l'IA pour le texte, bien que Gemini dispose d'un détecteur d'images accessible au public.
Pangram détecte-t-il les filigranes générés par l'IA ?
Pangram ne prend actuellement pas en charge la détection des filigranes par IA.

Annamieka est rédactrice technique chez Pangram.






