Il watermarking basato sull'intelligenza artificiale è una strategia di rilevamento che prevede la manipolazione del modo in cui i modelli di linguaggio di grandi dimensioni (LLM) generano i testi. Scopri come funziona, chi lo utilizza, perché a volte fallisce e in che modo è collegato a Pangram.
Il watermarking è un metodo per individuare i contenuti generati dall'intelligenza artificiale che si basa sulla manipolazione della frequenza con cui un modello di linguaggio di grandi dimensioni (LLM) utilizza determinate parole. È quindi possibile rilevare tali variazioni nella frequenza delle parole e stabilire se un testo sia stato scritto da un determinato modello di intelligenza artificiale.
I modelli di linguaggio di grandi dimensioni (LLM) funzionano inserendo una serie di parole e generando poi una serie di parole possibili che potrebbero seguire quelle parole nella frase. È così che scrivono le intelligenze artificiali: leggono una frase e producono un elenco di parole che potrebbero seguire nella frase. A ciascuna di queste parole viene assegnata una probabilità che indica quanto l’LLM sia propenso a inserirla come parola successiva. Successivamente, l’LLM sceglie da quell’elenco una parola da inserire effettivamente dopo, ma non necessariamente (e nemmeno di solito) la parola successiva ASSOLUTAMENTE PIÙ probabile: se, data una frase qualsiasi, ad esempio «Porto a spasso il mio…», l’LLM scegliesse sempre la parola successiva più probabile, ovvero «cane», gli LLM direbbero la stessa cosa ogni volta che venisse loro posta la stessa domanda.
Quindi hai una frase incompleta e un elenco di possibili parole successive tra cui scegliere. Il processo attraverso il quale il modello di linguaggio di grandi dimensioni (LLM) sceglie la parola successiva è proprio il punto in cui entra in gioco la “filigrana”: consiste nel modificare leggermente le probabilità associate a quelle possibili scelte di parole successive.
Un altro modo per spiegarlo è il seguente. Consideriamo l’insieme delle parole che un LLM potrebbe utilizzare, ovvero qualsiasi parola che un modello di IA potrebbe mai pronunciare. Lo chiameremo “vocabolario dell’LLM”. Il watermarking funziona selezionando in modo pseudocasuale un sottoinsieme del vocabolario e applicando al relativo punteggio un minuscolo modificatore che aumenta la probabilità che alcune parole vengano scelte.
A un sottoinsieme del vocabolario dell'LLM, selezionato in modo pseudocasuale, viene applicata una filigrana
Quindi, quando l'LLM genera un elenco ordinato di parole potenziali, il modificatore fa sì che queste si trovino leggermente più in alto nell'elenco rispetto a quanto accadrebbe altrimenti, e quindi abbiano maggiori probabilità di essere scelte.
Le parole contrassegnate da un watermark salgono leggermente nella classifica delle parole successive stilata dall'LLM
La filigrana viene rilevata analizzando il testo in uscita e determinando la frequenza con cui compaiono le parole contrassegnate dalla filigrana. Se queste compaiono nel testo con una frequenza maggiore rispetto a quella che si riscontra nell’inglese di riferimento, il risultato viene considerato positivo e il rilevatore di filigrane indica che il testo è stato generato dall’intelligenza artificiale.
I watermark generati dall'IA sono invisibili e alcuni studi indicano che l'inserimento di watermark tramite IA non compromette la qualità dei risultati. Ciò può sembrare controintuitivo: se i watermark alterano la probabilità che alcune parole compaiano nel risultato generato da un modello di linguaggio di grandi dimensioni (LLM), non dovrebbe essere percepibile da un essere umano, proprio come notiamo quando gli LLM utilizzano parole come “delve”?
Questo perché l'elenco delle parole contrassegnate viene generato per ogni singolo token. In altre parole, il sottoinsieme delle parole del vocabolario selezionate per essere contrassegnate cambia con ogni nuova parola della frase. Ciò significa che la variabilità del vocabolario è molto maggiore di quanto ci si aspetterebbe se l'insieme delle parole contrassegnate fosse un insieme fisso e predeterminato.
Le filigrane sono utili per il rilevamento tramite IA per diversi motivi. Innanzitutto, l’uso delle filigrane può garantire un elevato grado di certezza su un numero relativamente esiguo di parole, anche se, come nel caso del pangramma, la certezza diminuisce man mano che i segmenti si accorciano. Inoltre, i watermark sono specifici per ciascun modello: mentre il pangram indica solo se un testo è stato generato dall’IA, il watermarking è in grado di indicare esattamente quale modello di IA abbia prodotto il testo. Tuttavia, anche un risultato positivo relativo a un watermark è specifico per il modello: se si inserisce un testo generato da ChatGPT in un rilevatore di watermark di Claude, si otterrà un risultato negativo, poiché il watermark compare solo nei testi scritti da Claude.
L'inserimento di filigrane è facile da implementare anche dal punto di vista delle aziende che si occupano di IA: le filigrane possono essere implementate a costi relativamente bassi e non richiedono un nuovo addestramento del modello per essere utilizzate.
La filigranatura è fragile e può essere facilmente aggirata da strategie algoritmiche alle quali Pangram è resistente, come gli “humanizer”. È facile eludere un rilevatore di filigrane basato sull’IA sostituendo le parole con sinonimi, poiché la filigrana è incorporata nella scelta delle parole. Il watermarking è inoltre di tipo binario: il rilevatore di Pangram è in grado di distinguere i contenuti generati dall’IA da quelli misti (umano/IA), mentre il watermarking indica solo se un testo è stato elaborato da un modello di linguaggio di grandi dimensioni (LLM) come fase finale prima di arrivare all’utente.
Sebbene l’analisi dei watermark possa indicare se un testo è stato scritto da un modello, un risultato negativo ottenuto con un rilevatore di watermark non significa che il testo non sia stato generato dall’IA, né tantomeno che non sia stato generato dal modello in questione: indica semplicemente che il watermark specifico di quel modello non è presente. Il testo potrebbe facilmente essere stato scritto da un modello diverso, oppure essere stato elaborato da un "humanizer" o da un programma simile che ha sostituito le parole del testo con sinonimi.
Sì, attualmente i modelli Claude utilizzano la filigranatura tramite IA per conformarsi alle normative dell'UE: Anthropic ha iniziato ad applicare la filigranatura ai risultati generati da Claude il 2 agosto 2026, come annunciato nel proprio blog.
| Fornitore | Filigrana di testo | Codice di condotta dell'UE sottoscritto | Chi può verificarlo? |
|---|---|---|---|
| Gemini (Google) | Sì, SynthID-Text è disponibile su Gemini dal 2024 | Sì | SynthID Detector di Google (accesso limitato) |
| Claude (Anthropic) | Sì, dal 2 agosto 2026 | Sì | API di rilevamento antropico (anteprima privata) |
| ChatGPT (OpenAI) | No | Sì | Nessun controllo del testo |
| Meta AI (Meta) | No | Sì | Nessun controllo del testo |
| Copilot (Microsoft) | No | Sì | Nessun controllo del testo |
| Mistral | No | Sì | — |
| Grok (xAI) | No | No | — |
| Modelli a peso libero (Llama, DeepSeek, ecc.) | No | — | — |
Al momento, ChatGPT non utilizza la tecnica del watermarking basato sull’intelligenza artificiale e non esistono strumenti affidabili per il rilevamento o la verifica della presenza di watermark generati dall’intelligenza artificiale nei testi prodotti da ChatGPT.
La filigranatura tramite IA non ha un grande effetto sul rilevamento da parte di Pangram. Poiché la filigranatura non fa altro che influenzare leggermente i punteggi di probabilità delle parole utilizzate dai modelli LLM, i risultati dei modelli LLM con filigrana rimarranno rilevabili da Pangram.
In definitiva, la tecnica del watermarking individua solo i risultati più evidenti e non modificati generati dall’IA, nei quali non è stato compiuto alcuno sforzo per nascondere l’uso dell’IA. Il nostro obiettivo è quello di essere molto più precisi e distinguere tra l’assistenza dell’IA, i testi misti (IA e umani) e i testi generati interamente dall’IA. Inoltre, a differenza dei rilevatori di watermark, non teniamo conto del modello utilizzato per generare il testo.
Riteniamo che la filigranatura tramite IA sia complementare a Pangram. Riteniamo inoltre che, in generale, una maggiore trasparenza riguardo alla paternità dei testi generati dall’IA sia un bene per il mondo.
ChatGPT presenta una filigrana?
No, ChatGPT non inserisce filigrane nei propri testi. OpenAI ha sviluppato un sistema per l'inserimento di filigrane nei testi nel 2024, ma non lo ha mai reso pubblico.
Che cos’è SynthID?
SynthID è la filigrana di Google utilizzata nei modelli Gemini dal 2024.
Come posso verificare se un testo contiene una filigrana generata dall'intelligenza artificiale?
I rilevatori di filigrane basati sull'intelligenza artificiale vengono rilasciati dall'azienda che ha creato il modello; pertanto, per verificare la presenza di una filigrana in un testo è necessario che l'azienda conceda l'accesso alla chiave privata utilizzata per generare la filigrana. Al 14 settembre 2026, nessuna azienda specializzata in intelligenza artificiale ha rilasciato pubblicamente un rilevatore di filigrane basato sull'intelligenza artificiale per il testo, sebbene Gemini disponga di un rilevatore di immagini pubblico.
Pangram rileva le filigrane create dall'intelligenza artificiale?
Al momento Pangram non supporta il rilevamento delle filigrane tramite intelligenza artificiale.

Annamieka è una redattrice tecnica presso Pangram.






