Valutazioni indipendenti condotte da soggetti terzi confermano costantemente i dati interni di Pangram relativi all'accuratezza: ecco una sintesi delle prove esterne.
Riteniamo importante che le istituzioni possano fare affidamento sull'elevata precisione di Pangram; pertanto, incoraggiamo la verifica da parte di terzi dei nostri indicatori di qualità (falsi positivi e falsi negativi). Di seguito presenteremo le valutazioni su Pangram effettuate dai ricercatori dell'Università di Chicago (UChicago) e dell'Università del Maryland (UMD), nonché da revisori del settore commerciale.
Conclusione principale: i test interni di Pangram reggono al vaglio di soggetti terzi.
In un articolo sottoposto a revisione paritaria e pubblicato nel giugno 2026, un gruppo di ricercatori della Vrije Universiteit Brussel ha testato quattro strumenti di rilevamento dell’IA – Pangram, GPTZero, Turnitin e Copyleaks – su 160 articoli accademici di oltre 4.000 parole ciascuno. Il set di dati era redatto in inglese e suddiviso equamente tra testi scritti da studenti ESL (di cui l’inglese non è la lingua madre), testi generati dall’IA, testi ibridi (combinazione di testo umano e generato dall’IA) e testi generati dall’IA ma “umanizzati”.
I ricercatori hanno scoperto che Pangram era l'unico strumento in grado di individuare in modo affidabile i contenuti generati dall'intelligenza artificiale: «Tra i quattro strumenti di rilevamento dell'intelligenza artificiale esaminati in questo studio, al momento solo [Pangram] ha prodotto risultati soddisfacenti».
Pangram è stato l’unico strumento in grado di individuare in modo affidabile sia i testi scritti interamente dall’intelligenza artificiale sia quelli “umanizzati” (rispettivamente il 97,5% e il 95%). Nel caso dei testi generati interamente dall’intelligenza artificiale, gli altri tre strumenti non ne hanno individuato praticamente nessuno, registrando tutti uno 0%. Nessun altro rilevatore, ad eccezione di Pangram, è riuscito a gestire in modo affidabile i testi “umanizzati”, sebbene Turnitin ne abbia individuato circa la metà e Copyleaks un quarto.
| Strumento | Tasso di rilevamento (interamente basato sull'intelligenza artificiale) | Tasso di rilevamento (ibrido) | Tasso di rilevamento (umanizzato) | Tasso di falsi positivi |
|---|---|---|---|---|
| Pangram | 97.5% | 95% | 95% | 0% |
| Turnitin | 0% | 60% | 52.5% | 0% |
| Copyleaks | 0% | 32.5% | 25% | 0% |
| GPTZero | 0% | 0% | 2.5% | leggero scostamento positivo (l'unico strumento che non si attesta a zero sul testo umano) |
Ricerche precedenti avevano rilevato che altri sistemi di rilevamento generavano falsi positivi nei confronti degli autori di testi in lingua straniera (ESL), ma questo studio indipendente indica che Pangram non presenta un bias sostanziale nei confronti dei testi in lingua straniera.
Presso il Becker Friedman Institute for Economics dell’Università di Chicago, i ricercatori hanno messo a confronto quattro strumenti di rilevamento dell’IA: Pangram, GPTZero, Originality AI e RoBERTa (uno strumento open source). Lo studio ha utilizzato ciascuno di questi strumenti per analizzare 1.992 testi scritti da esseri umani prima del 2020 e 1.992 testi generati dall’IA, appartenenti a generi diversi e con un numero di parole variabile. Sono stati esaminati due tipi di errori nel rilevamento dell'IA: i tassi di falsi positivi (FPR) e i tassi di falsi negativi (FNR). Questi tassi sono stati confrontati per diverse soglie. I rilevatori hanno anche classificato i testi generati dall'IA da modelli di linguaggio (LLM) popolari come ChatGPT, Claude e Gemini. I ricercatori hanno creato diversi limiti massimi per la politica FPR tra i rilevatori per osservare le variazioni nell'FNR.
Dallo studio " Scrittura artificiale e rilevamento automatico " di Brian Jabarian e Alex Imas, agosto 2025:
Pangram supera gli altri rilevatori a tutti i livelli di soglia.
Pangram è l'unico rilevatore in grado di rispettare un limite massimo molto rigoroso (FPR ≤ 0,005) senza compromettere la capacità di individuare con precisione i testi generati dall'intelligenza artificiale.
Pangram rimane il leader in termini di convenienza in tutti i generi e, in media, costa 0,0228 dollari per ogni passaggio segnalato correttamente dall'IA, contro i 0,0416 dollari di OriginalityAI e i 0,0575 dollari di GPTZero, il che rende Pangram il rilevatore più conveniente sia per i passaggi completi che per i frammenti.
Lo studio ha dimostrato che:
Pangram raggiunge tassi di falsi positivi e falsi negativi praticamente pari a zero su brani di lunghezza medio-lunga.
L'elevata precisione di Pangram è stata apprezzata in diversi tipi di testo, quali: blog, recensioni, curriculum, notizie e romanzi. Nei testi più brevi, i tassi di falsi positivi e falsi negativi aumentano leggermente, «ma rimangono ben al di sotto delle soglie ragionevoli previste dalle linee guida».
Tasso medio di falsi positivi (testo scritto da esseri umani identificato erroneamente come generato dall’IA) e tasso medio di falsi negativi (testo generato dall’IA non individuato) per ciascun rilevatore, nei sei generi e nei quattro modelli di linguaggio di grandi dimensioni (LLM). In entrambi i casi, un valore più basso è indicativo di una migliore prestazione.
| Strumento | Tasso di falsi positivi | Tasso di falsi negativi | È resistente all'humanizer di StealthGPT? |
|---|---|---|---|
| Pangram | 0.001 | 0.01 | Sì (tasso di rilevamento prossimo al 100%) |
| Originality.ai | 0.002 | 0.035 | In parte (fino a 0,21 FNR su testi brevi) |
| GPTZero | 0.007 | 0.06 | No (FNR 0,50+) |
| RoBERTa (open source) | 0.50 | inaffidabile (contrassegna la maggior parte del testo come generato dall'IA) | n/a (non idoneo) |
Pangram non fornisce più previsioni per testi di meno di 50 parole, ma come sottolineato nello studio,
Pangram’s performance largely holds up on very short passages (< 50 words) and is robust to “humanizer” tools (e.g., StealthGPT), the performance of other detectors becomes case-dependent.
Nell'esperimento 1 di questo studio dell'UMD, sono stati impiegati annotatori con diversi livelli di conoscenza dei modelli di linguaggio di grandi dimensioni (LLM) per prevedere se un testo fosse stato generato dall'intelligenza artificiale. Dopo aver osservato che un annotatore era quasi perfetto nell'identificare i testi generati dall'IA, sono stati utilizzati altri quattro annotatori esperti con background simili nell'uso degli LLM per classificare lo stesso campione di 60 testi. I risultati dei voti degli esperti sono stati confrontati con rilevatori commerciali come Pangram, Pangram Humanizer e GPTZero, nonché con strumenti open source come Fast-DetectGPT. Durante questo processo, Pangram è stato confrontato con altri rilevatori.
Percentuale di articoli sull'IA individuati (TPR) e tasso di falsi positivi in tutte le condizioni, compresa quella più difficile: il testo umanizzato o1-pro. Solo Pangram è riuscito a tenere il passo con gli esperti umani.
| Rilevatore | Rilevamento complessivo (TPR) | Tasso di falsi positivi | Rilevamento su testo umanizzato |
|---|---|---|---|
| Esperti (voto a maggioranza) | 99.3% | 0% | 100% |
| Pangram Humanizers | 99.3% | 2.7% | 96.7% |
| Pangramma (base) | 98.0% | 2% | 90.0% |
| GPTZero | 85.3% | 0.7% | 46.7% |
| Fast-DetectGPT | 80.0% | 7.2% | 23.3% |
| Binocolo (modalità Precisione) | 66.7% | 1.3% | 6.7% |
| RADAR | 15.3% | 2% | 0% |
Pangram è in grado di individuare con precisione i testi generati dall'intelligenza artificiale e poi "umanizzati". Ciò è confermato dagli informatici dell'Università del Maryland, i quali hanno osservato che Pangram ha ottenuto il punteggio complessivo più alto nel rilevamento di testi "umanizzati" e parafrasati, superando altri software di rilevamento dell'IA con un'accuratezza del 99,3%.
Scopri di più su come Pangram regge il confronto con gli humanizer
Amanda Caswell di Tom’s Guide ha affermato in un articolo che, dopo aver provato decine di strumenti di rilevamento dell’IA, Pangram «ha superato tutti gli altri che ho testato». È emerso inoltre che Pangram sta lavorando con impegno per ridurre il numero già esiguo di falsi positivi.
David Gewirtz di ZDNET descrive Pangram come «un nuovo arrivato nei nostri test che è subito balzato in testa alla classifica».
Dato che l'uso dell'IA negli articoli di ricerca è aumentato, si teme che ciò possa essere un indicatore di condotta scorretta. L'articolo di Adam Day su Medium ha utilizzato il rilevamento dell'IA di Pangram per ottenere risultati affidabili sulla prevalenza dei contenuti generati dall'IA, concludendo al contempo che esistono casi d'uso legittimi per l'IA generativa nella ricerca. Day raccomanda di utilizzare Pangram per condurre ricerche, affermando: "Se qualcuno volesse fare un'indagine sull'uso dell'IA generativa nella letteratura pubblicata, penso che ci sia un'ottima opportunità per farlo con gli strumenti di Pangram".
Noi di Pangram crediamo che la trasparenza sia fondamentale per instaurare un rapporto di fiducia. Saremmo lieti di collaborare con voi per garantire la trasparenza dell'IA nella vostra organizzazione.

Destiny è tirocinante come analista di ricerca presso Pangram. Frequenta inoltre il NYC College of Technology, dove studia matematica applicata e chimica. Il lavoro di Destiny presso Pangram ha contribuito in modo significativo allo studio dei contenuti generati dall'intelligenza artificiale su Internet. Oltre al lavoro e agli studi, Destiny è appassionata di scrittura creativa e narrativa horror.






