Casi di studio

Valutazioni di pangrammi effettuate da terzi

Valutazioni indipendenti condotte da soggetti terzi confermano costantemente i dati interni di Pangram relativi all'accuratezza: ecco una sintesi delle prove esterne.

2 agosto 2026

Riteniamo importante che le istituzioni possano fare affidamento sull'elevata precisione di Pangram; pertanto, incoraggiamo la verifica da parte di terzi dei nostri indicatori di qualità (falsi positivi e falsi negativi). Di seguito presenteremo le valutazioni su Pangram effettuate dai ricercatori dell'Università di Chicago (UChicago) e dell'Università del Maryland (UMD), nonché da revisori del settore commerciale.

Conclusione principale: i test interni di Pangram reggono al vaglio di soggetti terzi.

Pangram raggiunge una percentuale di rilevamento del 97,5% sui testi generati interamente dall'intelligenza artificiale e zero falsi positivi sui saggi scritti da studenti di inglese come seconda lingua (ESL)

In un articolo sottoposto a revisione paritaria e pubblicato nel giugno 2026, un gruppo di ricercatori della Vrije Universiteit Brussel ha testato quattro strumenti di rilevamento dell’IA – Pangram, GPTZero, Turnitin e Copyleaks – su 160 articoli accademici di oltre 4.000 parole ciascuno. Il set di dati era redatto in inglese e suddiviso equamente tra testi scritti da studenti ESL (di cui l’inglese non è la lingua madre), testi generati dall’IA, testi ibridi (combinazione di testo umano e generato dall’IA) e testi generati dall’IA ma “umanizzati”.

I ricercatori hanno scoperto che Pangram era l'unico strumento in grado di individuare in modo affidabile i contenuti generati dall'intelligenza artificiale: «Tra i quattro strumenti di rilevamento dell'intelligenza artificiale esaminati in questo studio, al momento solo [Pangram] ha prodotto risultati soddisfacenti».

Pangram è stato l’unico strumento in grado di individuare in modo affidabile sia i testi scritti interamente dall’intelligenza artificiale sia quelli “umanizzati” (rispettivamente il 97,5% e il 95%). Nel caso dei testi generati interamente dall’intelligenza artificiale, gli altri tre strumenti non ne hanno individuato praticamente nessuno, registrando tutti uno 0%. Nessun altro rilevatore, ad eccezione di Pangram, è riuscito a gestire in modo affidabile i testi “umanizzati”, sebbene Turnitin ne abbia individuato circa la metà e Copyleaks un quarto.

StrumentoTasso di rilevamento (interamente basato sull'intelligenza artificiale)Tasso di rilevamento (ibrido)Tasso di rilevamento (umanizzato)Tasso di falsi positivi
Pangram97.5%95%95%0%
Turnitin0%60%52.5%0%
Copyleaks0%32.5%25%0%
GPTZero0%0%2.5%leggero scostamento positivo (l'unico strumento che non si attesta a zero sul testo umano)

Ricerche precedenti avevano rilevato che altri sistemi di rilevamento generavano falsi positivi nei confronti degli autori di testi in lingua straniera (ESL), ma questo studio indipendente indica che Pangram non presenta un bias sostanziale nei confronti dei testi in lingua straniera.

Affidabilità e accuratezza di Pangram (Università di Chicago)

Esperimento

Presso il Becker Friedman Institute for Economics dell’Università di Chicago, i ricercatori hanno messo a confronto quattro strumenti di rilevamento dell’IA: Pangram, GPTZero, Originality AI e RoBERTa (uno strumento open source). Lo studio ha utilizzato ciascuno di questi strumenti per analizzare 1.992 testi scritti da esseri umani prima del 2020 e 1.992 testi generati dall’IA, appartenenti a generi diversi e con un numero di parole variabile. Sono stati esaminati due tipi di errori nel rilevamento dell'IA: i tassi di falsi positivi (FPR) e i tassi di falsi negativi (FNR). Questi tassi sono stati confrontati per diverse soglie. I rilevatori hanno anche classificato i testi generati dall'IA da modelli di linguaggio (LLM) popolari come ChatGPT, Claude e Gemini. I ricercatori hanno creato diversi limiti massimi per la politica FPR tra i rilevatori per osservare le variazioni nell'FNR.

Risultati

Dallo studio " Scrittura artificiale e rilevamento automatico " di Brian Jabarian e Alex Imas, agosto 2025:

Pangram supera gli altri rilevatori a tutti i livelli di soglia.

Pangram è l'unico rilevatore in grado di rispettare un limite massimo molto rigoroso (FPR ≤ 0,005) senza compromettere la capacità di individuare con precisione i testi generati dall'intelligenza artificiale.

Pangram rimane il leader in termini di convenienza in tutti i generi e, in media, costa 0,0228 dollari per ogni passaggio segnalato correttamente dall'IA, contro i 0,0416 dollari di OriginalityAI e i 0,0575 dollari di GPTZero, il che rende Pangram il rilevatore più conveniente sia per i passaggi completi che per i frammenti.

Lo studio ha dimostrato che:

Pangram raggiunge tassi di falsi positivi e falsi negativi praticamente pari a zero su brani di lunghezza medio-lunga.

L'elevata precisione di Pangram è stata apprezzata in diversi tipi di testo, quali: blog, recensioni, curriculum, notizie e romanzi. Nei testi più brevi, i tassi di falsi positivi e falsi negativi aumentano leggermente, «ma rimangono ben al di sotto delle soglie ragionevoli previste dalle linee guida».

Tasso medio di falsi positivi (testo scritto da esseri umani identificato erroneamente come generato dall’IA) e tasso medio di falsi negativi (testo generato dall’IA non individuato) per ciascun rilevatore, nei sei generi e nei quattro modelli di linguaggio di grandi dimensioni (LLM). In entrambi i casi, un valore più basso è indicativo di una migliore prestazione.

StrumentoTasso di falsi positiviTasso di falsi negativiÈ resistente all'humanizer di StealthGPT?
Pangram0.0010.01Sì (tasso di rilevamento prossimo al 100%)
Originality.ai0.0020.035In parte (fino a 0,21 FNR su testi brevi)
GPTZero0.0070.06No (FNR 0,50+)
RoBERTa (open source)0.50inaffidabile (contrassegna la maggior parte del testo come generato dall'IA)n/a (non idoneo)

Pangram non fornisce più previsioni per testi di meno di 50 parole, ma come sottolineato nello studio,

Pangram’s performance largely holds up on very short passages (< 50 words) and is robust to “humanizer” tools (e.g., StealthGPT), the performance of other detectors becomes case-dependent.

Esibizione dei Pangram contro gli Humanizers (Università del Maryland)

Esperimento

Nell'esperimento 1 di questo studio dell'UMD, sono stati impiegati annotatori con diversi livelli di conoscenza dei modelli di linguaggio di grandi dimensioni (LLM) per prevedere se un testo fosse stato generato dall'intelligenza artificiale. Dopo aver osservato che un annotatore era quasi perfetto nell'identificare i testi generati dall'IA, sono stati utilizzati altri quattro annotatori esperti con background simili nell'uso degli LLM per classificare lo stesso campione di 60 testi. I risultati dei voti degli esperti sono stati confrontati con rilevatori commerciali come Pangram, Pangram Humanizer e GPTZero, nonché con strumenti open source come Fast-DetectGPT. Durante questo processo, Pangram è stato confrontato con altri rilevatori.

Percentuale di articoli sull'IA individuati (TPR) e tasso di falsi positivi in tutte le condizioni, compresa quella più difficile: il testo umanizzato o1-pro. Solo Pangram è riuscito a tenere il passo con gli esperti umani.

RilevatoreRilevamento complessivo (TPR)Tasso di falsi positiviRilevamento su testo umanizzato
Esperti (voto a maggioranza)99.3%0%100%
Pangram Humanizers99.3%2.7%96.7%
Pangramma (base)98.0%2%90.0%
GPTZero85.3%0.7%46.7%
Fast-DetectGPT80.0%7.2%23.3%
Binocolo (modalità Precisione)66.7%1.3%6.7%
RADAR15.3%2%0%

Risultati

Pangram è in grado di individuare con precisione i testi generati dall'intelligenza artificiale e poi "umanizzati". Ciò è confermato dagli informatici dell'Università del Maryland, i quali hanno osservato che Pangram ha ottenuto il punteggio complessivo più alto nel rilevamento di testi "umanizzati" e parafrasati, superando altri software di rilevamento dell'IA con un'accuratezza del 99,3%.

Scopri di più su come Pangram regge il confronto con gli humanizer

Valutazioni dei pangrammi al di fuori degli istituti di ricerca

Amanda Caswell di Tom’s Guide ha affermato in un articolo che, dopo aver provato decine di strumenti di rilevamento dell’IA, Pangram «ha superato tutti gli altri che ho testato». È emerso inoltre che Pangram sta lavorando con impegno per ridurre il numero già esiguo di falsi positivi.

David Gewirtz di ZDNET descrive Pangram come «un nuovo arrivato nei nostri test che è subito balzato in testa alla classifica».

Dato che l'uso dell'IA negli articoli di ricerca è aumentato, si teme che ciò possa essere un indicatore di condotta scorretta. L'articolo di Adam Day su Medium ha utilizzato il rilevamento dell'IA di Pangram per ottenere risultati affidabili sulla prevalenza dei contenuti generati dall'IA, concludendo al contempo che esistono casi d'uso legittimi per l'IA generativa nella ricerca. Day raccomanda di utilizzare Pangram per condurre ricerche, affermando: "Se qualcuno volesse fare un'indagine sull'uso dell'IA generativa nella letteratura pubblicata, penso che ci sia un'ottima opportunità per farlo con gli strumenti di Pangram".

Conclusione

Noi di Pangram crediamo che la trasparenza sia fondamentale per instaurare un rapporto di fiducia. Saremmo lieti di collaborare con voi per garantire la trasparenza dell'IA nella vostra organizzazione.


Destiny Akinode
Destiny AkinodeTirocinante di ricerca

Destiny è tirocinante come analista di ricerca presso Pangram. Frequenta inoltre il NYC College of Technology, dove studia matematica applicata e chimica. Il lavoro di Destiny presso Pangram ha contribuito in modo significativo allo studio dei contenuti generati dall'intelligenza artificiale su Internet. Oltre al lavoro e agli studi, Destiny è appassionata di scrittura creativa e narrativa horror.

Altri articoli di Destiny Akinode

Altre letture

I documenti presentati alle conferenze sull'IA sono sempre più spesso redatti dall'IA: +370% dal 2023
Casi di studio

I documenti presentati alle conferenze sull'IA sono sempre più spesso redatti dall'IA: +370% dal 2023

30 settembre 2024
Qual è il rilevatore di IA più preciso? 30 strumenti testati (2026)
Casi di studio

Qual è il rilevatore di IA più preciso? 30 strumenti testati (2026)

7 gennaio 2026
Il 3% delle recensioni in prima pagina su Amazon è ora generato dall'intelligenza artificiale
Casi di studio

Il 3% delle recensioni in prima pagina su Amazon è ora generato dall'intelligenza artificiale

4 maggio 2026
Pangram non rileva alcun falso positivo in una serie di saggi scritti da studenti con background diversi
Casi di studio

Pangram non rileva alcun falso positivo in una serie di saggi scritti da studenti con background diversi

19 agosto 2026
In che modo Gradpilot utilizza Pangram per aiutare gli studenti a trovare la propria voce
Casi di studio

In che modo Gradpilot utilizza Pangram per aiutare gli studenti a trovare la propria voce

15 settembre 2025
Come si posiziona Pangram rispetto a GPTZero?
Casi di studio

Come si posiziona Pangram rispetto a GPTZero?

22 gennaio 2026