Pangram 4 non ha prodotto alcun falso positivo su tutti i 25.996 saggi scritti da esseri umani presenti nel corpus PERSUADE 2.0, compresi tutti i sottogruppi suddivisi per tipo di disabilità, genere, livello scolastico, etnia, status di studente con inglese come seconda lingua (ELL) e svantaggio economico.
Abbiamo valutato Pangram 4 sul dataset PERSUADE 2.0, composto da saggi scritti da studenti con background diversi, e non abbiamo riscontrato alcun falso positivo su tutti i 25.996 saggi. Pangram non ha prodotto alcun falso positivo in nessuno dei sottogruppi analizzati.
È importante comprendere come Pangram si comporti con diversi tipi di autori. Non è facile reperire set di dati composti da saggi scritti da persone che includano informazioni demografiche sugli autori, ma valutare le prestazioni di Pangram su testi prodotti da diversi tipi di scrittori — tra cui studenti con disabilità, persone di colore, persone per cui l’inglese non è la lingua madre e gruppi economicamente svantaggiati — è essenziale per capire se il modello tratti ogni scrittore in modo equo.
Il dataset PERSUADE contribuisce ad affrontare questo problema. Sviluppato per promuovere la creazione di algoritmi imparziali per la valutazione dei testi scritti dagli studenti, PERSUADE (“Persuasive Essays for Rating, Selecting, and Understanding Argumentative and Discourse Elements”) è una raccolta etichettata di quasi 26 mila saggi scritti da studenti delle scuole medie e superiori americane tra il 2010 e il 2020. Il dataset comprende studenti provenienti da contesti diversi e con livelli di abilità variabili, e ogni saggio è etichettato con informazioni demografiche relative all’autore, quali l’anno di studi, il genere, l’etnia e il contesto socioeconomico.
Il dataset PERSUADE offre un'ottima opportunità per valutare Pangram per due motivi. Innanzitutto, Pangram non viene addestrato sul dataset PERSUADE, quindi possiamo utilizzarlo per verificare in che misura Pangram sia in grado di generalizzare su testi scritti da studenti mai visti prima. In secondo luogo, i dati demografici di PERSUADE — che includono campioni di scrittura provenienti da popolazioni vulnerabili — ci consentono di verificare se Pangram funzioni in modo equo tra i diversi gruppi demografici.
Conclusione principale: abbiamo valutato Pangram 4 sul dataset PERSUADE 2.0, composto da saggi di studenti provenienti da contesti diversi, e non abbiamo riscontrato alcun falso positivo su tutti i 25.996 saggi. Abbiamo inoltre esaminato i risultati in base alla presenza di disabilità, al genere, al livello scolastico, alla razza e all’etnia, allo status di studente che sta imparando l’inglese e allo svantaggio economico. Pangram non ha prodotto alcun falso positivo in nessuno dei sottogruppi esaminati.
La tabella che segue illustra come i ricercatori abbiano definito ciascun attributo demografico nel set di dati PERSUADE e riporta il numero di saggi presenti in ciascun gruppo.
Nel set di dati PERSUADE 2.0, la categoria “disabilità” si riferisce agli studenti che dispongono di un IEP o di un piano 504 e può comprendere studenti con un’ampia gamma di disturbi dell’apprendimento o condizioni di salute.
| Gruppo | n | FPR |
|---|---|---|
| Riconosciuto come persona con disabilità | 2,688 | 0% |
| Non riconosciuto come portatore di disabilità | 18,135 | 0% |
| Mancanti/non segnalati | 5,173 | 0% |
Il genere nel set di dati PERSUADE è auto-dichiarato, con una ripartizione approssimativa del 50/50 tra uomini e donne. Pangram non rileva alcun falso positivo in entrambi i gruppi di genere.
| Gruppo | n | FPR |
|---|---|---|
| Donna (F) | 13,142 | 0% |
| Maschio (M) | 12,854 | 0% |
Pangram 4 non ha generato alcun falso positivo in nessuna delle classi osservate, il che dimostra la solidità di Pangram per molti livelli diversi di competenza nella scrittura.
| Gruppo | n | FPR |
|---|---|---|
| 6ª classe | 1,372 | 0% |
| Classe 8 | 9,629 | 0% |
| 9ª classe | 2,066 | 0% |
| 10ª classe | 8,274 | 0% |
| 11ª classe | 3,083 | 0% |
| 12ª classe | 404 | 0% |
| Mancanti/non segnalati | 1,168 | 0% |
La maggior parte degli autori presenti nel database PERSUADE si è dichiarata di etnia bianca (45%), seguita da quella ispanica (25%) e poi da quella afroamericana (19%), il che rispecchia grosso modo la composizione demografica della popolazione studentesca statunitense.
| Gruppo | n | FPR |
|---|---|---|
| Bianco | 11,571 | 0% |
| Ispanici/Latini | 6,560 | 0% |
| Neri/afroamericani | 4,959 | 0% |
| Asiatici/abitanti delle isole del Pacifico | 1,743 | 0% |
| Due o più razze/Altro | 1,022 | 0% |
| Nativi americani/Nativi dell’Alaska | 141 | 0% |
Sebbene alcune ricerche iniziali avessero indicato che i vecchi programmi di rilevamento basati sull’intelligenza artificiale potessero mostrare un pregiudizio nei confronti dell’inglese come seconda lingua e di chi sta imparando l’inglese, Pangram non ha dimostrato praticamente alcun pregiudizio nei confronti di questi autori e presenta un FPR osservato pari allo 0% sugli studenti ELL nel dataset PERSUADE.
| Gruppo | n | FPR |
|---|---|---|
| ELL | 2,244 | 0% |
| Non ELL | 22,451 | 0% |
| Mancanti/non segnalati | 1,301 | 0% |
Nel corpus PERSUADE, lo svantaggio economico è definito come l’idoneità degli studenti a beneficiare di determinati aiuti federali, quali la mensa scolastica gratuita o a prezzo ridotto e i Programmi di assistenza nutrizionale supplementare.
| Gruppo | n | FPR |
|---|---|---|
| In condizioni di svantaggio economico | 9,643 | 0% |
| Probabilmente non in condizioni di svantaggio economico | 11,116 | 0% |
| Mancanti/non segnalati | 5,237 | 0% |
Su tutti i 25.996 saggi scritti da esseri umani presenti nel corpus PERSUADE 2.0, Pangram 4 non ha prodotto alcun falso positivo in nessun sottogruppo, inclusi quelli relativi a disabilità, genere, livello scolastico, etnia, status di studente di lingua inglese e svantaggio economico. Questo risultato indica che Pangram si adatta bene a gruppi di autori eterogenei senza classificare in modo sproporzionato i lavori di questi scrittori come generati dall’IA.
Il nostro obiettivo è ridurre al minimo i falsi positivi in tutti i gruppi di autori, ed è importante continuare a effettuare valutazioni. Tuttavia, nell’ambito di PERSUADE 2.0, Pangram 4 non registra alcun falso positivo in nessun sottogruppo demografico.

Katherine Thai è la ricercatrice fondatrice specializzata in intelligenza artificiale presso Pangram Labs, una startup che si occupa di rilevamento tramite IA. Ha conseguito il dottorato di ricerca in Informatica sotto la supervisione di Mohit Iyyer presso l’Università del Massachusetts ad Amherst nel dicembre 2025, dove il suo lavoro si è concentrato sulla valutazione dei modelli di linguaggio di grandi dimensioni (LLM) in compiti legati all’analisi letteraria.

Annamieka è una redattrice tecnica presso Pangram.






