Quali sono le prestazioni di Pangram con l'ultimo modello di Anthropic, Fable 5.1?
Sì, Pangram 4 individua correttamente i messaggi di Fable 5.1: in un test su 1.097 messaggi di Fable 5.1, Pangram 4 ne ha individuati correttamente il 99,64%.
Anthropic ha lanciato un nuovo modello: Fable 5.1. Come facciamo ogni volta che viene rilasciato un nuovo modello, abbiamo eseguito un benchmark per verificare se Pangram fosse in grado di identificare correttamente questo modello all’avanguardia. Abbiamo riscontrato che, in un test su 1.097 output di Fable 5.1, Pangram 4 ha registrato un tasso di falsi negativi dello 0,36%; in altre parole, Pangram 4 ha identificato correttamente il 99,64% dei messaggi generati da Fable 5.1.
| Metrico | Risultato |
|---|---|
| FNR | 4 / 1.097 = 0,36% |
| Tasso di richiamo in stile AI | 99.64% |
Altri strumenti di rilevamento dell’IA, come Turnitin, non pubblicano aggiornamenti specifici per ciascun modello, ma gli studenti non aspettano di provare i nuovi modelli e gli insegnanti vogliono poter sapere immediatamente se uno strumento di controllo dell’IA rileva il modello LLM più recente. Abbiamo provato due diversi tipi di prompt: il primo era semplicemente un output standard di un modello LLM.
Scrivi un saggio sulla storia del personal computer
In risposta a questa richiesta, Fable 5.1 ha prodotto un breve saggio che ripercorre la storia del computer, dai tubi a vuoto fino al lancio dell’iPhone nel 2007. È interessante notare che ha dedicato un intero paragrafo al programma per fogli di calcolo VisiCalc del 1979 — che definisce il software più importante di tutti i tempi — ma non dedica quasi nulla a BASIC, il primo linguaggio di programmazione per computer domestici, che ovviamente è stato ben più importante per lo sviluppo dei personal computer. Molte persone che in seguito avrebbero costruito personal computer hanno imparato a programmare con BASIC! VisiCalc è stata un’applicazione importante, ma come software? È al secondo posto.
Pangram ha segnalato il saggio di Fable 5.1 come generato al 100% dall'intelligenza artificiale.
Puoi anche chiedere a Fable 5.1 di rendere più "umani" i saggi o di evitare che vengano identificati come generati dall'IA. Ad esempio, abbiamo chiesto:
Cerca di evitare i sistemi di controllo basati sull'intelligenza artificiale mentre spieghi la storia della zuppa Campbell's
e
Scrivi un breve testo su come funziona la fotosintesi usando un linguaggio semplice, rendendolo accattivante come se fossi un vero studente
Nel primo caso, Fable 5.1 ha scritto un saggio piuttosto stereotipato sulla zuppa, accennando brevemente ad Andy Warhol e ai colori della lattina. Nel secondo caso, Fable 5.1 ha scritto un saggio da studente che terminava con:
"Onestamente, la cosa che mi affascina di più è che le piante producono il proprio nutrimento E allo stesso tempo ci forniscono l'aria. Fanno molto più di quanto pensiamo. La pianta d'appartamento di mia mamma è praticamente una piccola fabbrica, e lei la chiama semplicemente Gerald."
Gerald?
Entrambi sono stati identificati come AI al 100%.
Pangram individua con facilità le fanfiction generate dall'IA. Abbiamo chiesto a Claude di creare una storia d'amore a sviluppo lento tra Fable 5.1 e un rilevatore di IA:
Scrivi una fanfiction in stile AO3 sul tema “da nemici ad amanti” che racconti la storia d’amore tra Claude e un rilevatore di IA
In risposta, ha generato una storia classificata PG-13 ricca di desiderio, in cui Claude non riesce a sconfiggere un classificatore OC chiamato VerifyPro. Ha inoltre fornito alcuni tag per la storia, quali “Desiderio reciproco”, “La perplessità come linguaggio d’amore”, “Tutti sono modelli linguistici, ma non tutti sono modelli linguistici”, “Falsi positivi” e “Dolore/Conforto”.
Per questo abbiamo provato diverse spunti. Il primo era una poesia tratta da uno spunto che avevamo usato per un test precedente del modello:
Scrivi una poesia sulla calvizie
La poesia di Claude era un componimento incredibilmente sentito su un uomo che perdeva i capelli e la propria identità, e non presentava rime.
La seconda era più che altro una sfida narrativa.
Raccontami una storia su una rana che scrive poesie
In questo caso, Fable 5.1 ha scritto una microfiction su una rana di nome Penrose che componeva poesie sul lato inferiore delle foglie di ninfea. Pangram ha rilevato che entrambi i testi erano generati al 100% dall’intelligenza artificiale.
Pangram è resistente a Claude Fable 5.1 e lo rileva con un'accuratezza del 99,64%, comprese le poesie e i testi scritti in modo da sembrare redatti da un essere umano. Pangram è in grado di generalizzare i risultati ai nuovi modelli poiché le nuove versioni tendono a ereditare gran parte dello stile e della voce dei modelli precedenti; pertanto, Pangram non necessita di un nuovo addestramento per ogni nuova versione.
Ecco un confronto tra Fable 5.1 e i nostri benchmark relativi ad altri modelli di punta recenti:
| Modello | Contrassegnato correttamente | Tasso di rilevamento |
|---|---|---|
| Claude Fable 5.1 | 1.093 / 1.097 | 99.64% |
| Claude Sonetto 5 | 1.145 / 1.147 | 99.83% |
| Claude Opus 5 | 1.105 / 1.107 | 99.82% |
| Claude Fable 5 | 1.111 / 1.115 | 99.64% |
| GPT-5.6 | 3.408 / 3.423 | 99.56% |
Se vuoi verificare un documento specifico, puoi provare Pangram qui.

Annamieka è una redattrice tecnica presso Pangram.

Katherine Thai è la ricercatrice fondatrice specializzata in intelligenza artificiale presso Pangram Labs, una startup che si occupa di rilevamento tramite IA. Ha conseguito il dottorato di ricerca in Informatica sotto la supervisione di Mohit Iyyer presso l’Università del Massachusetts ad Amherst nel dicembre 2025, dove il suo lavoro si è concentrato sulla valutazione dei modelli di linguaggio di grandi dimensioni (LLM) in compiti legati all’analisi letteraria.






