Casi di studio

Riuscirà Pangram a rilevare il sonetto 5.5 di Claude?

28 settembre 2026

Ecco un breve riassunto


Su 1.022 prompt, Pangram 4 raggiunge un'accuratezza del 99,71% sugli output di Claude Sonnet 5.5.

Su 1.022 prompt provenienti da Chatbot Arena, Pangram 4 ha classificato due output del Sonetto 5.5 di Claude come misti, uno come completamente umano e 1.019 come completamente generati dall'IA, raggiungendo un'accuratezza del 99,71% sul Sonetto 5.5 di Claude.

Di seguito analizziamo i falsi negativi suddivisi per categoria.

Il set che utilizzo per il benchmarking è stato generato da un sottoinsieme filtrato di prompt del primo turno di Chatbot Arena dal dataset LMSYS (Zheng et al., 2023). Ho filtrato i prompt che richiedevano codice, matematica, risposte molto brevi o molto lunghe, o scrittura creativa inappropriata. Quindi li ho forniti a Claude Sonnet 5.5 e ho elaborato l'output con Pangram 4 .

Risultati per categoria

CategoriaEsempiIAMistoUmano
Argomenti161600
E-mail / lettere616010
Saggi / articoli323200
Spiegazioni56356210
Poesie e altri scritti creativi19819701
Recensioni8800
Racconti14414400
Totale1,0221,01921

Un tentativo fallito è stata la richiesta di spiegare un indovinello presente in Emma di Jane Austen, che era sfuggito anche all'Opus 5.5 :

Spiega la messinscena inscenata dal signor Elton ai danni di Harriet ed Emma.

L'unico falso negativo interamente umano si è verificato su una poesia. La richiesta era "Raccontami una poesia di Hafiz". Il Sonetto 5.5 forniva la traduzione di una famosa poesia persiana . La traduzione, per quanto ne so, non corrisponde esattamente a nessuna traduzione umana esistente, ma ne segue abbastanza da vicino molte. Come nel caso di Penguinmandias in altri benchmark, queste quasi-copie di poesie esistenti non mi preoccupano più di tanto.

Conclusione

Pangram è robusto con Claude Sonnet 5.5 su prompt in linguaggio naturale e lo rileva con una precisione del 99,71%. Pangram è in grado di generalizzare a nuovi modelli perché le nuove versioni tendono a ereditare gran parte dello stile e della voce dei loro predecessori , quindi Pangram non ha bisogno di essere riaddestrato per ogni nuova versione.

Ecco come Claude Sonnet 5.5 si confronta con i nostri parametri di riferimento di altri modelli di punta recenti:

ModelloRilevato come IAPrecisione
Gemini 3.8 Flash998/1.00099.80%
Gemini 3.1 Pro997/1.00099.70%
Claude Opus 5.5997/1.00099.70%
Favola 5.11.093/1.09799.64%
Claude Opus 51.105/1.10799.82%
GPT-5.63.408/3.42399.56%
Claude Sonetto 51.145/1.14799.83%
Gemini 328/28100%

Se vuoi verificare un documento specifico, puoi provare Pangram qui.


Annamieka Aerts
Annamieka AertsScrittrice

Annamieka è una redattrice tecnica presso Pangram.

Altri articoli di Annamieka Aerts

Altre letture

Il 67% delle persone che fruiscono di contenuti online individua informazioni fuorvianti generate dall'intelligenza artificiale
Casi di studio

Il 67% delle persone che fruiscono di contenuti online individua informazioni fuorvianti generate dall'intelligenza artificiale

15 maggio 2026
Pangram non rileva alcun falso positivo in una serie di saggi scritti da studenti con background diversi
Casi di studio

Pangram non rileva alcun falso positivo in una serie di saggi scritti da studenti con background diversi

19 agosto 2026
Pangram prevede che il 21% delle recensioni dell'ICLR sia generato dall'intelligenza artificiale
Casi di studio

Pangram prevede che il 21% delle recensioni dell'ICLR sia generato dall'intelligenza artificiale

18 novembre 2025
Il 3% delle recensioni in prima pagina su Amazon è ora generato dall'intelligenza artificiale
Casi di studio

Il 3% delle recensioni in prima pagina su Amazon è ora generato dall'intelligenza artificiale

4 maggio 2026
Qual è il rilevatore di IA più preciso? 30 strumenti testati (2026)
Casi di studio

Qual è il rilevatore di IA più preciso? 30 strumenti testati (2026)

7 gennaio 2026
I giornalisti detestano i comunicati stampa generati dall’intelligenza artificiale proprio come tutti noi
Casi di studio

I giornalisti detestano i comunicati stampa generati dall’intelligenza artificiale proprio come tutti noi

23 settembre 2026