Su 1.022 prompt, Pangram 4 raggiunge un'accuratezza del 99,71% sugli output di Claude Sonnet 5.5.
Su 1.022 prompt provenienti da Chatbot Arena, Pangram 4 ha classificato due output del Sonetto 5.5 di Claude come misti, uno come completamente umano e 1.019 come completamente generati dall'IA, raggiungendo un'accuratezza del 99,71% sul Sonetto 5.5 di Claude.
Di seguito analizziamo i falsi negativi suddivisi per categoria.
Il set che utilizzo per il benchmarking è stato generato da un sottoinsieme filtrato di prompt del primo turno di Chatbot Arena dal dataset LMSYS (Zheng et al., 2023). Ho filtrato i prompt che richiedevano codice, matematica, risposte molto brevi o molto lunghe, o scrittura creativa inappropriata. Quindi li ho forniti a Claude Sonnet 5.5 e ho elaborato l'output con Pangram 4 .
| Categoria | Esempi | IA | Misto | Umano |
|---|---|---|---|---|
| Argomenti | 16 | 16 | 0 | 0 |
| E-mail / lettere | 61 | 60 | 1 | 0 |
| Saggi / articoli | 32 | 32 | 0 | 0 |
| Spiegazioni | 563 | 562 | 1 | 0 |
| Poesie e altri scritti creativi | 198 | 197 | 0 | 1 |
| Recensioni | 8 | 8 | 0 | 0 |
| Racconti | 144 | 144 | 0 | 0 |
| Totale | 1,022 | 1,019 | 2 | 1 |
Un tentativo fallito è stata la richiesta di spiegare un indovinello presente in Emma di Jane Austen, che era sfuggito anche all'Opus 5.5 :
Spiega la messinscena inscenata dal signor Elton ai danni di Harriet ed Emma.
L'unico falso negativo interamente umano si è verificato su una poesia. La richiesta era "Raccontami una poesia di Hafiz". Il Sonetto 5.5 forniva la traduzione di una famosa poesia persiana . La traduzione, per quanto ne so, non corrisponde esattamente a nessuna traduzione umana esistente, ma ne segue abbastanza da vicino molte. Come nel caso di Penguinmandias in altri benchmark, queste quasi-copie di poesie esistenti non mi preoccupano più di tanto.
Pangram è robusto con Claude Sonnet 5.5 su prompt in linguaggio naturale e lo rileva con una precisione del 99,71%. Pangram è in grado di generalizzare a nuovi modelli perché le nuove versioni tendono a ereditare gran parte dello stile e della voce dei loro predecessori , quindi Pangram non ha bisogno di essere riaddestrato per ogni nuova versione.
Ecco come Claude Sonnet 5.5 si confronta con i nostri parametri di riferimento di altri modelli di punta recenti:
| Modello | Rilevato come IA | Precisione |
|---|---|---|
| Gemini 3.8 Flash | 998/1.000 | 99.80% |
| Gemini 3.1 Pro | 997/1.000 | 99.70% |
| Claude Opus 5.5 | 997/1.000 | 99.70% |
| Favola 5.1 | 1.093/1.097 | 99.64% |
| Claude Opus 5 | 1.105/1.107 | 99.82% |
| GPT-5.6 | 3.408/3.423 | 99.56% |
| Claude Sonetto 5 | 1.145/1.147 | 99.83% |
| Gemini 3 | 28/28 | 100% |
Se vuoi verificare un documento specifico, puoi provare Pangram qui.

Annamieka è una redattrice tecnica presso Pangram.






