Su 986 prompt, Pangram 4 raggiunge un'accuratezza del 99,59% sugli output di GPT-6 Astra.
Su 986 prompt provenienti da Chatbot Arena, Pangram 4 ha classificato tre output di GPT-6 Astra come misti, uno come completamente umano e 982 come completamente generati dall'IA, raggiungendo un'accuratezza del 99,59% su GPT-6 Astra.
Di seguito analizziamo i falsi negativi suddivisi per categoria.
Il benchmark è stato generato utilizzando un sottoinsieme filtrato di prompt del primo turno di Chatbot Arena dal dataset LMSYS (Zheng et al., 2023). Ho filtrato i prompt che richiedevano codice, matematica, risposte molto brevi o molto lunghe o scrittura creativa inappropriata. Quindi li ho forniti a GPT-6 Astra e ho elaborato l'output con Pangram 4 .
| Categoria | Esempi | IA | Misto | Umano |
|---|---|---|---|---|
| Argomenti | 16 | 16 | 0 | 0 |
| E-mail / lettere | 57 | 56 | 1 | 0 |
| Saggi / articoli | 34 | 34 | 0 | 0 |
| Spiegazioni | 547 | 546 | 1 | 0 |
| Poesie e altri scritti creativi | 183 | 181 | 1 | 1 |
| Recensioni | 7 | 7 | 0 | 0 |
| Racconti | 142 | 142 | 0 | 0 |
| Totale | 986 | 982 | 3 | 1 |
I tre risultati, di natura mista, erano una poesia, una breve spiegazione e un'e-mail.
Astra tende a rispondere alle domande brevi in modo molto conciso. Complessivamente, ho inviato 1.032 domande per questo set di riferimento, ma 46 delle risposte di Astra 6 erano al di sotto del minimo di 50 parole richiesto da Pangram e non sono state valutate.
Pangram è robusto rispetto a GPT-6 Astra nei prompt in linguaggio naturale e lo rileva con una precisione del 99,59%. Pangram è in grado di generalizzare a nuovi modelli perché le nuove versioni tendono a ereditare gran parte dello stile e della voce dei loro predecessori , quindi Pangram non ha bisogno di essere riaddestrato per ogni nuova versione.
Ecco come GPT-6 Astra si confronta con i nostri benchmark di altri modelli di punta recenti:
| Modello | Rilevato come IA | Precisione |
|---|---|---|
| Claude Sonetto 5.5 | 1.019/1.022 | 99.71% |
| Gemini 3.8 Flash | 998/1.000 | 99.80% |
| Gemini 3.1 Pro | 997/1.000 | 99.70% |
| Claude Opus 5.5 | 997/1.000 | 99.70% |
| Favola 5.1 | 1.093/1.097 | 99.64% |
| Claude Opus 5 | 1.105/1.107 | 99.82% |
| GPT-5.6 | 3.408/3.423 | 99.56% |
| Claude Sonetto 5 | 1.145/1.147 | 99.83% |
| Gemini 3 | 28/28 | 100% |
Se vuoi verificare un documento specifico, puoi provare Pangram qui.

Annamieka è una redattrice tecnica presso Pangram.






