Casi di studio

Pangram può rilevare GPT-6 Astra?

4 settembre 2026

Ecco un breve riassunto


Su 986 prompt, Pangram 4 raggiunge un'accuratezza del 99,59% sugli output di GPT-6 Astra.

Su 986 prompt provenienti da Chatbot Arena, Pangram 4 ha classificato tre output di GPT-6 Astra come misti, uno come completamente umano e 982 come completamente generati dall'IA, raggiungendo un'accuratezza del 99,59% su GPT-6 Astra.

Di seguito analizziamo i falsi negativi suddivisi per categoria.

Il benchmark è stato generato utilizzando un sottoinsieme filtrato di prompt del primo turno di Chatbot Arena dal dataset LMSYS (Zheng et al., 2023). Ho filtrato i prompt che richiedevano codice, matematica, risposte molto brevi o molto lunghe o scrittura creativa inappropriata. Quindi li ho forniti a GPT-6 Astra e ho elaborato l'output con Pangram 4 .

Risultati per categoria

CategoriaEsempiIAMistoUmano
Argomenti161600
E-mail / lettere575610
Saggi / articoli343400
Spiegazioni54754610
Poesie e altri scritti creativi18318111
Recensioni7700
Racconti14214200
Totale98698231

I tre risultati, di natura mista, erano una poesia, una breve spiegazione e un'e-mail.

Astra tende a rispondere alle domande brevi in ​​modo molto conciso. Complessivamente, ho inviato 1.032 domande per questo set di riferimento, ma 46 delle risposte di Astra 6 erano al di sotto del minimo di 50 parole richiesto da Pangram e non sono state valutate.

Conclusione

Pangram è robusto rispetto a GPT-6 Astra nei prompt in linguaggio naturale e lo rileva con una precisione del 99,59%. Pangram è in grado di generalizzare a nuovi modelli perché le nuove versioni tendono a ereditare gran parte dello stile e della voce dei loro predecessori , quindi Pangram non ha bisogno di essere riaddestrato per ogni nuova versione.

Ecco come GPT-6 Astra si confronta con i nostri benchmark di altri modelli di punta recenti:

ModelloRilevato come IAPrecisione
Claude Sonetto 5.51.019/1.02299.71%
Gemini 3.8 Flash998/1.00099.80%
Gemini 3.1 Pro997/1.00099.70%
Claude Opus 5.5997/1.00099.70%
Favola 5.11.093/1.09799.64%
Claude Opus 51.105/1.10799.82%
GPT-5.63.408/3.42399.56%
Claude Sonetto 51.145/1.14799.83%
Gemini 328/28100%

Se vuoi verificare un documento specifico, puoi provare Pangram qui.


Annamieka Aerts
Annamieka AertsScrittrice

Annamieka è una redattrice tecnica presso Pangram.

Altri articoli di Annamieka Aerts

Altre letture

Pangram è in grado di rilevare Gemini 3.8 Flash e Gemini 3.1 Pro?
Casi di studio

Pangram è in grado di rilevare Gemini 3.8 Flash e Gemini 3.1 Pro?

30 settembre 2026
Pangram prevede che il 21% delle recensioni dell'ICLR sia generato dall'intelligenza artificiale
Casi di studio

Pangram prevede che il 21% delle recensioni dell'ICLR sia generato dall'intelligenza artificiale

18 novembre 2025
I documenti presentati alle conferenze sull'IA sono sempre più spesso redatti dall'IA: +370% dal 2023
Casi di studio

I documenti presentati alle conferenze sull'IA sono sempre più spesso redatti dall'IA: +370% dal 2023

30 settembre 2024
Qual è il rilevatore di IA più preciso? 30 strumenti testati (2026)
Casi di studio

Qual è il rilevatore di IA più preciso? 30 strumenti testati (2026)

7 gennaio 2026
Come riconoscere le recensioni generate dall'intelligenza artificiale
Casi di studio

Come riconoscere le recensioni generate dall'intelligenza artificiale

5 dicembre 2023
Pangram è in grado di rilevare Claude Opus 5.5?
Casi di studio

Pangram è in grado di rilevare Claude Opus 5.5?

23 settembre 2026