De um total de 986 pedidos, o Pangram 4 alcançou uma precisão de 99,59% nas saídas do GPT-6 Astra.
De 986 pedidos provenientes do Chatbot Arena, o Pangram 4 classificou três saídas do GPT-6 Astra como mistas, uma como totalmente humana e 982 como totalmente geradas por IA, alcançando uma precisão de 99,59% no GPT-6 Astra.
A seguir, discutimos os falsos negativos por categoria.
O conjunto de dados de referência foi gerado utilizando um subconjunto filtrado de prompts da primeira ronda do Chatbot Arena, provenientes do conjunto de dados LMSYS (Zheng et al., 2023). Filtrei os avisos que solicitavam código, matemática, respostas demasiado curtas ou demasiado longas, ou escrita criativa inadequada. Em seguida, forneci estes avisos ao GPT-6 Astra e processei a saída através do Pangram 4 .
| Categoria | Exemplos | IA | Misto | Humano |
|---|---|---|---|---|
| Argumentos | 16 | 16 | 0 | 0 |
| E-mails / cartas | 57 | 56 | 1 | 0 |
| Ensaios / artigos | 34 | 34 | 0 | 0 |
| Explicações | 547 | 546 | 1 | 0 |
| Poemas e outros textos criativos | 183 | 181 | 1 | 1 |
| Críticas | 7 | 7 | 0 | 0 |
| Histórias | 142 | 142 | 0 | 0 |
| Total | 986 | 982 | 3 | 1 |
Os três resultados mistos foram um poema, uma breve explicação e um e-mail.
O Astra tende a responder a perguntas curtas de forma muito sucinta. Ao todo, enviei 1.032 perguntas para este conjunto de testes de referência, mas 46 das respostas da Astra 6 tinham menos de 50 palavras (o mínimo exigido pelo Pangram) e não foram pontuadas.
O Pangram é robusto ao GPT-6 Astra em comandos de linguagem natural e detecta-o com 99,59% de precisão. O Pangram consegue generalizar para novos modelos porque as novas versões tendem a herdar grande parte do estilo e da voz dos seus antecessores , pelo que o Pangram não necessita de ser retreinado para cada nova versão.
Veja como o GPT-6 Astra se compara com os nossos benchmarks de outros modelos de gama alta recentes:
| Modelo | Detetado como IA | Precisão |
|---|---|---|
| Soneto 5.5 de Claude | 1.019/1.022 | 99.71% |
| Gemini 3.8 Flash | 998/1.000 | 99.80% |
| Gemini 3.1 Pro | 997/1.000 | 99.70% |
| Claude Opus 5.5 | 997/1.000 | 99.70% |
| Fábula 5.1 | 1.093/1.097 | 99.64% |
| Claude Opus 5 | 1.105/1.107 | 99.82% |
| GPT-5.6 | 3.408/3.423 | 99.56% |
| Claude Soneto 5 | 1.145/1.147 | 99.83% |
| Gémeos 3 | 28/28 | 100% |
Se quiseres consultar um documento específico, podes experimentar o Pangram aqui.







