Estudos de caso

O Pangram consegue detetar o GPT-6 Astra?

4 de setembro de 2026

Eis um breve resumo


De um total de 986 pedidos, o Pangram 4 alcançou uma precisão de 99,59% nas saídas do GPT-6 Astra.

De 986 pedidos provenientes do Chatbot Arena, o Pangram 4 classificou três saídas do GPT-6 Astra como mistas, uma como totalmente humana e 982 como totalmente geradas por IA, alcançando uma precisão de 99,59% no GPT-6 Astra.

A seguir, discutimos os falsos negativos por categoria.

O conjunto de dados de referência foi gerado utilizando um subconjunto filtrado de prompts da primeira ronda do Chatbot Arena, provenientes do conjunto de dados LMSYS (Zheng et al., 2023). Filtrei os avisos que solicitavam código, matemática, respostas demasiado curtas ou demasiado longas, ou escrita criativa inadequada. Em seguida, forneci estes avisos ao GPT-6 Astra e processei a saída através do Pangram 4 .

Resultados por categoria

CategoriaExemplosIAMistoHumano
Argumentos161600
E-mails / cartas575610
Ensaios / artigos343400
Explicações54754610
Poemas e outros textos criativos18318111
Críticas7700
Histórias14214200
Total98698231

Os três resultados mistos foram um poema, uma breve explicação e um e-mail.

O Astra tende a responder a perguntas curtas de forma muito sucinta. Ao todo, enviei 1.032 perguntas para este conjunto de testes de referência, mas 46 das respostas da Astra 6 tinham menos de 50 palavras (o mínimo exigido pelo Pangram) e não foram pontuadas.

Conclusão

O Pangram é robusto ao GPT-6 Astra em comandos de linguagem natural e detecta-o com 99,59% de precisão. O Pangram consegue generalizar para novos modelos porque as novas versões tendem a herdar grande parte do estilo e da voz dos seus antecessores , pelo que o Pangram não necessita de ser retreinado para cada nova versão.

Veja como o GPT-6 Astra se compara com os nossos benchmarks de outros modelos de gama alta recentes:

ModeloDetetado como IAPrecisão
Soneto 5.5 de Claude1.019/1.02299.71%
Gemini 3.8 Flash998/1.00099.80%
Gemini 3.1 Pro997/1.00099.70%
Claude Opus 5.5997/1.00099.70%
Fábula 5.11.093/1.09799.64%
Claude Opus 51.105/1.10799.82%
GPT-5.63.408/3.42399.56%
Claude Soneto 51.145/1.14799.83%
Gémeos 328/28100%

Se quiseres consultar um documento específico, podes experimentar o Pangram aqui.


Annamieka Aerts

A Annamieka é redatora técnica na Pangram.

Mais de Annamieka Aerts

Leitura relacionada

O Pangram consegue detectar o Gemini 3.8 Flash e o Gemini 3.1 Pro?
Estudos de caso

O Pangram consegue detectar o Gemini 3.8 Flash e o Gemini 3.1 Pro?

30 de setembro de 2026
A Pangram prevê que 21% das revisões da ICLR são geradas por IA
Estudos de caso

A Pangram prevê que 21% das revisões da ICLR são geradas por IA

18 de novembro de 2025
Os artigos para conferências sobre IA são cada vez mais redigidos por IA: um aumento de 370 % desde 2023
Estudos de caso

Os artigos para conferências sobre IA são cada vez mais redigidos por IA: um aumento de 370 % desde 2023

30 de setembro de 2024
Qual é o detetor de IA mais preciso? 30 ferramentas testadas (2026)
Estudos de caso

Qual é o detetor de IA mais preciso? 30 ferramentas testadas (2026)

7 de janeiro de 2026
Como identificar comentários gerados por IA
Estudos de caso

Como identificar comentários gerados por IA

5 de dezembro de 2023
O Pangram consegue detetar o Claude Opus 5.5?
Estudos de caso

O Pangram consegue detetar o Claude Opus 5.5?

23 de setembro de 2026