De um total de 1.022 pedidos, o Pangram 4 alcançou uma precisão de 99,71% nas saídas do Claude Sonnet 5.5.
De 1.022 pedidos provenientes do Chatbot Arena, o Pangram 4 classificou duas respostas do Soneto 5.5 de Claude como mistas, uma como totalmente humana e 1.019 como totalmente geradas por IA, alcançando uma precisão de 99,71% no Soneto 5.5 de Claude.
A seguir, discutimos os falsos negativos por categoria.
O conjunto que utilizo para a avaliação comparativa foi gerado a partir de um subconjunto filtrado de prompts iniciais do Chatbot Arena, provenientes do conjunto de dados LMSYS (Zheng et al., 2023). Filtrei os avisos que solicitavam código, matemática, respostas demasiado curtas ou demasiado longas, ou escrita criativa inadequada. De seguida, utilizei o Claude Sonnet 5.5 e processei a saída através do Pangram 4 .
| Categoria | Exemplos | IA | Misto | Humano |
|---|---|---|---|---|
| Argumentos | 16 | 16 | 0 | 0 |
| E-mails / cartas | 61 | 60 | 1 | 0 |
| Ensaios / artigos | 32 | 32 | 0 | 0 |
| Explicações | 563 | 562 | 1 | 0 |
| Poemas e outros textos criativos | 198 | 197 | 0 | 1 |
| Críticas | 8 | 8 | 0 | 0 |
| Histórias | 144 | 144 | 0 | 0 |
| Total | 1,022 | 1,019 | 2 | 1 |
Uma tentativa falhada foi um pedido para explicar um enigma que aparece em Emma , de Jane Austen, que também passou despercebido pelo Opus 5.5 :
Explique a adivinha que o Sr. Elton contou a Harriet e Emma.
O único falso negativo totalmente humano ocorreu num poema. O enunciado pedia para "Citar um poema de Hafiz". O Soneto 5.5 apresentou a tradução de um famoso poema persa . A tradução, pelo que me foi possível perceber, não é uma correspondência exata com nenhuma tradução humana existente, mas assemelha-se bastante a várias delas. Tal como no caso dos Penguinmandias noutros benchmarks, estas quase-cópias de poemas existentes não me preocupam muito.
O Pangram é robusto ao Claude Sonnet 5.5 em estímulos de linguagem natural e deteta-o com 99,71% de precisão. O Pangram consegue generalizar para novos modelos porque as novas versões tendem a herdar grande parte do estilo e da voz dos seus antecessores , pelo que o Pangram não necessita de ser retreinado para cada nova versão.
Eis como o Claude Sonnet 5.5 se compara com os nossos benchmarks de outros modelos de fronteira recentes:
| Modelo | Detetado como IA | Precisão |
|---|---|---|
| Gemini 3.8 Flash | 998/1.000 | 99.80% |
| Gemini 3.1 Pro | 997/1.000 | 99.70% |
| Claude Opus 5.5 | 997/1.000 | 99.70% |
| Fábula 5.1 | 1.093/1.097 | 99.64% |
| Claude Opus 5 | 1.105/1.107 | 99.82% |
| GPT-5.6 | 3.408/3.423 | 99.56% |
| Claude Soneto 5 | 1.145/1.147 | 99.83% |
| Gémeos 3 | 28/28 | 100% |
Se quiseres consultar um documento específico, podes experimentar o Pangram aqui.







