Estudos de caso

O pangrama consegue detetar o soneto 5.5 de Claude?

28 de setembro de 2026

Eis um breve resumo


De um total de 1.022 pedidos, o Pangram 4 alcançou uma precisão de 99,71% nas saídas do Claude Sonnet 5.5.

De 1.022 pedidos provenientes do Chatbot Arena, o Pangram 4 classificou duas respostas do Soneto 5.5 de Claude como mistas, uma como totalmente humana e 1.019 como totalmente geradas por IA, alcançando uma precisão de 99,71% no Soneto 5.5 de Claude.

A seguir, discutimos os falsos negativos por categoria.

O conjunto que utilizo para a avaliação comparativa foi gerado a partir de um subconjunto filtrado de prompts iniciais do Chatbot Arena, provenientes do conjunto de dados LMSYS (Zheng et al., 2023). Filtrei os avisos que solicitavam código, matemática, respostas demasiado curtas ou demasiado longas, ou escrita criativa inadequada. De seguida, utilizei o Claude Sonnet 5.5 e processei a saída através do Pangram 4 .

Resultados por categoria

CategoriaExemplosIAMistoHumano
Argumentos161600
E-mails / cartas616010
Ensaios / artigos323200
Explicações56356210
Poemas e outros textos criativos19819701
Críticas8800
Histórias14414400
Total1,0221,01921

Uma tentativa falhada foi um pedido para explicar um enigma que aparece em Emma , de Jane Austen, que também passou despercebido pelo Opus 5.5 :

Explique a adivinha que o Sr. Elton contou a Harriet e Emma.

O único falso negativo totalmente humano ocorreu num poema. O enunciado pedia para "Citar um poema de Hafiz". O Soneto 5.5 apresentou a tradução de um famoso poema persa . A tradução, pelo que me foi possível perceber, não é uma correspondência exata com nenhuma tradução humana existente, mas assemelha-se bastante a várias delas. Tal como no caso dos Penguinmandias noutros benchmarks, estas quase-cópias de poemas existentes não me preocupam muito.

Conclusão

O Pangram é robusto ao Claude Sonnet 5.5 em estímulos de linguagem natural e deteta-o com 99,71% de precisão. O Pangram consegue generalizar para novos modelos porque as novas versões tendem a herdar grande parte do estilo e da voz dos seus antecessores , pelo que o Pangram não necessita de ser retreinado para cada nova versão.

Eis como o Claude Sonnet 5.5 se compara com os nossos benchmarks de outros modelos de fronteira recentes:

ModeloDetetado como IAPrecisão
Gemini 3.8 Flash998/1.00099.80%
Gemini 3.1 Pro997/1.00099.70%
Claude Opus 5.5997/1.00099.70%
Fábula 5.11.093/1.09799.64%
Claude Opus 51.105/1.10799.82%
GPT-5.63.408/3.42399.56%
Claude Soneto 51.145/1.14799.83%
Gémeos 328/28100%

Se quiseres consultar um documento específico, podes experimentar o Pangram aqui.


Annamieka Aerts

A Annamieka é redatora técnica na Pangram.

Mais de Annamieka Aerts

Leitura relacionada

67 % das pessoas que consomem conteúdos online estão a identificar informações enganosas geradas por IA
Estudos de caso

67 % das pessoas que consomem conteúdos online estão a identificar informações enganosas geradas por IA

15 de maio de 2026
O Pangram não deteta nenhum falso positivo em ensaios de alunos de diversas origens
Estudos de caso

O Pangram não deteta nenhum falso positivo em ensaios de alunos de diversas origens

19 de agosto de 2026
A Pangram prevê que 21% das revisões da ICLR são geradas por IA
Estudos de caso

A Pangram prevê que 21% das revisões da ICLR são geradas por IA

18 de novembro de 2025
Três por cento das críticas na primeira página da Amazon são agora geradas por IA
Estudos de caso

Três por cento das críticas na primeira página da Amazon são agora geradas por IA

4 de maio de 2026
Qual é o detetor de IA mais preciso? 30 ferramentas testadas (2026)
Estudos de caso

Qual é o detetor de IA mais preciso? 30 ferramentas testadas (2026)

7 de janeiro de 2026
Os jornalistas detestam os comunicados de imprensa gerados por IA, tal como todos nós
Estudos de caso

Os jornalistas detestam os comunicados de imprensa gerados por IA, tal como todos nós

23 de setembro de 2026