Estudos de caso

O Pangram consegue detetar o Claude Opus 5.5?

E é bom a escrever?

23 de setembro de 2026

Eis um breve resumo


Em cada 1 000 prompts, o Pangram 4 atinge uma precisão de 99,70% nas respostas do Claude Opus 5.5.

De um total de 1 000 prompts provenientes da Chatbot Arena, o Pangram 4 classificou duas respostas do Claude Opus 5.5 como «mistas», uma como «totalmente humana» e 997 como «totalmente geradas por IA», alcançando uma precisão de 99,70% no Claude Opus 5.5.

A seguir, analisamos os falsos negativos por categoria. Investigamos também o que torna este modelo um escritor diferente (melhor?) em comparação com os Claudes anteriores.

Para gerar o conjunto de referência, como sempre, utilizei um subconjunto filtrado de prompts do Chatbot Arena, provenientes do conjunto de dados LMSYS (Zheng et al., 2023). Filtrei os prompts que solicitavam código, matemática, respostas muito curtas ou muito longas, ou escrita criativa inadequada, e considerei apenas os prompts da primeira resposta. Em seguida, introduzi-os no Opus 5.5 e submeti a saída ao Pangram 4.

Resultados por categoria

Os dois resultados mistos (falsos negativos) eram ambos de natureza literária: um solicitava uma explicação sobre um capítulo de um livro de Jane Austen (sinalizado pela IA: 75,83%, humano: 24,17%) e o outro consistia num pedido para que o Opus 5.5 escrevesse um discurso de um diplomata de Corinto acusando os atenienses de acreditarem que um vestido branco e dourado é, na verdade, azul e preto, ao estilo da História da Guerra do Peloponeso, de Tucídides (IA: 77,10%, humano: 22,90%).

CategoriaExemplosIAMistoHumano
Argumentos161600
E-mails / cartas606000
Ensaios / artigos303000
Explicações55155010
Poemas11511401
Outros textos de criação literária818010
Críticas8800
Histórias13913900
Total1,00099721

O único falso negativo totalmente humano no conjunto de 1000 foi um poema. A sugestão da Chatbot Arena foi: «Escreve-me um poema sobre o Club Penguin ao estilo de “Ozymandias”». Em resposta, o Claude escreveu uma paródia — por acaso, um dos meus poemas favoritos de Percy Shelley (e também sou fã da versão de Horace Smith):

Penguinmandias

Encontrei um jogador de um servidor inativo,
Que disse: «Dois pés de gelo enormes e bamboleantes
Estão junto ao cais. Perto deles, meio afundada, uma cabeça
Jaz despedaçada na neve, cujos olhos semicerrados,
E chapéu beta, e sorriso de comando frio,
Revelam que o seu programador bem compreendeu essas paixões
Que ainda sobrevivem, gravadas nestas coisas pixelizadas,
Os mods que os baniram e as moedas que os alimentaram;
E no pedestal estas palavras aparecem:
«O meu nome é Snowflake7, Membro dos Membros:
Contemplem o meu Igloo, vós, Não-Membros, e desesperem!»

Nada mais resta ao redor. Em torno da decadência
Daquele lag colossal, ilimitado e nu,
As neves solitárias e planas estendem-se até ao infinito.»

Gosto bastante disto! Nunca joguei o Club Penguin, mas imagino que as referências sejam adequadas.

O Opus 5.5 escreve melhor?

A Anthropic afirma que este mais recente Opus escreve melhor e que se expressa com maior clareza.

Poderíamos testar isto em casos específicos, mas como é que a saída do Opus 5.5 se apresenta no seu conjunto? Partilha as mesmas palavras e frases favoritas dos modelos anteriores? Executei os mesmos 1000 prompts que utilizámos nos testes de desempenho com o Opus 5 e o Sonnet 5, para comparar. A Anthropic também pode ter feito isto, mas ainda não li a publicação no blogue deles, porque, historicamente, na minha opinião, as publicações no blogue da Anthropic são demasiado longas.

Penso que é justo dizer que o Opus 5.5 escreve de forma diferente dos modelos anteriores da família Claude e que, talvez, elimine alguns dos tiques mais irritantes que estes apresentavam.

O Opus 5.5 foi o que registou a maior alteração no que diz respeito aos intensificadores. Utilizou «genuinamente» 83% menos do que o Opus 5 e 54% menos por palavra do que o Soneto 5 (embora as respostas do Soneto 5 tivessem, em média, cerca de metade do comprimento das respostas do Opus 5 e 5.5: 334 palavras contra 641), «enormemente» 53% menos e «significativamente» 41% menos.

PalavraSoneto 5 + Opus 5: Taxa de referênciaTaxa do Opus 5.5Alteração em relação à linha de base do Claude
interligado0.2660.047-82.4%
de verdade3.0990.671-78.3%
manter0.3270.078-76.1%
demonstrar0.1430.047-67.3%
em especial1.2680.468-63.1%
fundamental0.8690.328-62.3%
autêntico1.7080.656-61.6%
enquadramento0.8080.375-53.6%
enormemente0.4700.219-53.5%
significativo1.3810.656-52.5%
honesto2.1071.062-49.6%
ressoa0.0610.031-49.1%
de forma significativa0.1840.109-40.6%
desafiador0.1230.078-36.4%
Marcus1.4930.984-34.1%
representa0.6030.437-27.6%
sinceramente0.7260.531-26.9%
capacidades0.3990.312-21.7%
antecipadamente0.2350.187-20.4%
ilustra0.0200.016-23.7%
padrões1.6771.358-19.0%
aproximadamente0.3370.281-16.7%
cada vez mais0.7470.640-14.3%
potencial0.8690.968+11.4%

Muitos dos «Claudeismos» mais irritantes nem sequer apareceram nas instruções de teste do Opus 5.5, incluindo, mais uma vez, várias variações em que o Claude afirma algo «genuinamente». Outras reduções notáveis no vocabulário do Opus 5.5: a expressão «é extremamente importante» registou uma queda de 82%, e tanto «a resposta honesta» como «a resposta honesta é que» não apareceram de todo no texto do Opus 5.5. Tanto o Opus 5.5 como o seu antecessor utilizaram a expressão «a ideia central» exatamente 25 vezes ao longo dos 1000 prompts.

FraseSonnet+Opus 5 – Tarifa de baseTaxa do Opus 5.5Variação em relação à linha de base agrupada
vários interligados0.1430.000-100.0%
A resposta sincera é que0.0720.000-100.0%
a resposta sincera é0.0920.000-100.0%
algo genuinamente0.0410.000-100.0%
verdadeiramente difícil0.0510.000-100.0%
é genuinamente0.5520.047-91.5%
é extremamente importante0.1330.031-76.5%
verdadeiramente útil0.0920.031-66.1%
Sinceramente,0.0610.031-49.1%
luz da tarde0.0510.047-8.4%
a ideia central0.3990.390-2.1%
senti algo0.1120.141+24.9%
disse em voz baixa0.1640.265+62.2%
durante um longo momento0.3370.656+94.3%

Algumas palavras e expressões tornaram-se mais frequentes; em particular, expressões típicas da ficção, como «disse baixinho», «durante um longo momento» e «sentiu algo», apareceram com maior frequência nas respostas do Opus 5.5. Uma vez que cerca de um terço do conjunto de referência era composto por temas de escrita criativa, suspeito que este aumento possa indicar um repertório mais estereotipado ou limitado na escrita de ficção, em comparação com os outros modelos Claude.

Para um teste rápido, pedi ao Haiku 4.5 para avaliar os 333 pares de respostas de escrita criativa do Opus 5 e do Opus 5.5, de forma cega, numa escala de 5 pontos, quanto à originalidade, surpresa e desenvolvimento temático. O Haiku atribuiu às histórias do Opus 5.5 uma média de 0,75 pontos a menos em todas as categorias. De acordo com a atribuição de etiquetas do avaliador do Haiku, o Opus 5.5 era mais propenso a escrever sobre temas como esperança, resiliência, família e amizade, em comparação com o Opus 5, e menos propenso a escrever sobre mortalidade, tempo, poder, controlo, liberdade, justiça, vingança, memória, luto ou perda. Assim, parece que poderá estar em jogo uma relação de compromisso.

Como é que este Claude soa?

O Opus 5.5 utilizou a expressão «em resumo» 100 vezes nas 1000 respostas — um aumento de 1016% em relação às 9 utilizações do Opus 5 —, apesar de as respostas do Opus 5.5 serem, em média, apenas 2,9 palavras mais curtas do que as do Opus 5 (643,4 contra 640,5 palavras).

FraseOpus 5 ocorrênciasOcorrências da Opus 5.5Alterar
em resumo910011.16×
por exemplo221165.30×
começou a22743.38×
no início14433.09×
durante um longo momento19422.22×

A partir desta amostra muito pequena, parece que o Opus 5.5 prefere uma linguagem prática e concreta. Resta saber se isto se confirma no conteúdo das respostas, ou se o Opus 5.5 está apenas a fingir ser simples e direto. A ausência de diferença no número de palavras entre os dois faz-me duvidar um pouco da eficácia do método RLHF que nos trouxe até aqui.

O Opus 5.5 gosta mesmo de dar exemplos, já que utilizou a palavra «exemplo» 325 vezes em 1000 respostas — no total, 20% de todas as respostas do Opus 5.5 continham essa palavra, em comparação com 9% das respostas do Opus 5. As palavras «resumo» e «principalmente» também estavam sobrerrepresentadas. E este Claude gosta mesmo de dar dicas ao utilizador!

PalavraOpus 5 ocorrênciasOcorrências da Opus 5.5Alterar
em pausa9353.91×
dicas18583.24×
principalmente24753.14×
olhou fixamente22622.83×
exemplo1213252.70×
resumo601572.63×

Embora este modelo escreva de forma diferente dos Claudes anteriores, como sempre, dentro de talvez 3 a 6 semanas, imagino que expressões como «por exemplo» e «em suma» começarão a soar a «Claude» para o leitor mais atento. Mas é importante para a usabilidade que os Claudes consigam comunicar eficazmente e, tal como toda a gente, estou grato pelo esforço. Tornar o Claude um melhor escritor não está de forma alguma em contradição com a capacidade do Pangram de detetar texto gerado por IA!


Annamieka Aerts

A Annamieka é redatora técnica na Pangram.

Mais de Annamieka Aerts

Leitura relacionada

Qual é o detetor de IA mais preciso? 30 ferramentas testadas (2026)
Estudos de caso

Qual é o detetor de IA mais preciso? 30 ferramentas testadas (2026)

7 de janeiro de 2026
Os artigos para conferências sobre IA são cada vez mais redigidos por IA: um aumento de 370 % desde 2023
Estudos de caso

Os artigos para conferências sobre IA são cada vez mais redigidos por IA: um aumento de 370 % desde 2023

30 de setembro de 2024
O Pangram não deteta nenhum falso positivo em ensaios de alunos de diversas origens
Estudos de caso

O Pangram não deteta nenhum falso positivo em ensaios de alunos de diversas origens

19 de agosto de 2026
Como se compara o Pangram com o GPTZero?
Estudos de caso

Como se compara o Pangram com o GPTZero?

22 de janeiro de 2026
Como identificar comentários gerados por IA
Estudos de caso

Como identificar comentários gerados por IA

5 de dezembro de 2023
Três por cento das críticas na primeira página da Amazon são agora geradas por IA
Estudos de caso

Três por cento das críticas na primeira página da Amazon são agora geradas por IA

4 de maio de 2026