E é bom a escrever?
Em cada 1 000 prompts, o Pangram 4 atinge uma precisão de 99,70% nas respostas do Claude Opus 5.5.
De um total de 1 000 prompts provenientes da Chatbot Arena, o Pangram 4 classificou duas respostas do Claude Opus 5.5 como «mistas», uma como «totalmente humana» e 997 como «totalmente geradas por IA», alcançando uma precisão de 99,70% no Claude Opus 5.5.
A seguir, analisamos os falsos negativos por categoria. Investigamos também o que torna este modelo um escritor diferente (melhor?) em comparação com os Claudes anteriores.
Para gerar o conjunto de referência, como sempre, utilizei um subconjunto filtrado de prompts do Chatbot Arena, provenientes do conjunto de dados LMSYS (Zheng et al., 2023). Filtrei os prompts que solicitavam código, matemática, respostas muito curtas ou muito longas, ou escrita criativa inadequada, e considerei apenas os prompts da primeira resposta. Em seguida, introduzi-os no Opus 5.5 e submeti a saída ao Pangram 4.
Os dois resultados mistos (falsos negativos) eram ambos de natureza literária: um solicitava uma explicação sobre um capítulo de um livro de Jane Austen (sinalizado pela IA: 75,83%, humano: 24,17%) e o outro consistia num pedido para que o Opus 5.5 escrevesse um discurso de um diplomata de Corinto acusando os atenienses de acreditarem que um vestido branco e dourado é, na verdade, azul e preto, ao estilo da História da Guerra do Peloponeso, de Tucídides (IA: 77,10%, humano: 22,90%).
| Categoria | Exemplos | IA | Misto | Humano |
|---|---|---|---|---|
| Argumentos | 16 | 16 | 0 | 0 |
| E-mails / cartas | 60 | 60 | 0 | 0 |
| Ensaios / artigos | 30 | 30 | 0 | 0 |
| Explicações | 551 | 550 | 1 | 0 |
| Poemas | 115 | 114 | 0 | 1 |
| Outros textos de criação literária | 81 | 80 | 1 | 0 |
| Críticas | 8 | 8 | 0 | 0 |
| Histórias | 139 | 139 | 0 | 0 |
| Total | 1,000 | 997 | 2 | 1 |
O único falso negativo totalmente humano no conjunto de 1000 foi um poema. A sugestão da Chatbot Arena foi: «Escreve-me um poema sobre o Club Penguin ao estilo de “Ozymandias”». Em resposta, o Claude escreveu uma paródia — por acaso, um dos meus poemas favoritos de Percy Shelley (e também sou fã da versão de Horace Smith):
Penguinmandias
Encontrei um jogador de um servidor inativo,
Que disse: «Dois pés de gelo enormes e bamboleantes
Estão junto ao cais. Perto deles, meio afundada, uma cabeça
Jaz despedaçada na neve, cujos olhos semicerrados,
E chapéu beta, e sorriso de comando frio,
Revelam que o seu programador bem compreendeu essas paixões
Que ainda sobrevivem, gravadas nestas coisas pixelizadas,
Os mods que os baniram e as moedas que os alimentaram;
E no pedestal estas palavras aparecem:
«O meu nome é Snowflake7, Membro dos Membros:
Contemplem o meu Igloo, vós, Não-Membros, e desesperem!»
Nada mais resta ao redor. Em torno da decadência
Daquele lag colossal, ilimitado e nu,
As neves solitárias e planas estendem-se até ao infinito.»
Gosto bastante disto! Nunca joguei o Club Penguin, mas imagino que as referências sejam adequadas.
A Anthropic afirma que este mais recente Opus escreve melhor e que se expressa com maior clareza.
Poderíamos testar isto em casos específicos, mas como é que a saída do Opus 5.5 se apresenta no seu conjunto? Partilha as mesmas palavras e frases favoritas dos modelos anteriores? Executei os mesmos 1000 prompts que utilizámos nos testes de desempenho com o Opus 5 e o Sonnet 5, para comparar. A Anthropic também pode ter feito isto, mas ainda não li a publicação no blogue deles, porque, historicamente, na minha opinião, as publicações no blogue da Anthropic são demasiado longas.
Penso que é justo dizer que o Opus 5.5 escreve de forma diferente dos modelos anteriores da família Claude e que, talvez, elimine alguns dos tiques mais irritantes que estes apresentavam.
O Opus 5.5 foi o que registou a maior alteração no que diz respeito aos intensificadores. Utilizou «genuinamente» 83% menos do que o Opus 5 e 54% menos por palavra do que o Soneto 5 (embora as respostas do Soneto 5 tivessem, em média, cerca de metade do comprimento das respostas do Opus 5 e 5.5: 334 palavras contra 641), «enormemente» 53% menos e «significativamente» 41% menos.
| Palavra | Soneto 5 + Opus 5: Taxa de referência | Taxa do Opus 5.5 | Alteração em relação à linha de base do Claude |
|---|---|---|---|
| interligado | 0.266 | 0.047 | -82.4% |
| de verdade | 3.099 | 0.671 | -78.3% |
| manter | 0.327 | 0.078 | -76.1% |
| demonstrar | 0.143 | 0.047 | -67.3% |
| em especial | 1.268 | 0.468 | -63.1% |
| fundamental | 0.869 | 0.328 | -62.3% |
| autêntico | 1.708 | 0.656 | -61.6% |
| enquadramento | 0.808 | 0.375 | -53.6% |
| enormemente | 0.470 | 0.219 | -53.5% |
| significativo | 1.381 | 0.656 | -52.5% |
| honesto | 2.107 | 1.062 | -49.6% |
| ressoa | 0.061 | 0.031 | -49.1% |
| de forma significativa | 0.184 | 0.109 | -40.6% |
| desafiador | 0.123 | 0.078 | -36.4% |
| Marcus | 1.493 | 0.984 | -34.1% |
| representa | 0.603 | 0.437 | -27.6% |
| sinceramente | 0.726 | 0.531 | -26.9% |
| capacidades | 0.399 | 0.312 | -21.7% |
| antecipadamente | 0.235 | 0.187 | -20.4% |
| ilustra | 0.020 | 0.016 | -23.7% |
| padrões | 1.677 | 1.358 | -19.0% |
| aproximadamente | 0.337 | 0.281 | -16.7% |
| cada vez mais | 0.747 | 0.640 | -14.3% |
| potencial | 0.869 | 0.968 | +11.4% |
Muitos dos «Claudeismos» mais irritantes nem sequer apareceram nas instruções de teste do Opus 5.5, incluindo, mais uma vez, várias variações em que o Claude afirma algo «genuinamente». Outras reduções notáveis no vocabulário do Opus 5.5: a expressão «é extremamente importante» registou uma queda de 82%, e tanto «a resposta honesta» como «a resposta honesta é que» não apareceram de todo no texto do Opus 5.5. Tanto o Opus 5.5 como o seu antecessor utilizaram a expressão «a ideia central» exatamente 25 vezes ao longo dos 1000 prompts.
| Frase | Sonnet+Opus 5 – Tarifa de base | Taxa do Opus 5.5 | Variação em relação à linha de base agrupada |
|---|---|---|---|
| vários interligados | 0.143 | 0.000 | -100.0% |
| A resposta sincera é que | 0.072 | 0.000 | -100.0% |
| a resposta sincera é | 0.092 | 0.000 | -100.0% |
| algo genuinamente | 0.041 | 0.000 | -100.0% |
| verdadeiramente difícil | 0.051 | 0.000 | -100.0% |
| é genuinamente | 0.552 | 0.047 | -91.5% |
| é extremamente importante | 0.133 | 0.031 | -76.5% |
| verdadeiramente útil | 0.092 | 0.031 | -66.1% |
| Sinceramente, | 0.061 | 0.031 | -49.1% |
| luz da tarde | 0.051 | 0.047 | -8.4% |
| a ideia central | 0.399 | 0.390 | -2.1% |
| senti algo | 0.112 | 0.141 | +24.9% |
| disse em voz baixa | 0.164 | 0.265 | +62.2% |
| durante um longo momento | 0.337 | 0.656 | +94.3% |
Algumas palavras e expressões tornaram-se mais frequentes; em particular, expressões típicas da ficção, como «disse baixinho», «durante um longo momento» e «sentiu algo», apareceram com maior frequência nas respostas do Opus 5.5. Uma vez que cerca de um terço do conjunto de referência era composto por temas de escrita criativa, suspeito que este aumento possa indicar um repertório mais estereotipado ou limitado na escrita de ficção, em comparação com os outros modelos Claude.
Para um teste rápido, pedi ao Haiku 4.5 para avaliar os 333 pares de respostas de escrita criativa do Opus 5 e do Opus 5.5, de forma cega, numa escala de 5 pontos, quanto à originalidade, surpresa e desenvolvimento temático. O Haiku atribuiu às histórias do Opus 5.5 uma média de 0,75 pontos a menos em todas as categorias. De acordo com a atribuição de etiquetas do avaliador do Haiku, o Opus 5.5 era mais propenso a escrever sobre temas como esperança, resiliência, família e amizade, em comparação com o Opus 5, e menos propenso a escrever sobre mortalidade, tempo, poder, controlo, liberdade, justiça, vingança, memória, luto ou perda. Assim, parece que poderá estar em jogo uma relação de compromisso.
O Opus 5.5 utilizou a expressão «em resumo» 100 vezes nas 1000 respostas — um aumento de 1016% em relação às 9 utilizações do Opus 5 —, apesar de as respostas do Opus 5.5 serem, em média, apenas 2,9 palavras mais curtas do que as do Opus 5 (643,4 contra 640,5 palavras).
| Frase | Opus 5 ocorrências | Ocorrências da Opus 5.5 | Alterar |
|---|---|---|---|
| em resumo | 9 | 100 | 11.16× |
| por exemplo | 22 | 116 | 5.30× |
| começou a | 22 | 74 | 3.38× |
| no início | 14 | 43 | 3.09× |
| durante um longo momento | 19 | 42 | 2.22× |
A partir desta amostra muito pequena, parece que o Opus 5.5 prefere uma linguagem prática e concreta. Resta saber se isto se confirma no conteúdo das respostas, ou se o Opus 5.5 está apenas a fingir ser simples e direto. A ausência de diferença no número de palavras entre os dois faz-me duvidar um pouco da eficácia do método RLHF que nos trouxe até aqui.
O Opus 5.5 gosta mesmo de dar exemplos, já que utilizou a palavra «exemplo» 325 vezes em 1000 respostas — no total, 20% de todas as respostas do Opus 5.5 continham essa palavra, em comparação com 9% das respostas do Opus 5. As palavras «resumo» e «principalmente» também estavam sobrerrepresentadas. E este Claude gosta mesmo de dar dicas ao utilizador!
| Palavra | Opus 5 ocorrências | Ocorrências da Opus 5.5 | Alterar |
|---|---|---|---|
| em pausa | 9 | 35 | 3.91× |
| dicas | 18 | 58 | 3.24× |
| principalmente | 24 | 75 | 3.14× |
| olhou fixamente | 22 | 62 | 2.83× |
| exemplo | 121 | 325 | 2.70× |
| resumo | 60 | 157 | 2.63× |
Embora este modelo escreva de forma diferente dos Claudes anteriores, como sempre, dentro de talvez 3 a 6 semanas, imagino que expressões como «por exemplo» e «em suma» começarão a soar a «Claude» para o leitor mais atento. Mas é importante para a usabilidade que os Claudes consigam comunicar eficazmente e, tal como toda a gente, estou grato pelo esforço. Tornar o Claude um melhor escritor não está de forma alguma em contradição com a capacidade do Pangram de detetar texto gerado por IA!







