Et est-ce qu'il écrit bien ?
Sur 1 000 requêtes, Pangram 4 atteint une précision de 99,70 % sur les résultats générés par Claude Opus 5.5.
Sur 1 000 requêtes issues de Chatbot Arena, Pangram 4 a classé deux réponses générées par Claude Opus 5.5 comme « mixtes », une comme « entièrement humaine » et 997 comme « entièrement générées par l'IA », atteignant ainsi une précision de 99,70 % sur Claude Opus 5.5.
Nous abordons ci-dessous les faux négatifs par catégorie. Nous examinons également ce qui fait de ce modèle un rédacteur différent (meilleur ?) par rapport aux versions précédentes de Claude.
Pour générer l’ensemble de référence, j’ai, comme à l’accoutumée, utilisé un sous-ensemble filtré de prompts « Chatbot Arena » issus de l’ensemble de données LMSYS (Zheng et al., 2023). J’ai écarté les prompts demandant du code, des calculs mathématiques, des réponses très courtes ou très longues, ou encore des exercices de création littéraire inappropriés, et je n’ai pris en compte que les prompts de premier tour. J’ai ensuite soumis ces prompts à Opus 5.5 et j’ai traité les résultats à l’aide de Pangram 4.
Les deux faux négatifs parmi les résultats mixtes concernaient tous deux la littérature : l’un demandait une explication d’un chapitre d’un livre de Jane Austen (signalé par l’IA : 75,83 %, humain : 24,17 %) et l’autre consistait à demander à Opus 5.5 de rédiger un discours d’un diplomate corinthien accusant les Athéniens de croire qu’une robe blanche et dorée est en réalité bleue et noire, dans le style de l’Histoire de la guerre du Péloponnèse de Thucydide (IA : 77,10 %, humain : 22,90 %).
| Catégorie | Exemples | IA | Mixte | Humain |
|---|---|---|---|---|
| Arguments | 16 | 16 | 0 | 0 |
| E-mails / lettres | 60 | 60 | 0 | 0 |
| Essais / articles | 30 | 30 | 0 | 0 |
| Explications | 551 | 550 | 1 | 0 |
| Poèmes | 115 | 114 | 0 | 1 |
| Autres textes de création littéraire | 81 | 80 | 1 | 0 |
| Avis | 8 | 8 | 0 | 0 |
| Récits | 139 | 139 | 0 | 0 |
| Total | 1,000 | 997 | 2 | 1 |
Le seul faux négatif entièrement humain parmi les 1 000 exemples était un poème. La consigne donnée par Chatbot Arena était la suivante : « Écris-moi un poème sur Club Penguin dans le style d’Ozymandias. » En réponse, Claude a rédigé une parodie — par hasard — de l’un de mes poèmes préférés de Percy Shelley (et je suis également fan de la version d’Horace Smith) :
Penguinmandias
J’ai rencontré un joueur d’un serveur désaffecté,
Qui m’a dit : « Deux immenses pieds de glace qui se dandinent
Se dressent près du quai. Près d’eux, à demi enfouie, une tête
Gît brisée dans la neige, dont les yeux plissés,
Le chapeau bêta et le rictus d’un ordre glacial,
Témoignent que son codeur a bien saisi ces passions
Qui subsistent encore, gravées sur ces objets pixélisés,
Les mods qui les ont bannis, et les pièces qui les ont nourris ;
Et sur le piédestal apparaissent ces mots :
« Je m’appelle Snowflake7, membre parmi les membres :
Contemplez mon igloo, ô non-membres, et désespérez ! »
Il ne reste rien d’autre. Autour de la ruine
De ce lag colossal, infini et nu,
Les neiges solitaires et uniformes s’étendent à perte de vue. »
J'adore ça ! Je n'ai jamais joué à Club Penguin, mais j'imagine que les clins d'œil sont bien trouvés.
Anthropic affirme que ce tout dernier Opus est plus performant en matière de rédaction et qu'il communique avec plus de clarté.
Nous pourrions tester cela sur des cas particuliers, mais à quoi ressemble globalement la production d’Opus 5.5 ? Partage-t-il les mêmes mots et expressions préférés que les modèles précédents ? J’ai soumis les 1 000 mêmes prompts que nous avions utilisés pour nos tests de performance à Opus 5 et à Sonnet 5 afin de les comparer. Anthropic l’a peut-être fait aussi, mais je n’ai pas encore lu leur article de blog, car, d’après mon expérience, les articles du blog d’Anthropic sont généralement trop longs.
Je pense qu'on peut dire sans se tromper que l'Opus 5.5 s'écrit différemment des modèles précédents de la gamme Claude, et qu'il se débarrasse peut-être de certains des tics les plus agaçants qu'ils présentaient.
C'est l'Opus 5.5 qui a connu les changements les plus importants en matière d'intensificateurs. Il a utilisé le mot « véritablement » 83 % moins souvent qu’Opus 5, et 54 % moins souvent par mot que Sonnet 5 (bien que les réponses de Sonnet 5 aient été, en moyenne, environ deux fois plus courtes que celles d’Opus 5 et 5.5 : 334 mots contre 641), le mot « énormément » 53 % moins souvent, et le mot « de manière significative » 41 % moins souvent.
| Mot | Sonnet 5 + Opus 5 : tarif de base | Taux Opus 5.5 | Évolution par rapport à la valeur de référence de Claude |
|---|---|---|---|
| interconnecté | 0.266 | 0.047 | -82.4% |
| sincèrement | 3.099 | 0.671 | -78.3% |
| maintenir | 0.327 | 0.078 | -76.1% |
| démontrer | 0.143 | 0.047 | -67.3% |
| en particulier | 1.268 | 0.468 | -63.1% |
| fondamental | 0.869 | 0.328 | -62.3% |
| authentique | 1.708 | 0.656 | -61.6% |
| encadrement | 0.808 | 0.375 | -53.6% |
| énormément | 0.470 | 0.219 | -53.5% |
| important | 1.381 | 0.656 | -52.5% |
| honnête | 2.107 | 1.062 | -49.6% |
| trouve un écho | 0.061 | 0.031 | -49.1% |
| de manière significative | 0.184 | 0.109 | -40.6% |
| exigeant | 0.123 | 0.078 | -36.4% |
| Marcus | 1.493 | 0.984 | -34.1% |
| représente | 0.603 | 0.437 | -27.6% |
| honnêtement | 0.726 | 0.531 | -26.9% |
| capacités | 0.399 | 0.312 | -21.7% |
| d'emblée | 0.235 | 0.187 | -20.4% |
| illustre | 0.020 | 0.016 | -23.7% |
| motifs | 1.677 | 1.358 | -19.0% |
| environ | 0.337 | 0.281 | -16.7% |
| de plus en plus | 0.747 | 0.640 | -14.3% |
| potentiel | 0.869 | 0.968 | +11.4% |
Bon nombre des « Claudeismes » les plus agaçants n’apparaissaient pas du tout dans les prompts du benchmark Opus 5.5, parmi lesquels figuraient à nouveau plusieurs variantes où Claude affirmait quelque chose « sincèrement ». Autres baisses notables dans le vocabulaire d’Opus 5.5 : « matters enormously » a connu une baisse de 82 %, et les expressions « the honest answer » et « the honest answer is that » n’apparaissaient pas du tout dans le texte d’Opus 5.5. Opus 5.5 et son prédécesseur ont tous deux utilisé l’expression « the core idea » exactement 25 fois sur les 1 000 consignes.
| Phrase | Sonnet+Opus 5 : tarif de base | Taux Opus 5.5 | Évolution par rapport à la valeur de référence groupée |
|---|---|---|---|
| plusieurs éléments interconnectés | 0.143 | 0.000 | -100.0% |
| La réponse honnête, c'est que | 0.072 | 0.000 | -100.0% |
| La réponse honnête est : | 0.092 | 0.000 | -100.0% |
| quelque chose de vraiment | 0.041 | 0.000 | -100.0% |
| vraiment difficile | 0.051 | 0.000 | -100.0% |
| est véritablement | 0.552 | 0.047 | -91.5% |
| cela a une importance considérable | 0.133 | 0.031 | -76.5% |
| vraiment utile | 0.092 | 0.031 | -66.1% |
| Je suis sincèrement | 0.061 | 0.031 | -49.1% |
| lumière de l'après-midi | 0.051 | 0.047 | -8.4% |
| l'idée centrale | 0.399 | 0.390 | -2.1% |
| j'ai ressenti quelque chose | 0.112 | 0.141 | +24.9% |
| dit à voix basse | 0.164 | 0.265 | +62.2% |
| pendant un long moment | 0.337 | 0.656 | +94.3% |
Certains mots et expressions sont plus fréquents ; en particulier, des tournures propres à la fiction telles que « dit doucement », « pendant un long moment » et « sentit quelque chose » apparaissent plus souvent dans les réponses d’Opus 5.5. Étant donné que la référence comprenait environ un tiers de sujets d’écriture créative, je soupçonne que cette augmentation pourrait indiquer un répertoire plus stéréotypé ou plus limité lors de la rédaction de fiction par rapport aux autres modèles Claude.
Pour vérifier rapidement cette hypothèse, j’ai demandé à Haiku 4.5 d’évaluer, en aveugle, les 333 paires de textes créatifs issus d’Opus 5 et d’Opus 5.5 sur une échelle de 5 points, selon les critères d’originalité, de surprise et de développement thématique. Il a attribué aux récits d’Opus 5.5 une note moyenne inférieure de 0,75 point dans chaque catégorie. D’après les étiquettes attribuées par le correcteur Haiku, Opus 5.5 avait davantage tendance à aborder des thèmes tels que l’espoir, la résilience, la famille et l’amitié par rapport à Opus 5, et moins tendance à traiter de la mortalité, du temps, du pouvoir, du contrôle, de la liberté, de la justice, de la vengeance, de la mémoire, du deuil ou de la perte. Il semblerait donc qu’il y ait un compromis à l’œuvre.
Opus 5.5 a utilisé l'expression « en bref » 100 fois sur l'ensemble des 1 000 réponses — soit une augmentation de 1 016 % par rapport aux 9 occurrences d'Opus 5 — alors que les réponses d'Opus 5.5 ne comptaient en moyenne que 2,9 mots de moins que celles d'Opus 5 (643,4 contre 640,5 mots).
| Phrase | Opus 5 occurrences | Occurrences de l'opus 5.5 | Modifier |
|---|---|---|---|
| en bref | 9 | 100 | 11.16× |
| par exemple | 22 | 116 | 5.30× |
| a commencé à | 22 | 74 | 3.38× |
| au début | 14 | 43 | 3.09× |
| pendant un long moment | 19 | 42 | 2.22× |
Au vu de cet échantillon très restreint, il semble qu’Opus 5.5 privilégie un langage concret et terre-à-terre. Reste à voir si cela se confirme dans le fond des réponses, ou si Opus 5.5 se contente de faire mine d’être simple et direct. L’absence de différence au niveau du nombre de mots entre les deux me fait un peu douter de l’efficacité de la méthode RLHF qui nous a menés jusqu’ici.
Opus 5.5 aime beaucoup donner des exemples, puisqu’il a utilisé le mot « exemple » 325 fois sur 1 000 réponses — au total, 20 % de toutes les réponses d’Opus 5.5 contenaient ce mot, contre 9 % pour celles d’Opus 5. Les termes « résumé » et « principalement » étaient également surreprésentés. Et ce Claude aime vraiment donner des conseils à l’utilisateur !
| Mot | Opus 5 occurrences | Occurrences de l'opus 5.5 | Modifier |
|---|---|---|---|
| en pause | 9 | 35 | 3.91× |
| conseils | 18 | 58 | 3.24× |
| principalement | 24 | 75 | 3.14× |
| fixé du regard | 22 | 62 | 2.83× |
| exemple | 121 | 325 | 2.70× |
| résumé | 60 | 157 | 2.63× |
Même si ce modèle écrit différemment des versions précédentes de Claude, comme toujours, d’ici trois à six semaines environ, j’imagine que des expressions telles que « par exemple » et « en résumé » commenceront à trahir la présence de Claude aux yeux du lecteur attentif. Mais il est important, pour des raisons d’ergonomie, que les modèles Claude puissent communiquer efficacement, et, comme tout le monde, j’apprécie les efforts déployés. Améliorer les capacités rédactionnelles de Claude n’est en aucun cas incompatible avec la capacité de Pangram à détecter les textes générés par l’IA !

Annamieka est rédactrice technique chez Pangram.






