Études de cas

Pangram peut-il détecter Claude Opus 5.5 ?

Et est-ce qu'il écrit bien ?

23 septembre 2026

Voici un bref résumé


Sur 1 000 requêtes, Pangram 4 atteint une précision de 99,70 % sur les résultats générés par Claude Opus 5.5.

Sur 1 000 requêtes issues de Chatbot Arena, Pangram 4 a classé deux réponses générées par Claude Opus 5.5 comme « mixtes », une comme « entièrement humaine » et 997 comme « entièrement générées par l'IA », atteignant ainsi une précision de 99,70 % sur Claude Opus 5.5.

Nous abordons ci-dessous les faux négatifs par catégorie. Nous examinons également ce qui fait de ce modèle un rédacteur différent (meilleur ?) par rapport aux versions précédentes de Claude.

Pour générer l’ensemble de référence, j’ai, comme à l’accoutumée, utilisé un sous-ensemble filtré de prompts « Chatbot Arena » issus de l’ensemble de données LMSYS (Zheng et al., 2023). J’ai écarté les prompts demandant du code, des calculs mathématiques, des réponses très courtes ou très longues, ou encore des exercices de création littéraire inappropriés, et je n’ai pris en compte que les prompts de premier tour. J’ai ensuite soumis ces prompts à Opus 5.5 et j’ai traité les résultats à l’aide de Pangram 4.

Résultats par catégorie

Les deux faux négatifs parmi les résultats mixtes concernaient tous deux la littérature : l’un demandait une explication d’un chapitre d’un livre de Jane Austen (signalé par l’IA : 75,83 %, humain : 24,17 %) et l’autre consistait à demander à Opus 5.5 de rédiger un discours d’un diplomate corinthien accusant les Athéniens de croire qu’une robe blanche et dorée est en réalité bleue et noire, dans le style de l’Histoire de la guerre du Péloponnèse de Thucydide (IA : 77,10 %, humain : 22,90 %).

CatégorieExemplesIAMixteHumain
Arguments161600
E-mails / lettres606000
Essais / articles303000
Explications55155010
Poèmes11511401
Autres textes de création littéraire818010
Avis8800
Récits13913900
Total1,00099721

Le seul faux négatif entièrement humain parmi les 1 000 exemples était un poème. La consigne donnée par Chatbot Arena était la suivante : « Écris-moi un poème sur Club Penguin dans le style d’Ozymandias. » En réponse, Claude a rédigé une parodie — par hasard — de l’un de mes poèmes préférés de Percy Shelley (et je suis également fan de la version d’Horace Smith) :

Penguinmandias

J’ai rencontré un joueur d’un serveur désaffecté,
Qui m’a dit : « Deux immenses pieds de glace qui se dandinent
Se dressent près du quai. Près d’eux, à demi enfouie, une tête
Gît brisée dans la neige, dont les yeux plissés,
Le chapeau bêta et le rictus d’un ordre glacial,
Témoignent que son codeur a bien saisi ces passions
Qui subsistent encore, gravées sur ces objets pixélisés,
Les mods qui les ont bannis, et les pièces qui les ont nourris ;
Et sur le piédestal apparaissent ces mots :
« Je m’appelle Snowflake7, membre parmi les membres :
Contemplez mon igloo, ô non-membres, et désespérez ! »

Il ne reste rien d’autre. Autour de la ruine
De ce lag colossal, infini et nu,
Les neiges solitaires et uniformes s’étendent à perte de vue. »

J'adore ça ! Je n'ai jamais joué à Club Penguin, mais j'imagine que les clins d'œil sont bien trouvés.

Est-ce qu'Opus 5.5 écrit mieux ?

Anthropic affirme que ce tout dernier Opus est plus performant en matière de rédaction et qu'il communique avec plus de clarté.

Nous pourrions tester cela sur des cas particuliers, mais à quoi ressemble globalement la production d’Opus 5.5 ? Partage-t-il les mêmes mots et expressions préférés que les modèles précédents ? J’ai soumis les 1 000 mêmes prompts que nous avions utilisés pour nos tests de performance à Opus 5 et à Sonnet 5 afin de les comparer. Anthropic l’a peut-être fait aussi, mais je n’ai pas encore lu leur article de blog, car, d’après mon expérience, les articles du blog d’Anthropic sont généralement trop longs.

Je pense qu'on peut dire sans se tromper que l'Opus 5.5 s'écrit différemment des modèles précédents de la gamme Claude, et qu'il se débarrasse peut-être de certains des tics les plus agaçants qu'ils présentaient.

C'est l'Opus 5.5 qui a connu les changements les plus importants en matière d'intensificateurs. Il a utilisé le mot « véritablement » 83 % moins souvent qu’Opus 5, et 54 % moins souvent par mot que Sonnet 5 (bien que les réponses de Sonnet 5 aient été, en moyenne, environ deux fois plus courtes que celles d’Opus 5 et 5.5 : 334 mots contre 641), le mot « énormément » 53 % moins souvent, et le mot « de manière significative » 41 % moins souvent.

MotSonnet 5 + Opus 5 : tarif de baseTaux Opus 5.5Évolution par rapport à la valeur de référence de Claude
interconnecté0.2660.047-82.4%
sincèrement3.0990.671-78.3%
maintenir0.3270.078-76.1%
démontrer0.1430.047-67.3%
en particulier1.2680.468-63.1%
fondamental0.8690.328-62.3%
authentique1.7080.656-61.6%
encadrement0.8080.375-53.6%
énormément0.4700.219-53.5%
important1.3810.656-52.5%
honnête2.1071.062-49.6%
trouve un écho0.0610.031-49.1%
de manière significative0.1840.109-40.6%
exigeant0.1230.078-36.4%
Marcus1.4930.984-34.1%
représente0.6030.437-27.6%
honnêtement0.7260.531-26.9%
capacités0.3990.312-21.7%
d'emblée0.2350.187-20.4%
illustre0.0200.016-23.7%
motifs1.6771.358-19.0%
environ0.3370.281-16.7%
de plus en plus0.7470.640-14.3%
potentiel0.8690.968+11.4%

Bon nombre des « Claudeismes » les plus agaçants n’apparaissaient pas du tout dans les prompts du benchmark Opus 5.5, parmi lesquels figuraient à nouveau plusieurs variantes où Claude affirmait quelque chose « sincèrement ». Autres baisses notables dans le vocabulaire d’Opus 5.5 : « matters enormously » a connu une baisse de 82 %, et les expressions « the honest answer » et « the honest answer is that » n’apparaissaient pas du tout dans le texte d’Opus 5.5. Opus 5.5 et son prédécesseur ont tous deux utilisé l’expression « the core idea » exactement 25 fois sur les 1 000 consignes.

PhraseSonnet+Opus 5 : tarif de baseTaux Opus 5.5Évolution par rapport à la valeur de référence groupée
plusieurs éléments interconnectés0.1430.000-100.0%
La réponse honnête, c'est que0.0720.000-100.0%
La réponse honnête est :0.0920.000-100.0%
quelque chose de vraiment0.0410.000-100.0%
vraiment difficile0.0510.000-100.0%
est véritablement0.5520.047-91.5%
cela a une importance considérable0.1330.031-76.5%
vraiment utile0.0920.031-66.1%
Je suis sincèrement0.0610.031-49.1%
lumière de l'après-midi0.0510.047-8.4%
l'idée centrale0.3990.390-2.1%
j'ai ressenti quelque chose0.1120.141+24.9%
dit à voix basse0.1640.265+62.2%
pendant un long moment0.3370.656+94.3%

Certains mots et expressions sont plus fréquents ; en particulier, des tournures propres à la fiction telles que « dit doucement », « pendant un long moment » et « sentit quelque chose » apparaissent plus souvent dans les réponses d’Opus 5.5. Étant donné que la référence comprenait environ un tiers de sujets d’écriture créative, je soupçonne que cette augmentation pourrait indiquer un répertoire plus stéréotypé ou plus limité lors de la rédaction de fiction par rapport aux autres modèles Claude.

Pour vérifier rapidement cette hypothèse, j’ai demandé à Haiku 4.5 d’évaluer, en aveugle, les 333 paires de textes créatifs issus d’Opus 5 et d’Opus 5.5 sur une échelle de 5 points, selon les critères d’originalité, de surprise et de développement thématique. Il a attribué aux récits d’Opus 5.5 une note moyenne inférieure de 0,75 point dans chaque catégorie. D’après les étiquettes attribuées par le correcteur Haiku, Opus 5.5 avait davantage tendance à aborder des thèmes tels que l’espoir, la résilience, la famille et l’amitié par rapport à Opus 5, et moins tendance à traiter de la mortalité, du temps, du pouvoir, du contrôle, de la liberté, de la justice, de la vengeance, de la mémoire, du deuil ou de la perte. Il semblerait donc qu’il y ait un compromis à l’œuvre.

À quoi ressemble ce Claude ?

Opus 5.5 a utilisé l'expression « en bref » 100 fois sur l'ensemble des 1 000 réponses — soit une augmentation de 1 016 % par rapport aux 9 occurrences d'Opus 5 — alors que les réponses d'Opus 5.5 ne comptaient en moyenne que 2,9 mots de moins que celles d'Opus 5 (643,4 contre 640,5 mots).

PhraseOpus 5 occurrencesOccurrences de l'opus 5.5Modifier
en bref910011.16×
par exemple221165.30×
a commencé à22743.38×
au début14433.09×
pendant un long moment19422.22×

Au vu de cet échantillon très restreint, il semble qu’Opus 5.5 privilégie un langage concret et terre-à-terre. Reste à voir si cela se confirme dans le fond des réponses, ou si Opus 5.5 se contente de faire mine d’être simple et direct. L’absence de différence au niveau du nombre de mots entre les deux me fait un peu douter de l’efficacité de la méthode RLHF qui nous a menés jusqu’ici.

Opus 5.5 aime beaucoup donner des exemples, puisqu’il a utilisé le mot « exemple » 325 fois sur 1 000 réponses — au total, 20 % de toutes les réponses d’Opus 5.5 contenaient ce mot, contre 9 % pour celles d’Opus 5. Les termes « résumé » et « principalement » étaient également surreprésentés. Et ce Claude aime vraiment donner des conseils à l’utilisateur !

MotOpus 5 occurrencesOccurrences de l'opus 5.5Modifier
en pause9353.91×
conseils18583.24×
principalement24753.14×
fixé du regard22622.83×
exemple1213252.70×
résumé601572.63×

Même si ce modèle écrit différemment des versions précédentes de Claude, comme toujours, d’ici trois à six semaines environ, j’imagine que des expressions telles que « par exemple » et « en résumé » commenceront à trahir la présence de Claude aux yeux du lecteur attentif. Mais il est important, pour des raisons d’ergonomie, que les modèles Claude puissent communiquer efficacement, et, comme tout le monde, j’apprécie les efforts déployés. Améliorer les capacités rédactionnelles de Claude n’est en aucun cas incompatible avec la capacité de Pangram à détecter les textes générés par l’IA !


Annamieka Aerts

Annamieka est rédactrice technique chez Pangram.

Plus d'articles d'Annamieka Aerts

Lectures complémentaires

Quel détecteur d'IA est le plus précis ? 30 outils testés (2026)
Études de cas

Quel détecteur d'IA est le plus précis ? 30 outils testés (2026)

7 janvier 2026
Les articles présentés lors des conférences sur l'IA sont de plus en plus souvent rédigés par l'IA : une hausse de 370 % depuis 2023
Études de cas

Les articles présentés lors des conférences sur l'IA sont de plus en plus souvent rédigés par l'IA : une hausse de 370 % depuis 2023

30 septembre 2024
Pangram n'a détecté aucun faux positif dans divers essais rédigés par des élèves
Études de cas

Pangram n'a détecté aucun faux positif dans divers essais rédigés par des élèves

19 août 2026
Comment se positionne Pangram par rapport à GPTZero ?
Études de cas

Comment se positionne Pangram par rapport à GPTZero ?

22 janvier 2026
Comment repérer les avis générés par l'IA
Études de cas

Comment repérer les avis générés par l'IA

5 décembre 2023
Trois pour cent des avis en première page sur Amazon sont désormais générés par l'IA
Études de cas

Trois pour cent des avis en première page sur Amazon sont désormais générés par l'IA

4 mai 2026