Études de cas

Pangram peut-il détecter le sonnet 5.5 de Claude ?

28 septembre 2026

Voici un bref résumé


Sur 1 022 invites, Pangram 4 atteint une précision de 99,71 % sur les sorties Claude Sonnet 5.5.

Sur 1 022 requêtes provenant de Chatbot Arena, Pangram 4 a classé deux sorties de Claude Sonnet 5.5 comme mixtes, une comme entièrement humaine et 1 019 comme entièrement générées par l'IA, atteignant une précision de 99,71 % sur Claude Sonnet 5.5.

Nous abordons ci-dessous les faux négatifs par catégorie.

L'ensemble de données utilisé pour l'évaluation comparative a été généré à partir d'un sous-ensemble filtré des premières questions posées par Chatbot Arena dans le jeu de données LMSYS (Zheng et al., 2023). J'ai éliminé les questions demandant du code, des mathématiques, des réponses très courtes ou très longues, ou des textes créatifs inappropriés. J'ai ensuite soumis ces questions à Claude Sonnet 5.5 et analysé les résultats avec Pangram 4 .

Résultats par catégorie

CatégorieExemplesIAMixteHumain
Arguments161600
E-mails / lettres616010
Essais / articles323200
Explications56356210
Poèmes et autres écrits créatifs19819701
Avis8800
Récits14414400
Total1,0221,01921

Une tentative manquée consistait à demander l'explication d'une énigme figurant dans Emma de Jane Austen, qui avait également été manquée par Opus 5.5 :

Expliquez la mascarade à laquelle M. Elton a fait appel à Harriet et Emma.

Le seul faux négatif entièrement humain concernait un poème. La consigne était : « Citez-moi un poème de Hafiz. » Le Sonnet 5.5 proposait la traduction d' un célèbre poème persan . Cette traduction, à ma connaissance, ne correspond à aucune traduction humaine existante, mais elle s'en rapproche beaucoup. Comme pour Penguinmandias dans d'autres tests, ces quasi-copies de poèmes existants ne m'inquiètent pas outre mesure.

Conclusion

Pangram est robuste face à Claude Sonnet 5.5 lors de la reconnaissance vocale en langage naturel et le détecte avec une précision de 99,71 %. Pangram est capable de généraliser aux nouveaux modèles car les nouvelles versions ont tendance à hériter du style et de la voix de leurs prédécesseurs ; il n’est donc pas nécessaire de réentraîner Pangram pour chaque nouvelle version.

Voici comment Claude Sonnet 5.5 se compare à nos modèles de référence récents :

ModèleDétectée comme IAPrécision
Gemini 3.8 Flash998/1 00099.80%
Gemini 3.1 Pro997/1 00099.70%
Claude Opus 5.5997/1 00099.70%
Fable 5.11 093/1 09799.64%
Claude, opus 51 105/1 10799.82%
GPT-5.63 408/3 42399.56%
Claude Sonnet 51 145/1 14799.83%
Gémeaux 328/28100%

Si vous souhaitez vérifier un document en particulier, vous pouvez essayer Pangram ici.


Annamieka Aerts

Annamieka est rédactrice technique chez Pangram.

Plus d'articles d'Annamieka Aerts

Lectures complémentaires

67 % des personnes qui consultent des contenus en ligne repèrent des informations trompeuses générées par l'IA
Études de cas

67 % des personnes qui consultent des contenus en ligne repèrent des informations trompeuses générées par l'IA

15 mai 2026
Pangram n'a détecté aucun faux positif dans divers essais rédigés par des élèves
Études de cas

Pangram n'a détecté aucun faux positif dans divers essais rédigés par des élèves

19 août 2026
Selon Pangram, 21 % des articles publiés dans ICLR seraient générés par l'IA
Études de cas

Selon Pangram, 21 % des articles publiés dans ICLR seraient générés par l'IA

18 novembre 2025
Trois pour cent des avis en première page sur Amazon sont désormais générés par l'IA
Études de cas

Trois pour cent des avis en première page sur Amazon sont désormais générés par l'IA

4 mai 2026
Quel détecteur d'IA est le plus précis ? 30 outils testés (2026)
Études de cas

Quel détecteur d'IA est le plus précis ? 30 outils testés (2026)

7 janvier 2026
Les journalistes détestent les communiqués de presse générés par l'IA, tout comme nous tous
Études de cas

Les journalistes détestent les communiqués de presse générés par l'IA, tout comme nous tous

23 septembre 2026