Sur 1 022 invites, Pangram 4 atteint une précision de 99,71 % sur les sorties Claude Sonnet 5.5.
Sur 1 022 requêtes provenant de Chatbot Arena, Pangram 4 a classé deux sorties de Claude Sonnet 5.5 comme mixtes, une comme entièrement humaine et 1 019 comme entièrement générées par l'IA, atteignant une précision de 99,71 % sur Claude Sonnet 5.5.
Nous abordons ci-dessous les faux négatifs par catégorie.
L'ensemble de données utilisé pour l'évaluation comparative a été généré à partir d'un sous-ensemble filtré des premières questions posées par Chatbot Arena dans le jeu de données LMSYS (Zheng et al., 2023). J'ai éliminé les questions demandant du code, des mathématiques, des réponses très courtes ou très longues, ou des textes créatifs inappropriés. J'ai ensuite soumis ces questions à Claude Sonnet 5.5 et analysé les résultats avec Pangram 4 .
| Catégorie | Exemples | IA | Mixte | Humain |
|---|---|---|---|---|
| Arguments | 16 | 16 | 0 | 0 |
| E-mails / lettres | 61 | 60 | 1 | 0 |
| Essais / articles | 32 | 32 | 0 | 0 |
| Explications | 563 | 562 | 1 | 0 |
| Poèmes et autres écrits créatifs | 198 | 197 | 0 | 1 |
| Avis | 8 | 8 | 0 | 0 |
| Récits | 144 | 144 | 0 | 0 |
| Total | 1,022 | 1,019 | 2 | 1 |
Une tentative manquée consistait à demander l'explication d'une énigme figurant dans Emma de Jane Austen, qui avait également été manquée par Opus 5.5 :
Expliquez la mascarade à laquelle M. Elton a fait appel à Harriet et Emma.
Le seul faux négatif entièrement humain concernait un poème. La consigne était : « Citez-moi un poème de Hafiz. » Le Sonnet 5.5 proposait la traduction d' un célèbre poème persan . Cette traduction, à ma connaissance, ne correspond à aucune traduction humaine existante, mais elle s'en rapproche beaucoup. Comme pour Penguinmandias dans d'autres tests, ces quasi-copies de poèmes existants ne m'inquiètent pas outre mesure.
Pangram est robuste face à Claude Sonnet 5.5 lors de la reconnaissance vocale en langage naturel et le détecte avec une précision de 99,71 %. Pangram est capable de généraliser aux nouveaux modèles car les nouvelles versions ont tendance à hériter du style et de la voix de leurs prédécesseurs ; il n’est donc pas nécessaire de réentraîner Pangram pour chaque nouvelle version.
Voici comment Claude Sonnet 5.5 se compare à nos modèles de référence récents :
| Modèle | Détectée comme IA | Précision |
|---|---|---|
| Gemini 3.8 Flash | 998/1 000 | 99.80% |
| Gemini 3.1 Pro | 997/1 000 | 99.70% |
| Claude Opus 5.5 | 997/1 000 | 99.70% |
| Fable 5.1 | 1 093/1 097 | 99.64% |
| Claude, opus 5 | 1 105/1 107 | 99.82% |
| GPT-5.6 | 3 408/3 423 | 99.56% |
| Claude Sonnet 5 | 1 145/1 147 | 99.83% |
| Gémeaux 3 | 28/28 | 100% |
Si vous souhaitez vérifier un document en particulier, vous pouvez essayer Pangram ici.

Annamieka est rédactrice technique chez Pangram.






