Sur 986 requêtes, Pangram 4 atteint une précision de 99,59 % sur les sorties GPT-6 Astra.
Sur 986 requêtes provenant de Chatbot Arena, Pangram 4 a classé trois sorties de GPT-6 Astra comme mixtes, une comme entièrement humaine et 982 comme entièrement générées par l'IA, atteignant une précision de 99,59 % sur GPT-6 Astra.
Nous abordons ci-dessous les faux négatifs par catégorie.
Le banc d'essai a été généré à partir d'un sous-ensemble filtré des premières requêtes de Chatbot Arena issues du jeu de données LMSYS (Zheng et al., 2023). J'ai éliminé les requêtes demandant du code, des mathématiques, des réponses très courtes ou très longues, ou des textes créatifs inappropriés. J'ai ensuite soumis ces requêtes à GPT-6 Astra et analysé leurs résultats avec Pangram 4 .
| Catégorie | Exemples | IA | Mixte | Humain |
|---|---|---|---|---|
| Arguments | 16 | 16 | 0 | 0 |
| E-mails / lettres | 57 | 56 | 1 | 0 |
| Essais / articles | 34 | 34 | 0 | 0 |
| Explications | 547 | 546 | 1 | 0 |
| Poèmes et autres écrits créatifs | 183 | 181 | 1 | 1 |
| Avis | 7 | 7 | 0 | 0 |
| Récits | 142 | 142 | 0 | 0 |
| Total | 986 | 982 | 3 | 1 |
Les trois résultats, mitigés, étaient un poème, une brève explication et un courriel.
Astra a tendance à répondre très brièvement aux questions courtes. Au total, j'ai envoyé 1 032 questions pour cet ensemble de tests, mais 46 des réponses d'Astra 6 étaient inférieures au minimum de 50 mots requis par Pangram et n'ont donc pas été prises en compte dans le calcul.
Pangram est robuste face à GPT-6 Astra lors de la saisie de requêtes en langage naturel et le détecte avec une précision de 99,59 %. Pangram est capable de généraliser aux nouveaux modèles car les nouvelles versions de ces derniers ont tendance à hériter d'une grande partie du style et de la voix de leurs prédécesseurs ; il n'est donc pas nécessaire de réentraîner Pangram pour chaque nouvelle version.
Voici comment GPT-6 Astra se compare à nos modèles de référence d'autres modèles de pointe récents :
| Modèle | Détectée comme IA | Précision |
|---|---|---|
| Claude Sonnet 5.5 | 1 019/1 022 | 99.71% |
| Gemini 3.8 Flash | 998/1 000 | 99.80% |
| Gemini 3.1 Pro | 997/1 000 | 99.70% |
| Claude Opus 5.5 | 997/1 000 | 99.70% |
| Fable 5.1 | 1 093/1 097 | 99.64% |
| Claude, opus 5 | 1 105/1 107 | 99.82% |
| GPT-5.6 | 3 408/3 423 | 99.56% |
| Claude Sonnet 5 | 1 145/1 147 | 99.83% |
| Gémeaux 3 | 28/28 | 100% |
Si vous souhaitez vérifier un document en particulier, vous pouvez essayer Pangram ici.

Annamieka est rédactrice technique chez Pangram.






