Des évaluations indépendantes menées par des tiers confirment systématiquement les chiffres internes de Pangram en matière de précision — voici un tour d'horizon des données externes.
Nous estimons qu'il est important que les institutions puissent compter sur la grande précision de Pangram ; c'est pourquoi nous encourageons la vérification par des tiers de nos indicateurs de qualité (faux positifs et faux négatifs). Nous présentons ci-dessous les évaluations de Pangram réalisées par des chercheurs de l'Université de Chicago (UChicago) et de l'Université du Maryland (UMD), ainsi que par des experts indépendants.
Point clé : les tests internes de Pangram résistent à l'examen minutieux de tiers.
Dans un article soumis à un comité de lecture et publié en juin 2026, un groupe de chercheurs de la Vrije Universiteit Brussel a testé quatre outils de détection de l’IA – Pangram, GPTZero, Turnitin et Copyleaks – sur 160 articles universitaires comptant chacun plus de 4 000 mots. L'ensemble de données était rédigé en anglais et réparti de manière égale entre des textes rédigés par des étudiants dont l'anglais n'est pas la langue maternelle, des textes générés par l'IA, des textes hybrides (mélange de texte humain et de texte généré par l'IA) et des textes générés par l'IA puis « humanisés ».
Les chercheurs ont constaté que Pangram était le seul outil capable de détecter de manière fiable les contenus générés par l'IA : « Parmi les quatre outils de détection de l'IA étudiés ici, seul [Pangram] a donné, à l'heure actuelle, des résultats satisfaisants. »
Pangram était le seul outil capable de détecter de manière fiable à la fois les documents entièrement rédigés par une IA et ceux « humanisés » (respectivement 97,5 % et 95 %). Concernant l'ensemble des documents entièrement générés par une IA, les trois autres outils n'en ont pratiquement détecté aucun, affichant tous un taux de 0 %. Aucun autre détecteur que Pangram n'a su traiter de manière fiable les textes « humanisés », bien que Turnitin en ait détecté environ la moitié et Copyleaks un quart.
| Outil | Taux de détection (entièrement basé sur l'IA) | Taux de détection (hybride) | Taux de détection (humanisé) | Taux de faux positifs |
|---|---|---|---|---|
| Pangram | 97.5% | 95% | 95% | 0% |
| Turnitin | 0% | 60% | 52.5% | 0% |
| Copyleaks | 0% | 32.5% | 25% | 0% |
| GPTZero | 0% | 0% | 2.5% | léger biais positif (seul outil dont la valeur n'est pas égale à zéro pour le texte humain) |
Des recherches antérieures avaient montré que d'autres détecteurs généraient des faux positifs pour les auteurs dont l'anglais n'est pas la langue maternelle, mais cette étude indépendante indique que Pangram ne présente pas de biais significatif à l'encontre des textes rédigés par des auteurs dont l'anglais n'est pas la langue maternelle.
Au Becker Friedman Institute for Economics de l’Université de Chicago, des chercheurs ont comparé quatre détecteurs d’IA : Pangram, GPTZero, Originality AI et RoBERTa (un détecteur d’IA open source). L’étude a utilisé chaque détecteur pour analyser 1 992 textes rédigés par des humains avant 2020 et 1 992 textes générés par l’IA, couvrant différents genres et nombres de mots. Ils ont examiné deux types d'erreurs dans la détection de l'IA : les taux de faux positifs et les taux de faux négatifs. Ces taux ont été comparés pour plusieurs seuils. Les détecteurs ont également classé des textes générés par l'IA à partir de modèles de langage (LLM) populaires tels que ChatGPT, Claude et Gemini. Les chercheurs ont défini plusieurs plafonds de taux de faux positifs (FPR) pour les différents détecteurs afin de noter les variations du taux de faux négatifs (FNR).
Extrait de l'étude intitulée « Écriture artificielle et détection automatisée », rédigée par Brian Jabarian et Alex Imas en août 2025 :
Pangram surpasse les autres détecteurs à tous les seuils.
Pangram est le seul détecteur qui respecte un seuil strict (FPR ≤ 0,005) sans pour autant compromettre sa capacité à détecter avec précision les textes générés par l'IA.
Pangram reste le leader en matière de prix compétitifs dans tous les genres. En moyenne, il coûte 0,0228 $ par passage détecté correctement par l'IA, contre 0,0416 $ pour OriginalityAI et 0,0575 $ pour GPTZero, ce qui fait de Pangram le détecteur le plus économique, tant pour les passages complets que pour les ébauches.
L'étude a montré que :
Pangram affiche des taux de faux positifs et de faux négatifs pratiquement nuls sur des passages de longueur moyenne à longue.
La grande précision de Pangram a été saluée dans divers types de textes, tels que les blogs, les critiques, les CV, les actualités et les romans. Dans les textes courts, les taux de faux positifs et de faux négatifs augmentent légèrement, « mais restent bien en deçà des seuils raisonnables fixés par les directives ».
Taux moyen de faux positifs (textes rédigés par des humains identifiés à tort comme provenant de l'IA) et de faux négatifs (textes générés par l'IA non détectés) pour chaque détecteur, sur les six genres et les quatre modèles de langage à grande échelle (LLM). Dans les deux cas, plus la valeur est faible, mieux c'est.
| Outil | Taux de faux positifs | Taux de faux négatifs | Est-il résistant à l'humaniseur StealthGPT ? |
|---|---|---|---|
| Pangram | 0.001 | 0.01 | Oui (taux de détection proche de 100 %) |
| Originality.ai | 0.002 | 0.035 | En partie (jusqu'à 0,21 FNR sur un texte court) |
| GPTZero | 0.007 | 0.06 | Non (FNR ≥ 0,50) |
| RoBERTa (open source) | 0.50 | peu fiable (signale la plupart des textes comme provenant de l'IA) | n/a (ne convient pas) |
Pangram ne fournit plus de prévisions pour les textes de moins de 50 mots, mais comme le souligne l'étude,
Pangram’s performance largely holds up on very short passages (< 50 words) and is robust to “humanizer” tools (e.g., StealthGPT), the performance of other detectors becomes case-dependent.
Dans l'expérience 1 de cette étude de l'UMD, on a fait appel à des annotateurs possédant différents niveaux de connaissance des modèles de langage à grande échelle (LLM) pour déterminer si un texte avait été généré par une IA ou non. Après avoir constaté qu'un annotateur était presque parfait dans l'identification des textes générés par l'IA, quatre annotateurs experts supplémentaires ayant des antécédents similaires en matière d'utilisation des LLM ont été sollicités pour classer le même échantillon de 60 textes. Les résultats des votes des experts ont été comparés à ceux de détecteurs commerciaux tels que Pangram, Pangram Humanizer et GPTZero, ainsi qu'à ceux d'outils open source comme Fast-DetectGPT. Au cours de ce processus, Pangram a été comparé à d'autres détecteurs.
Pourcentage d'articles générés par l'IA détectés (TPR) et taux de faux positifs pour l'ensemble des conditions, y compris la plus difficile : le texte « o1-pro » humanisé. Seul Pangram a réussi à rivaliser avec les experts humains.
| Détecteur | Taux de détection global (TPR) | Taux de faux positifs | Détection dans un texte humanisé |
|---|---|---|---|
| Experts (vote à la majorité) | 99.3% | 0% | 100% |
| Les « humaniseurs » de Pangram | 99.3% | 2.7% | 96.7% |
| Pangram (de base) | 98.0% | 2% | 90.0% |
| GPTZero | 85.3% | 0.7% | 46.7% |
| Fast-DetectGPT | 80.0% | 7.2% | 23.3% |
| Jumelles (mode Précision) | 66.7% | 1.3% | 6.7% |
| RADAR | 15.3% | 2% | 0% |
Pangram est capable de détecter avec précision les textes générés par l'IA et « humanisés ». Cette affirmation est corroborée par des informaticiens de l'UMD, qui ont constaté que Pangram obtenait les meilleurs résultats globaux en matière de détection des textes « humanisés » et paraphrasés, surpassant les autres logiciels de détection de l'IA avec une précision de 99,3 %.
Découvrez comment Pangram se mesure aux outils d'humanisation
Amanda Caswell, de Tom’s Guide, a déclaré dans un article qu’après avoir testé des dizaines d’outils de détection de l’IA, Pangram « s’est révélé plus performant que tous ceux que j’ai essayés ». Il a également été démontré que Pangram s’efforce activement de réduire le nombre déjà faible de faux positifs.
David Gewirtz, de ZDNET, décrit Pangram comme « un nouveau venu dans nos tests qui s'est immédiatement hissé parmi les meilleurs ».
L'utilisation croissante de l'IA dans les articles de recherche suscite des inquiétudes quant à la possibilité qu'elle soit un indicateur de mauvaise conduite. Dans son article publié sur Medium, Adam Day a utilisé l'outil de détection de l'IA de Pangram pour obtenir des résultats fiables sur la prévalence du contenu généré par l'IA, tout en concluant qu'il existe des cas d'utilisation légitimes de l'IA générative dans la recherche. Day recommande d'utiliser Pangram pour mener des recherches, affirmant : « Si quelqu'un souhaite mener une enquête sur l'utilisation de l'IA générative dans la littérature publiée, je pense que les outils de Pangram offrent une excellente opportunité de le faire. »
Chez Pangram, nous sommes convaincus que la transparence est essentielle à la confiance. Nous serions ravis de collaborer avec vous pour apporter la transparence en matière d'IA au sein de votre organisation.

Destiny est stagiaire en analyse de recherche chez Pangram. Elle est également étudiante au NYC College of Technology, où elle suit des cours de mathématiques appliquées et de chimie. Le travail de Destiny chez Pangram a grandement contribué à l'étude des dérives de l'IA sur Internet. En dehors du travail et de ses études, Destiny se passionne pour l'écriture créative et la fiction d'horreur.






