La phase post-entraînement transforme les modèles de langage de grande envergure (LLM) en assistants utiles, ce qui a pour effet de cantonner leur écriture à des schémas cohérents et identifiables qui s'écartent du texte humain.
Certaines personnes pensent qu'il est impossible de détecter un texte généré par l'IA, car les modèles de langage de grande envergure (LLM) sont entraînés à imiter le style humain, mais ce n'est pas le cas. En réalité, les LLM écrivent d'une manière nettement différente de celle des humains, et c'est précisément ce qui permet de détecter les textes générés par l'IA.
Dans son article publié sur Substack, Freddie DeBoer écrit :
« D'où proviennent ces schémas [d'écriture générés par l'IA] ? Ils proviennent de textes rédigés par des humains et figurant dans les corpus d'entraînement utilisés pour construire les LLM. Chaque schéma textuel d'un LLM – chaque schéma textuel d'un LLM – est en fin de compte le produit de la production textuelle humaine. La nature même d'un LLM consiste à modéliser le texte humain à partir de textes humains. »
Il en conclut qu'il n'est donc pas possible de mettre au point un détecteur d'IA présentant un taux de faux positifs extrêmement faible, car il existe toujours un risque qu'un être humain puisse imaginer et rédiger la même chaîne de texte que celle générée par un modèle de langage grand (LLM).
On entend souvent différentes versions de cette histoire :
« Les modèles de langage à grande échelle (LLM) échantillonnent une distribution d'écrits humains ; par conséquent, il est impossible de détecter un texte généré par un LLM, car la distribution utilisée pour l'entraînement de ces modèles est celle des écrits humains. »
« Les grands modèles de langage (LLM) sont entraînés à écrire comme des humains ; par conséquent, s'ils font bien leur travail, les textes générés par l'IA déjoueront n'importe quel détecteur. »
À première vue, ces arguments semblent valables, mais ils ne tiennent pas compte du fait que les LLM modernes sont des systèmes complexes. Ces modèles sont entraînés pour faire bien plus que simplement reproduire la distribution textuelle humaine. Dans cet article, nous allons examiner pourquoi et en quoi les LLM modernes, tels que ChatGPT, Claude et Gemini, s’écartent de la distribution textuelle humaine, et ce qui leur confère ce style et cette voix uniques qui permettent de détecter leurs textes.
Résumé : Il est tentant de croire que, puisque les modèles de langage à grande échelle (LLM) sont entraînés à reproduire le texte humain, leurs productions deviendront impossibles à distinguer de l'écriture humaine. Mais en réalité, les LLM ne se contentent pas de reproduire approximativement le texte humain : ils font l'objet d'un entraînement complémentaire pour devenir des assistants utiles capables de suivre des instructions, ce qui limite leur écriture à un ensemble restreint de choix détectables par des algorithmes.
L'histoire des modèles linguistiques a commencé avec les modèles de complétion. Ces premiers modèles linguistiques étaient simples : ils apprenaient, à partir d'un vaste ensemble de données textuelles, l'ordre dans lequel les mots se succédaient généralement. Ensuite, l'utilisateur fournissait au modèle de complétion quelques mots initiaux, à partir desquels le modèle prédisait le mot suivant le plus probable.
Un modèle de complétion prédit une distribution de probabilité pour le prochain token
Crédit photo : AIML.com
En substance, un modèle de complétion prend en entrée une chaîne initiale, ou préfixe, telle que « Le deep learning est très », puis génère une liste de probabilités concernant ce qui est susceptible de suivre. Ces probabilités sont calculées à partir de l'ensemble des complétions issues d'un très vaste corpus d'entraînement, composé principalement de données issues d'Internet. Il en a résulté un modèle probabiliste de l’ensemble de l’écriture humaine, capable de deviner quels mots étaient les plus susceptibles d’apparaître dans un certain ordre, compte tenu des fréquences naturelles des mots dans l’ensemble de données d’apprentissage.
C'est ainsi qu'ont vu le jour les premiers modèles linguistiques : GPT-1, GPT-2 et GPT-3. Ces modèles sont désormais appelés « modèles de base » : ils représentent les distributions brutes du langage humain, mais leurs résultats sont bruts et non peaufinés : ils ne suivent pas les instructions et ne sont pas capables de mener une conversation. Aujourd’hui, nous appelons cette étape initiale du développement d’un modèle linguistique « pré-entraînement », et ce n’est que la première étape de la création d’un assistant IA ou d’un chatbot — il y a encore beaucoup d’autres étapes par la suite.
Quand sommes-nous passés d’une simple distribution brute sur des mots à la capacité de dialoguer avec un modèle linguistique comme on le ferait avec une personne ? Pour répondre à cette question, il faut remonter à mars 2022, date à laquelle a eu lieu la première avancée majeure dans la transformation des modèles linguistiques en assistants : InstructGPT, lancé par OpenAI.
Avec InstructGPT, c'était la première fois qu'un modèle linguistique était explicitement entraîné non seulement à imiter le langage humain, mais aussi à suivre les instructions qui lui étaient données par un utilisateur, ce que l'on appelle désormais des « prompts ».
Les trois étapes post-entraînement décrites dans l'article InstructGPT : l'affinage supervisé, l'entraînement du modèle de récompense et l'apprentissage par renforcement
Voici une illustration tirée de l'article original sur InstructGPT. Cet article démontrait qu’il était possible d’utiliser une technique appelée « post-entraînement » pour personnaliser un modèle de base, en l’occurrence GPT-3, afin d’en faire un assistant utile et capable de suivre des instructions — en modifiant le style du modèle pour lui faire adopter une personnalité spécifique.
Cet article décrit trois étapes :
Ce phénomène s'apparente au conditionnement pavlovien en psychologie ! Les chercheurs récompensent le modèle pour certaines réponses et pas pour d'autres, et à force de répétition, le modèle apprend à associer un élément auparavant neutre, à savoir une réponse privilégiée par l'utilisateur, à une valeur positive issue de la fonction de récompense. Cette technique , appelée « instruction tuning », permet de transformer le modèle de base en un « modèle instructif » : un modèle capable d'engager une conversation et de suivre les instructions de l'utilisateur.
L'ajustement des instructions empêche les modèles linguistiques de dérailler, d'oublier des informations clés de leur consigne ou de s'égarer dans des digressions absurdes. Il permet également aux développeurs, tels qu'OpenAI et Anthropic, de contrôler le comportement de leurs modèles. Par exemple, les modèles devraient refuser de dire à un utilisateur comment fabriquer une bombe ou braquer une banque, même si c’est la réponse souhaitée par l’utilisateur. Sans post-entraînement, l’alignement des modèles, c’est-à-dire la capacité à rendre les grands modèles linguistiques utiles, inoffensifs et sûrs, ne serait pas possible. Anthropic a été un pionnier de ce type de spécification du comportement des modèles avec son article sur l’IA constitutionnelle, qui décrit comment l’entreprise utilise des techniques de post-entraînement pour créer une IA respectant un ensemble de principes définis dans la constitution d’Anthropic. Enfin, en théorie, l’ajustement des instructions rend les modèles plus agréables à l’échange. Comme les évaluateurs humains récompensent le modèle lorsqu’il donne des réponses satisfaisantes, celui-ci devient plus amical et développe une meilleure personnalité.
La phase post-entraînement n'est pas que du positif. Le remodelage des sorties affecte considérablement le comportement d'un modèle et rend ses réponses très différentes de celles du modèle de base d'origine.
L’optimisation d’un LLM en fonction des préférences humaines peut amener ce dernier à privilégier le fait de plaire aux gens plutôt que l’exactitude. Si cela va trop loin, le LLM renforcera les fausses croyances d’un utilisateur au lieu de les contredire. Ce type de comportement flagorneur de la part d’un modèle a donné lieu à une polémique retentissante en avril 2025, lorsque OpenAI a admis que sa nouvelle version de GPT-4o était excessivement flatteuse et conciliante, au détriment même des utilisateurs.
Le post-entraînement conduit également à des réponses moins créatives et moins originales de la part des LLM. Certains chercheurs émettent l'hypothèse que le post-entraînement rend les textes générés par les LLM monotones, peu originaux, répétitifs ou ressemblant à du « bric-à-brac » produit par l'IA.
Un article publié en 2024, intitulé « Creativity has Left the Chat », compare la diversité des versions « instruct » et « base » du modèle d’IA de Meta, Llama 2. Les auteurs ont constaté que le modèle « instruct » de Llama 2 présentait une diversité sémantique et stylistique nettement moindre dans ses résultats ; par exemple, lors du choix des personnages dans des récits, Llama 2 « instruct » choisissait systématiquement des personnages du même âge, de la même nationalité et du même type de personnalité, allant même jusqu’à leur attribuer les mêmes prénoms. Vous trouverez ci-dessous un nuage de mots représentant les prénoms choisis par les modèles « base » et « instruct ».
Nuages de mots composés de noms générés par des modèles de base et des modèles alignés, tirés de « Creativity Has Left the Chat »
Dans le même ordre d'idées, le post-entraînement entraîne ce que l'on appelle des « logits aplatis »: les modèles de langage de grande échelle (LLM) ayant subi un post-entraînement choisissent de manière déterministe un seul mot suivant, au lieu de produire une distribution variée de mots suivants possibles.
Même si, à première vue, cela ne semble pas grave, cela conduit à ce qu'on appelle l'« effondrement des modes » (mode collapse), qui se produit lorsque les grands modèles de langage (LLM) cessent de produire une grande variété d'expressions et se contentent, à la place, de reproduire sans cesse les mêmes choix limités.
Effondrement des modes vs. couverture des modes : un modèle effondré concentre la probabilité sur un seul mode
Voici une illustration du « mode collapse » : parmi trois façons courantes d'exprimer une idée, un LLM victime de ce phénomène optera par défaut pour la formulation la plus courante, au lieu de répartir sa probabilité entre toutes les formulations possibles.
Le fait que les LLM soient entraînés de cette manière a plusieurs implications pour la détection. Comme les LLM sont optimisés pour répondre à des préférences humaines spécifiques, ils ont tendance à développer des personnalités très distinctes. Ces personnalités présentent des particularités, des tics et des traits propres qu’un modèle de détection peut distinguer de l’écriture humaine. L'aplatissement des logits et l'effondrement du mode signifient également que les LLM alignés ont tendance à faire des choix très cohérents lorsqu'ils génèrent du texte, ce qui signifie que nous pouvons identifier ces choix en analysant de grandes quantités de données humaines et issues de l'IA.
De plus, les grands modèles de langage (LLM) développés aujourd’hui finissent par réutiliser leurs propres sorties au cours de leur entraînement, simplement en raison de la « slopification » croissante des textes sur Internet. Par exemple, fin 2024, plus d’un tiers des nouveaux articles publiés sur Internet étaient générés par l’IA; une telle quantité de texte généré par l’IA entraîne un effet d’amplification où les nouveaux modèles adoptent également les personnalités des anciens modèles ayant généré ce texte, même au-delà des familles de modèles. C’est pourquoi de nombreux LLM présentent des similitudes de style avec le ChatGPT original, même s’ils ont été créés par des laboratoires totalement différents ! Parfois, cela est même fait exprès : on suppose largement que les laboratoires chinois tentent de « distiller » les caractéristiques de modèles américains de pointe tels que Claude en s’entraînant sur leurs résultats. Cela confère à ces modèles linguistiques une personnalité semblable à celle de Claude !
La compréhension et la résolution du problème de l'effondrement des modes constituent un domaine de recherche actif et en pleine évolution dans le domaine de l'intelligence artificielle. Les modèles de langage de grande échelle (LLM) seront-ils un jour capables de produire des distributions de résultats plus diversifiées ? Je pense que oui, et certains modèles de langage présentent d'ores et déjà une grande diversité : en effet, nous en disposons déjà sous la forme de modèles de base !
Cependant, le « post-entraînement » en tant que paradigme n’est pas près de disparaître. Les raisons pour lesquelles les LLM font des choix cohérents et ont des préférences spécifiques reflètent les préférences de leurs développeurs. Demandez à un modèle de langage chinois ce qui s’est passé sur la place Tian’anmen en 1989 et vous remarquerez immédiatement les préférences de ce développeur ! Le fait est que nous ne pouvons pas disposer de modèles linguistiques sûrs et alignés, qui se comportent de manière utile et inoffensive, sans recourir au post-entraînement. En fin de compte, les entreprises spécialisées dans les LLM développent des produits grand public soumis à des exigences comportementales : il existe certains domaines de l'espace textuel humain (tels que la toxicité, la désinformation, etc.) dont elles ne veulent pas que leurs modèles s'inspirent. Enfin, les entreprises spécialisées dans les LLM souhaitent également optimiser leurs modèles pour qu’ils aient une personnalité agréable : plus les utilisateurs s’amusent à interagir avec leurs modèles, plus ils sont susceptibles d’utiliser un modèle particulier plutôt que ceux de la concurrence. On a pu observer ce phénomène à travers la réaction de certains fans de GPT-4o lorsque OpenAI a décidé d’arrêter la commercialisation de ce modèle.
Ces préférences des développeurs et des utilisateurs se traduisent en fin de compte dans les modèles par un rétrécissement de l'espace de personnalité et de sortie de ces grands modèles de langage (LLM), en échange d'un alignement, d'un façonnage du comportement et d'une optimisation de la personnalité. Ainsi, tant que les développeurs de ces modèles continueront d'avoir des préférences et des choix spécifiques concernant le comportement des modèles, je pense que Pangram devrait être en mesure de détecter ces préférences de manière systématique.

Bradley est chercheur en intelligence artificielle et spécialiste du développement de produits basés sur l'apprentissage profond dans le secteur industriel. Il a récemment dirigé le groupe de recherche sur l'apprentissage profond chez Absci, une entreprise spécialisée dans la découverte de médicaments par l'IA générative, et faisait auparavant partie de l'équipe principale chargée de la vision par ordinateur chez Tesla Autopilot.






