El procesamiento posterior al entrenamiento convierte a los modelos de lenguaje grande (LLM) en asistentes útiles y, al hacerlo, limita su escritura a patrones coherentes e identificables que se diferencian del texto humano.
Hay quien piensa que no es posible detectar la IA porque los modelos de lenguaje a gran escala (LLM) están entrenados para imitar el texto humano, pero no es así. De hecho, los LLM escriben de una forma claramente diferente a como lo hacen los humanos, y eso es precisamente lo que hace posible la detección de la IA.
En su artículo de Substack, Freddie DeBoer escribe:
«¿De dónde proceden los patrones [de redacción con IA]? Proceden de textos escritos por personas que se encuentran en los corpus de entrenamiento utilizados para desarrollar los modelos de lenguaje a gran escala (LLM). Cada patrón textual de un LLM —cada patrón textual de un LLM— es, en última instancia, el resultado de la producción textual humana. La propia naturaleza de un LLM consiste en modelar el texto humano basándose en el texto humano».
Llega a la conclusión de que, por lo tanto, no es posible crear un detector de IA con una tasa de falsos positivos extremadamente baja, ya que siempre existe la posibilidad de que alguna persona pueda idear y escribir la misma cadena de texto que generaría un modelo de lenguaje grande (LLM).
A menudo oímos diferentes versiones de esto:
«Los modelos de lenguaje grande (LLM) toman muestras de una distribución de textos escritos por humanos; por lo tanto, no es posible detectar un texto generado por un LLM, ya que la distribución utilizada para el entrenamiento de estos modelos es humana».
«Los modelos de lenguaje grande (LLM) están entrenados para escribir como los humanos, así que, si hacen bien su trabajo, los textos generados por IA superarán a cualquier detector».
A primera vista, estos argumentos parecen sólidos, pero no tienen en cuenta que los LLM modernos son sistemas complejos. Los LLM modernos están entrenados para hacer mucho más que simplemente imitar la distribución del texto humano. En esta entrada del blog, analizaremos por qué y en qué aspectos los LLM modernos, como ChatGPT, Claude y Gemini, se alejan de la distribución del texto humano, y qué es lo que les confiere ese estilo y esa voz únicos que hacen que su escritura sea detectable.
Resumen: Resulta tentador creer que, dado que los modelos de lenguaje grande (LLM) están entrenados para imitar el texto humano, sus resultados serán indistinguibles de la escritura humana. Pero, en realidad, los LLM no se limitan a aproximarse al texto humano: se les somete a un entrenamiento posterior para convertirlos en asistentes útiles que siguen instrucciones, lo que limita su escritura a un conjunto reducido de opciones que pueden detectarse algorítmicamente.
La historia de los modelos de lenguaje comenzó con los modelos de autocompletado. Estos primeros modelos de lenguaje eran sencillos: aprendían cómo se encadenaban habitualmente las palabras a partir de un amplio conjunto de datos de texto. A continuación, el usuario introducía unas cuantas palabras iniciales en el modelo de autocompletado y, a partir de ahí, el modelo predecía cuál era la siguiente palabra más probable.
Un modelo de autocompletado predice una distribución de probabilidad para el siguiente token
Crédito de la imagen: AIML.com
En esencia, un modelo de autocompletado toma como entrada una cadena inicial, o prefijo, como «El aprendizaje profundo es muy...», y a continuación genera una lista de probabilidades sobre lo que es probable que venga a continuación. Estas probabilidades se agregan a partir de todas las completaciones de un corpus de entrenamiento muy extenso, compuesto principalmente por datos de Internet. El resultado fue un modelo probabilístico de toda la escritura humana, capaz de predecir qué palabras tenían más probabilidades de aparecer en orden, teniendo en cuenta las frecuencias naturales de las palabras en el conjunto de datos de entrenamiento.
Esto dio lugar a los primeros modelos de lenguaje: GPT-1, GPT-2 y GPT-3. A estos modelos se les conoce ahora como «modelos base»: representan las distribuciones en bruto del lenguaje humano, pero sus resultados son rudimentarios y sin pulir: no siguen instrucciones y no pueden mantener una conversación. Hoy en día, a esta etapa inicial del desarrollo de los modelos de lenguaje la llamamos «preentrenamiento», y no es más que la primera fase de la creación de un asistente de IA o un chatbot; hay mucho más por hacer a partir de ahí.
¿Cuándo pasamos de una distribución bruta sobre las palabras a poder comunicarnos con un modelo de lenguaje como si fuera una persona? Para responder a esa pregunta, tenemos que remontarnos a marzo de 2022, cuando se produjo el primer gran avance en la transformación de los modelos de lenguaje en asistentes: InstructGPT, lanzado por OpenAI.
InstructGPT fue la primera vez que se entrenó explícitamente un modelo de lenguaje no solo para imitar el lenguaje humano, sino también para seguir las instrucciones que le daba un usuario, lo que ahora denominamos «prompts».
Los tres pasos posteriores al entrenamiento que se describen en el artículo sobre InstructGPT: ajuste fino supervisado, entrenamiento del modelo de recompensa y aprendizaje por refuerzo
Aquí hay una figura del artículo original sobre InstructGPT. El artículo original demostró que se podía aplicar una técnica denominada «post-training» para personalizar un modelo base —en este caso, GPT-3— y convertirlo en un asistente útil capaz de seguir instrucciones, modificando el estilo del modelo para que adoptara una personalidad específica.
El artículo describe tres pasos:
¡Esto es similar al condicionamiento pavloviano de la psicología! Los investigadores premian al modelo por algunas respuestas y no por otras, y, mediante la repetición, el modelo aprende a asociar algo que antes era neutro —concretamente, una respuesta preferida por los humanos— con un valor positivo de la función de recompensa. Esta técnica se denomina «ajuste por instrucciones» y es la que transforma el modelo base en un «modelo de instrucciones»: uno capaz de mantener una conversación y seguir las instrucciones del usuario.
El ajuste de las instrucciones evita que los modelos de lenguaje se desvíen, olviden información clave de su prompt o se vayan por las ramas con respuestas descabelladas. Además, proporciona a desarrolladores como OpenAI y Anthropic control sobre el comportamiento de sus modelos. Por ejemplo, los modelos deberían negarse a indicar a un usuario cómo fabricar una bomba o atracar un banco, aunque esa sea la respuesta que el usuario desee. Sin el entrenamiento posterior, la alineación de los modelos —es decir, la capacidad de hacer que los grandes modelos de lenguaje sean útiles, inofensivos y seguros— no sería posible. Anthropic fue pionera en este tipo de especificación del comportamiento de los modelos con su artículo sobre la IA constitucional, que describe cómo utilizan técnicas de post-entrenamiento para crear una IA que siga un conjunto de principios esbozados en la constitución de Anthropic. Por último, en teoría, el ajuste de instrucciones hace que sea más agradable conversar con los modelos. Dado que los evaluadores humanos recompensan al modelo por dar respuestas agradables, este se vuelve más amigable y desarrolla una mejor personalidad.
El proceso posterior al entrenamiento no solo trae buenas noticias. La remodelación de la salida afecta considerablemente al comportamiento del modelo y hace que sus respuestas sean muy diferentes de las del modelo base original.
Optimizar un modelo de lenguaje grande (LLM) según las preferencias humanas puede hacer que el modelo dé prioridad a complacer a las personas por encima de la corrección. Si esto se lleva demasiado lejos, el modelo reforzará las creencias erróneas del usuario en lugar de contradecirlas. En abril de 2025 se produjo una polémica notable en torno a este tipo de comportamiento adulador de los modelos, cuando OpenAI admitió que su nueva versión de GPT-4o era excesivamente halagadora y complaciente, incluso en detrimento del usuario.
El «post-training» también da lugar a respuestas menos creativas y originales por parte de los modelos de lenguaje grandes (LLM). Algunos investigadores plantean la hipótesis de que el «post-training» hace que el texto generado por los LLM suene monótono, poco original, repetitivo o como un batiburrillo de IA.
Un artículo de 2024, titulado «Creativity has Left the Chat», compara la diversidad de las versiones «instruct» y «base» del modelo de IA de Meta, Llama 2. Se observó que el modelo «instruct» de Llama 2 mostraba una diversidad semántica y estilística considerablemente menor en sus resultados; por ejemplo, a la hora de elegir personajes para historias, Llama 2 «instruct» elegía sistemáticamente personajes de la misma edad, nacionalidad y tipo de personalidad, e incluso les daba los mismos nombres. A continuación se muestra una nube de palabras con los nombres elegidos por los modelos «base» e «instruct».
Nubes de palabras con nombres generadas por modelos básicos frente a modelos alineados, extraídas de «Creativity Has Left the Chat»
En este sentido, el entrenamiento posterior da lugar a los denominados «logits aplanados», en los que los modelos de lenguaje grande (LLM) entrenados posteriormente eligen de forma determinista una única palabra siguiente, en lugar de generar una distribución variada de posibles palabras siguientes.
Aunque a primera vista eso no parece malo, da lugar a lo que se conoce como «colapso de modos», que se produce cuando los modelos de lenguaje grande (LLM) dejan de generar una gran variedad de expresiones y, en su lugar, se limitan a repetir una y otra vez las mismas opciones limitadas.
Colapso modal frente a cobertura modal: un modelo con colapso concentra la probabilidad en un único modo
He aquí una ilustración del colapso de modos: si se dan tres formas generales y habituales de expresar algo, un modelo de lenguaje grande (LLM) que sufra colapso de modos optará por defecto por la forma más habitual de expresarlo, en lugar de distribuir su probabilidad entre todas las formas posibles de expresarlo.
El hecho de que los LLM se entrenen de esta manera tiene algunas implicaciones para la detección. Dado que los LLM están optimizados para preferencias humanas específicas, tienden a adoptar personalidades muy distintivas. Estas personalidades tienen peculiaridades, tics e idiosincrasias que un modelo de detección puede distinguir de la escritura humana. Los logits aplanados y el colapso modal también implican que los LLM alineados tienden a tomar decisiones muy coherentes a la hora de generar texto, lo que significa que podemos aprender cuáles son esas decisiones analizando grandes cantidades de datos humanos y de IA.
Además, los modelos de lenguaje grande (LLM) desarrollados en la actualidad acaban incorporando sus propios resultados a lo largo de su entrenamiento, simplemente debido a la creciente «slopificación» del texto en Internet. Por ejemplo, a finales de 2024, más de un tercio de los nuevos artículos de Internet son generados por IA; tal cantidad de texto generado por IA da lugar a un efecto de amplificación en el que los nuevos modelos también adoptan las personalidades de los modelos más antiguos que generaron ese texto, incluso entre familias de modelos diferentes. ¡Por eso muchos LLM muestran similitudes de estilo con el ChatGPT original, a pesar de que hayan sido creados por laboratorios completamente diferentes! A veces, esto incluso se hace a propósito: se especula ampliamente que los laboratorios chinos intentan «destilar» modelos pioneros estadounidenses como Claude entrenándolos con sus propios resultados. ¡Eso confiere a estos modelos de lenguaje una personalidad similar a la de Claude!
Estudiar y resolver el colapso de modos es un ámbito de investigación en inteligencia artificial muy activo y en constante evolución. ¿Serán capaces algún día los modelos de lenguaje grandes (LLM) de generar distribuciones de resultados más diversas? Mi respuesta es que sí, e incluso hay algunos modelos de lenguaje que ya son bastante diversos: ¡de hecho, ya los tenemos en forma de modelos base!
Sin embargo, el «post-training» como paradigma no va a desaparecer. Las razones por las que los modelos de lenguaje grande (LLM) toman decisiones coherentes y tienen preferencias específicas reflejan las preferencias de sus desarrolladores. ¡Pregunta a un modelo de lenguaje chino qué ocurrió en la plaza de Tiananmen en 1989 y notarás inmediatamente las preferencias de ese desarrollador! La realidad es que no podemos disponer de modelos de lenguaje seguros y alineados que se comporten de forma útil e inofensiva sin el entrenamiento posterior. Al fin y al cabo, las empresas de LLM están creando productos de consumo que tienen requisitos de comportamiento: hay algunas áreas del espacio textual humano (como la toxicidad, la desinformación, etc.) de las que las empresas de LLM no quieren que sus modelos extraigan ejemplos. Por último, las empresas de LLM también quieren optimizar sus modelos para que tengan personalidades agradables: cuanto más se diviertan las personas al interactuar con sus modelos, más probable será que utilicen un modelo concreto y no los de la competencia. Esto quedó patente en la reacción de algunos seguidores de GPT-4o ante la decisión de OpenAI de dejar de comercializar ese modelo.
Estas preferencias de los desarrolladores y de las personas se plasman, en última instancia, en los modelos, limitando el espacio de personalidad y de resultados de estos modelos de lenguaje grande (LLM) a cambio de la alineación, la configuración del comportamiento y la optimización de la personalidad. Por lo tanto, mientras los desarrolladores de estos modelos sigan teniendo preferencias y decisiones específicas sobre el comportamiento de los mismos, creo que Pangram debería ser capaz de detectar dichas preferencias de forma sistemática.

Bradley es investigador en inteligencia artificial y experto en el desarrollo de productos de aprendizaje profundo para el sector industrial. Recientemente ha dirigido el grupo de investigación en aprendizaje profundo de Absci, una empresa dedicada al descubrimiento de fármacos mediante IA generativa, y anteriormente formó parte del equipo principal de visión artificial de Tesla Autopilot.






