Ver todos os artigos (65)
Como funciona o Pangram

O Pangram utiliza os indicadores de perplexidade e variabilidade?

Se o Pangram se baseia na perplexidade e na variabilidade, tal como acontece com alguns detetores mais antigos.

Última revisão em 24 de julho de 2026

Não, o Pangram não se baseia na complexidade e na variabilidade para as previsões do nosso modelo. O Pangram é um tipo de rede neural denominado «modelo classificador». O Pangram é treinado utilizando «espelhos sintéticos» dos documentos mais difíceis de classificar e, posteriormente, é retreinado repetidamente. Isso torna-o adaptável a novos modelos e significa que, à medida que o Pangram adquire mais experiência com texto humano através do nosso algoritmo de aprendizagem ativa, vai melhorando gradualmente.

O que são a perplexidade e a irregularidade?

Extraído da nossa publicação no blogue sobre perplexidade e variabilidade repentina — não hesite em consultar esta publicação para obter explicações aprofundadas sobre as limitações destes métodos.

https://www.pangram.com/blog/why-perplexity-and-burstiness-fail-to-detect-ai

A perplexidade é o grau de inesperado ou surpreendente de cada palavra num texto, quando analisada na perspetiva de um determinado modelo de linguagem ou LLM.

Por exemplo, eis duas frases. Vamos concentrar-nos na última palavra de cada frase, para efeitos de demonstração. No primeiro exemplo, a última palavra apresenta uma baixa perplexidade, enquanto no segundo exemplo, a última palavra apresenta uma elevada perplexidade.

Baixa perplexidade:

Hoje, ao almoço, comi uma taça de *sopa*.

Alta perplexidade:

Hoje, ao almoço, comi uma taça de *aranhas*.

A razão pela qual a segunda frase apresenta um elevado índice de perplexidade é que é muito raro um modelo de linguagem encontrar exemplos de pessoas a comerem taças de aranhas no seu conjunto de dados de treino; por isso, é muito surpreendente para o modelo de linguagem que a frase termine com «aranhas», em vez de algo como «sopa», «uma sanduíche» ou «uma salada».

A «burstiness» é a variação da perplexidade ao longo de um documento. Se houver palavras e frases surpreendentes espalhadas por todo o documento, pode dizer-se que este apresenta um elevado nível de «burstiness».

Porque é que o Pangram não utiliza a perplexidade e a variabilidade?

Existem muitas desvantagens na utilização da perplexidade e da variabilidade para detetar textos gerados por IA. Para uma explicação aprofundada do que se segue, consulte a nossa publicação no blogue sobre o tema: https://www.pangram.com/blog/why-perplexity-and-burstiness-fail-to-detect-ai. Como os modelos linguísticos são explicitamente treinados para minimizar a perplexidade nos seus dados de treino, textos humanos frequentemente reproduzidos, como a Declaração de Independência e os artigos da Wikipédia, são erroneamente classificados como sendo da IA, um problema que só se agrava à medida que os modelos incorporam mais conteúdo da Web. Estas métricas são também relativas a um modelo específico, pelo que um detetor calibrado para um gerador produz resultados imprecisos noutro, e muitos modelos comerciais nem sequer disponibilizam as probabilidades de tokens necessárias para calcular a perplexidade. Penalizam sistematicamente os falantes não nativos de inglês, cujo vocabulário mais limitado e estruturas de frases mais simples produzem naturalmente menor perplexidade e variabilidade. E, fundamentalmente, são heurísticas estáticas que não podem melhorar com mais dados nem calcular da forma que uma abordagem de aprendizagem profunda permite — não conseguem oferecer a fiabilidade que as aplicações de alto risco exigem.