Fallstudien

Bewertungen von Pangrammen durch Dritte

Unabhängige Bewertungen durch Dritte bestätigen durchweg die internen Genauigkeitswerte von Pangram – eine Zusammenfassung der externen Belege.

2. August 2026

Wir halten es für wichtig, dass sich Institutionen auf die hohe Genauigkeit von Pangram verlassen können, und empfehlen daher eine unabhängige Überprüfung unserer Qualitätskennzahlen (Falsch-Positive und Falsch-Negative). Im Folgenden stellen wir Bewertungen von Pangram vor, die von Forschern der University of Chicago (UChicago) und der University of Maryland (UMD) sowie von kommerziellen Gutachtern stammen.

Das Wichtigste auf einen Blick: Die internen Tests von Pangram halten einer Überprüfung durch Dritte stand.

Pangram erreicht eine Erkennungsrate von 97,5 % bei vollständig KI-generierten Texten und keine Fehlalarme bei ESL-Aufsätzen.

In einer im Juni 2026 veröffentlichten, von Fachkollegen begutachteten Studie testete eine Forschergruppe der Vrije Universiteit Brussel vier KI-Erkennungswerkzeuge – Pangram, GPTZero, Turnitin und Copyleaks – anhand von 160 wissenschaftlichen Arbeiten mit jeweils über 4.000 Wörtern. Der Datensatz war in englischer Sprache verfasst und gleichmäßig aufgeteilt in von ESL-Studierenden verfasste Texte, KI-generierte Texte, hybride Texte (eine Mischung aus menschlichem und KI-Text) sowie humanisierte KI-Texte.

Die Forscher stellten fest, dass Pangram das einzige Tool war, das KI-Inhalte zuverlässig erkennen konnte: „Von den vier hier untersuchten KI-Erkennungstools lieferte derzeit nur [Pangram] zufriedenstellende Ergebnisse.“

Pangram war das einzige Tool, das sowohl vollständig von KI verfasste als auch humanisierte Texte zuverlässig erkennen konnte (97,5 % bzw. 95 %). Bei den vollständig von KI generierten Texten konnten die anderen drei im Wesentlichen keine erkennen und erzielten alle eine Trefferquote von 0 %. Außer Pangram konnte kein anderes Erkennungsprogramm humanisierte Texte zuverlässig verarbeiten, obwohl Turnitin etwa die Hälfte und Copyleaks ein Viertel davon erkennen konnte.

WerkzeugErkennungsrate (vollständig KI-gestützt)Erkennungsrate (Hybrid)Erkennungsrate (humanisiert)Falsch-positiv-Rate
Pangram97.5%95%95%0%
Turnitin0%60%52.5%0%
Copyleaks0%32.5%25%0%
GPTZero0%0%2.5%geringe positive Verzerrung (einziges Tool, das bei menschlichem Text nicht den Wert Null aufweist)

Frühere Untersuchungen hatten ergeben, dass andere Erkennungssysteme bei ESL-Autoren zu Fehlalarmen führten, doch diese unabhängige Studie zeigt, dass Pangram keine nennenswerten Verzerrungen gegenüber ESL-Texten aufweist.

Zuverlässigkeit und Genauigkeit von Pangram (Universität Chicago)

Experiment

Am Becker Friedman Institute for Economics der University of Chicago verglichen Forscher vier KI-Detektoren: Pangram, GPTZero, Originality AI und RoBERTa (ein Open-Source-KI-Detektor). Im Rahmen der Studie wurden mit jedem Detektor 1.992 von Menschen verfasste Texte aus der Zeit vor 2020 sowie 1.992 KI-generierte Texte aus verschiedenen Genres und mit unterschiedlicher Wortanzahl analysiert. Sie untersuchten zwei Arten von Fehlern bei der KI-Erkennung: Falsch-Positiv-Raten und Falsch-Negativ-Raten. Diese Raten wurden für verschiedene Schwellenwerte verglichen. Die Detektoren klassifizierten zudem KI-generierte Texte aus beliebten LLMs wie ChatGPT, Claude und Gemini. Die Forscher legten für die Detektoren verschiedene Obergrenzen für die FPR-Rate fest, um die Veränderungen der FNR zu beobachten.

Ergebnisse

Aus der Studie „Artificial Writing and Automated Detection “ von Brian Jabarian und Alex Imas vom August 2025:

Pangram übertrifft die anderen Detektoren bei allen Schwellenwerten.

Pangram ist der einzige Detektor, der eine strenge Richtwertgrenze (FPR ≤ 0,005) einhält, ohne dabei die Fähigkeit zur genauen Erkennung von KI-Text zu beeinträchtigen.

Pangram ist nach wie vor der Preisführer in allen Genres und liegt im Durchschnitt bei 0,0228 US-Dollar pro korrekt markiertem KI-Textabschnitt, gegenüber 0,0416 US-Dollar bei OriginalityAI und 0,0575 US-Dollar bei GPTZero. Damit ist Pangram der kostengünstigste Detektor sowohl für vollständige Textabschnitte als auch für Textentwürfe.

Die Studie ergab, dass:

Pangram erzielt bei mittellangen bis langen Textpassagen praktisch keine Falsch-Positiv- und Falsch-Negativ-Raten.

Die hohe Genauigkeit von Pangram wurde in verschiedenen Textgattungen wie Blogs, Rezensionen, Lebensläufen, Nachrichten und Romanen gelobt. Bei kürzeren Texten steigen die Falsch-Positiv- und Falsch-Negativ-Raten zwar leicht an, „bleiben aber deutlich unter den als angemessen geltenden Schwellenwerten“.

Durchschnittliche Falsch-Positiv-Rate (menschlicher Text wird fälschlicherweise als KI-Text eingestuft) und Falsch-Negativ-Rate (KI-Text wird nicht erkannt) für jeden Detektor, über die sechs Genres und vier LLMs hinweg. Bei beiden Werten gilt: Je niedriger, desto besser.

WerkzeugFalsch-positiv-RateFalsch-negativ-RateIst der Humanizer robust gegenüber StealthGPT?
Pangram0.0010.01Ja (Erkennungsrate von nahezu 100 %)
Originality.ai0.0020.035Teilweise (bis zu 0,21 FNR bei kurzen Texten)
GPTZero0.0070.06Nein (FNR 0,50+)
RoBERTa (Open Source)0.50unzuverlässig (kennzeichnet den meisten Text als KI)k. A. (nicht geeignet)

Pangram liefert keine Vorhersagen mehr für Texte mit weniger als 50 Wörtern, doch wie in der Studie angemerkt,

Pangram’s performance largely holds up on very short passages (< 50 words) and is robust to “humanizer” tools (e.g., StealthGPT), the performance of other detectors becomes case-dependent.

Pangrams Auftritt gegen die Humanizers (Universität Maryland)

Experiment

In Experiment 1 dieser UMD-Studie wurden Annotatoren mit unterschiedlichen Kenntnissen über LLMs eingesetzt, um vorherzusagen, ob ein Text von einer KI generiert wurde oder nicht. Nachdem festgestellt wurde, dass ein Annotator KI-Texte nahezu fehlerfrei identifizieren konnte, wurden vier weitere erfahrene Annotatoren mit ähnlichem Hintergrund in der Nutzung von LLMs eingesetzt, um dieselbe Stichprobe von 60 Texten zu klassifizieren. Die Ergebnisse der Expertenbewertungen wurden mit kommerziellen Detektoren wie Pangram, Pangram Humanizer und GPTZero sowie mit Open-Source-Tools wie Fast-DetectGPT verglichen. Im Rahmen dieses Prozesses wurde Pangram mit anderen Detektoren verglichen.

Anteil der als KI-Artikel identifizierten Texte (TPR) und Falsch-Positiv-Rate unter allen Bedingungen sowie unter der schwierigsten Bedingung – humanisierter o1-pro-Text. Nur Pangram konnte mit den menschlichen Experten mithalten.

DetektorGesamt-Erkennungsrate (TPR)Falsch-positiv-RateErkennung in humanisiertem Text
Fachleute (Mehrheitsbeschluss)99.3%0%100%
Pangram-Humanisierer99.3%2.7%96.7%
Pangram (Grundform)98.0%2%90.0%
GPTZero85.3%0.7%46.7%
Fast-DetectGPT80.0%7.2%23.3%
Fernglas (Präzisionsmodus)66.7%1.3%6.7%
RADAR15.3%2%0%

Ergebnisse

Pangram kann von KI generierte Texte, die wie von Menschen verfasst wirken, präzise erkennen. Dies wird von Informatikern der UMD bestätigt, die festgestellt haben, dass Pangram bei der Erkennung von „Humanizern“ und umformulierten Texten insgesamt die höchste Punktzahl erzielte und mit einer Genauigkeit von 99,3 % andere KI-Erkennungssoftware übertraf.

Erfahren Sie mehr darüber, wie sich Pangram im Vergleich zu Humanizern schlägt

Bewertung von Pangram außerhalb von Forschungseinrichtungen

Amanda Caswell von Tom’s Guide erklärte in einem Artikel, dass Pangram nach dem Testen Dutzender Tools zur KI-Erkennung „die anderen von mir getesteten Tools übertraf“. Es zeigte sich zudem, dass Pangram intensiv daran arbeitet, die ohnehin schon geringe Anzahl an Fehlalarmen weiter zu reduzieren.

David Gewirtz von ZDNET beschreibt Pangram als „einen Neuling in unseren Tests, der sich sofort einen Platz unter den Gewinnern gesichert hat.“

Da der Einsatz von KI in wissenschaftlichen Arbeiten zugenommen hat, besteht die Sorge, dass dies ein Anzeichen für wissenschaftliches Fehlverhalten sein könnte. Adam Day nutzte in seinem Medium-Artikel die KI-Erkennung von Pangram, um zuverlässige Ergebnisse zur Verbreitung von KI-Inhalten zu erhalten, kam jedoch gleichzeitig zu dem Schluss, dass es legitime Anwendungsfälle für generative KI in der Forschung gibt. Day empfiehlt die Nutzung von Pangram für Forschungszwecke und sagt: „Wenn jemand eine Umfrage zur Nutzung von generativer KI in der veröffentlichten Literatur durchführen möchte, bietet sich meiner Meinung nach eine hervorragende Gelegenheit, dies mit den Tools von Pangram zu tun.“

Fazit

Wir bei Pangram sind davon überzeugt, dass Transparenz die Grundlage für Vertrauen ist. Wir würden uns freuen, gemeinsam mit Ihnen Transparenz in Bezug auf KI in Ihrem Unternehmen zu etablieren.


Destiny Akinode
Destiny AkinodeForschungspraktikantin

Destiny ist Praktikantin im Bereich Marktforschung bei Pangram. Außerdem studiert sie an der NYC College of Technology Angewandte Mathematik und Chemie. Destinys Arbeit bei Pangram hat wesentlich zur Erforschung von KI-Müll im Internet beigetragen. Neben ihrer Arbeit und ihrem Studium widmet sich Destiny leidenschaftlich dem kreativen Schreiben und der Horrorliteratur.

Mehr von Destiny Akinode

Weiterführende Literatur

KI-Konferenzbeiträge werden zunehmend von KI verfasst: Anstieg um 370 % seit 2023
Fallstudien

KI-Konferenzbeiträge werden zunehmend von KI verfasst: Anstieg um 370 % seit 2023

30. September 2024
Welcher KI-Detektor ist am genauesten? 30 Tools im Test (2026)
Fallstudien

Welcher KI-Detektor ist am genauesten? 30 Tools im Test (2026)

7. Januar 2026
Drei Prozent der Rezensionen auf der Startseite von Amazon werden mittlerweile von KI generiert
Fallstudien

Drei Prozent der Rezensionen auf der Startseite von Amazon werden mittlerweile von KI generiert

4. Mai 2026
Pangram zeigt bei verschiedenen Schüleraufsätzen 0 Fehlalarme an
Fallstudien

Pangram zeigt bei verschiedenen Schüleraufsätzen 0 Fehlalarme an

19. August 2026
Wie Gradpilot mit Hilfe von Pangram Schülern dabei hilft, ihren eigenen Stil zu finden
Fallstudien

Wie Gradpilot mit Hilfe von Pangram Schülern dabei hilft, ihren eigenen Stil zu finden

15. September 2025
Wie schneidet Pangram im Vergleich zu GPTZero ab?
Fallstudien

Wie schneidet Pangram im Vergleich zu GPTZero ab?

22. Januar 2026