Fallstudien

Pangram zeigt bei verschiedenen Schüleraufsätzen 0 Fehlalarme an

Pangram 4 lieferte bei allen 25.996 von Menschen verfassten Aufsätzen im PERSUADE 2.0-Korpus keine Fehlalarme, einschließlich aller Untergruppen nach Behinderungsstatus, Geschlecht, Klassenstufe, ethnischer Zugehörigkeit, ELL-Status und wirtschaftlicher Benachteiligung.

19. August 2026

Hier eine kurze Zusammenfassung


Wir haben Pangram 4 anhand des PERSUADE 2.0-Datensatzes mit vielfältigen Schüleraufsätzen evaluiert und in allen 25.996 Aufsätzen keine Fehlalarme festgestellt. Pangram erzeugte in jeder untersuchten Untergruppe keine Fehlalarme.

Es ist wichtig zu verstehen, wie Pangram bei verschiedenen Arten von Autoren abschneidet. Datensätze mit von Menschen verfassten Aufsätzen, die demografische Informationen zu den Autoren enthalten, sind nicht leicht zu beschaffen, doch die Bewertung der Leistung von Pangram anhand von Texten, die von verschiedenen Arten von Autoren verfasst wurden – darunter Studierende mit Behinderungen, Menschen mit Migrationshintergrund, Nicht-Muttersprachler und wirtschaftlich benachteiligte Gruppen –, ist unerlässlich, um zu verstehen, ob das Modell jeden Autor fair behandelt.

Der PERSUADE-Datensatz trägt dazu bei, dieses Problem anzugehen. PERSUADE („Persuasive Essays for Rating, Selecting, and Understanding Argumentative and Discourse Elements“) wurde entwickelt, um die Erstellung unvoreingenommener Algorithmen zur Bewertung von Schülertexten voranzutreiben, und ist eine mit Anmerkungen versehene Sammlung von fast 26.000 Aufsätzen amerikanischer Mittel- und Oberstufenschüler, die zwischen 2010 und 2020 verfasst wurden. Der Datensatz umfasst Schüler*innen mit unterschiedlichen Hintergründen und Leistungsniveaus, und jeder Aufsatz ist mit demografischen Informationen über den Autor oder die Autorin versehen, wie beispielsweise Klassenstufe, Geschlecht, ethnische Zugehörigkeit und sozioökonomischer Hintergrund.

Der PERSUADE-Datensatz bietet aus zwei Gründen eine hervorragende Gelegenheit, Pangram zu bewerten. Erstens wird Pangram nicht mit dem PERSUADE-Datensatz trainiert, sodass wir damit testen können, wie gut Pangram auf bisher unbekannte Schülertexte verallgemeinert. Zweitens ermöglichen uns die demografischen Daten von PERSUADE – einschließlich Schreibproben aus benachteiligten Bevölkerungsgruppen – zu untersuchen, ob Pangram über verschiedene demografische Gruppen hinweg fair abschneidet.

Wichtigste Erkenntnis: Wir haben Pangram 4 anhand des PERSUADE-2.0-Datensatzes mit vielfältigen Schüleraufsätzen evaluiert und bei allen 25.996 Aufsätzen keinerlei Fehlalarme festgestellt. Außerdem haben wir die Ergebnisse nach Behinderungsstatus, Geschlecht, Klassenstufe, Rasse und ethnischer Zugehörigkeit, Status als Englischlernender sowie wirtschaftlicher Benachteiligung untersucht. Pangram erzeugte in jeder der untersuchten Untergruppen keinerlei Fehlalarme.

Die nachstehende Aufschlüsselung beschreibt, wie die Forscher die einzelnen demografischen Merkmale im PERSUADE-Datensatz definiert haben, und gibt die Anzahl der in jeder Gruppe vertretenen Aufsätze an.

Behinderung

Der Begriff „Behinderungsstatus“ im PERSUADE 2.0-Datensatz bezieht sich auf Schüler, die über einen individuellen Förderplan (IEP) oder einen 504-Plan verfügen, und kann Schüler mit einer Vielzahl von Lernbehinderungen oder gesundheitlichen Beeinträchtigungen umfassen.

GruppenFPR
Als behindert eingestuft2,6880%
Es wurde keine Behinderung festgestellt18,1350%
Fehlend/nicht gemeldet5,1730%

Geschlecht

Das Geschlecht im PERSUADE-Datensatz wird durch Selbstangabe ermittelt; das Verhältnis zwischen Männern und Frauen liegt bei etwa 50:50. Pangram weist bei beiden Geschlechtsgruppen keine beobachteten Fehlalarme auf.

GruppenFPR
Weiblich (F)13,1420%
Männlich (M)12,8540%

Klassenstufe

Pangram 4 lieferte in keiner der untersuchten Klassenstufen falsche Positive, was die Robustheit von Pangram für viele verschiedene Niveaustufen der Schreibkompetenz belegt.

GruppenFPR
6. Klasse1,3720%
8. Klasse9,6290%
9. Klasse2,0660%
10. Klasse8,2740%
11. Klasse3,0830%
12. Klasse4040%
Fehlend/nicht gemeldet1,1680%

Ethnische Zugehörigkeit

Die Mehrheit der in der PERSUADE-Datenbank erfassten Autoren gab an, weiß zu sein (45 %), gefolgt von hispanischer Herkunft (25 %) und afroamerikanischer Herkunft (19 %), was in etwa die demografische Verteilung der US-amerikanischen Studierenden widerspiegelt.

GruppenFPR
Weiß11,5710%
Hispanoamerikaner/Latinos6,5600%
Schwarz/Afroamerikaner4,9590%
Asiaten und Pazifikinsulaner1,7430%
Zwei oder mehr Rennen/Sonstiges1,0220%
Indianer/Ureinwohner Alaskas1410%

Status als Englischlernender (ELL)

Während einige frühere Untersuchungen darauf hindeuteten, dass ältere KI-Erkennungsprogramme möglicherweise eine Verzerrung gegenüber Englisch als Zweitsprache und Englischlernenden aufwiesen, hat Pangram im Wesentlichen keine Verzerrung gegenüber diesen Autoren gezeigt und weist im PERSUADE-Datensatz eine beobachtete FPR von 0 % bei ELL-Schülern auf.

GruppenFPR
ELL2,2440%
Nicht ELL22,4510%
Fehlend/nicht gemeldet1,3010%

Wirtschaftliche Benachteiligung

Wirtschaftliche Benachteiligung wird im PERSUADE-Korpus als Anspruch der Schüler auf bestimmte staatliche Unterstützungsleistungen definiert, wie beispielsweise kostenlose oder preisreduzierte Schulmahlzeiten und die „Supplemental Nutrition Assistance Programs“ (SNAP).

GruppenFPR
Wirtschaftlich benachteiligt9,6430%
Wahrscheinlich nicht wirtschaftlich benachteiligt11,1160%
Fehlend/nicht gemeldet5,2370%

Fazit

Bei allen 25.996 von Menschen verfassten Aufsätzen im PERSUADE 2.0-Korpus lieferte Pangram 4 in keiner Untergruppe – einschließlich Behinderungsstatus, Geschlecht, Klassenstufe, ethnischer Zugehörigkeit, Status als Englischlernender und wirtschaftlicher Benachteiligung – falsche Positive. Dieses Ergebnis zeigt, dass Pangram sich gut auf vielfältige Autorengruppen übertragen lässt, ohne die Werke dieser Autoren unverhältnismäßig oft fälschlicherweise als KI-generiert einzustufen.

Unser Ziel ist es, Fehlalarme in allen Autorengruppen so selten wie möglich zu halten, und eine kontinuierliche Bewertung ist dabei von großer Bedeutung. Im Rahmen von PERSUADE 2.0 weist Pangram 4 jedoch in jeder demografischen Untergruppe null Fehlalarme auf.

Literaturverzeichnis


Katherine Thai
Katherine ThaiGründungsmitglied und KI-Forschungswissenschaftlerin

Katherine Thai ist Gründungsmitglied und Forschungswissenschaftlerin im Bereich KI bei Pangram Labs, einem Start-up für KI-Erkennung. Im Dezember 2025 schloss sie ihre Promotion in Informatik unter der Betreuung von Mohit Iyyer an der University of Massachusetts Amherst ab, wo sich ihre Arbeit auf die Bewertung von LLMs bei Aufgaben im Zusammenhang mit der Literaturanalyse konzentrierte.

Mehr von Katherine Thai
Annamieka Aerts

Annamieka ist technische Redakteurin bei Pangram.

Mehr von Annamieka Aerts

Weiterführende Literatur

KI-Konferenzbeiträge werden zunehmend von KI verfasst: Anstieg um 370 % seit 2023
Fallstudien

KI-Konferenzbeiträge werden zunehmend von KI verfasst: Anstieg um 370 % seit 2023

30. September 2024
Jeden Tag werden 60.000 KI-generierte Nachrichtenartikel veröffentlicht
Fallstudien

Jeden Tag werden 60.000 KI-generierte Nachrichtenartikel veröffentlicht

5. August 2024
KI verfasst preisgekrönte Belletristik
Fallstudien

KI verfasst preisgekrönte Belletristik

21. Mai 2026
Wie schneidet Pangram im Vergleich zu GPTZero ab?
Fallstudien

Wie schneidet Pangram im Vergleich zu GPTZero ab?

22. Januar 2026
Wie Gradpilot mit Hilfe von Pangram Schülern dabei hilft, ihren eigenen Stil zu finden
Fallstudien

Wie Gradpilot mit Hilfe von Pangram Schülern dabei hilft, ihren eigenen Stil zu finden

15. September 2025
Bewertungen von Pangrammen durch Dritte
Fallstudien

Bewertungen von Pangrammen durch Dritte

2. August 2026