Pangram 4 lieferte bei allen 25.996 von Menschen verfassten Aufsätzen im PERSUADE 2.0-Korpus keine Fehlalarme, einschließlich aller Untergruppen nach Behinderungsstatus, Geschlecht, Klassenstufe, ethnischer Zugehörigkeit, ELL-Status und wirtschaftlicher Benachteiligung.
Wir haben Pangram 4 anhand des PERSUADE 2.0-Datensatzes mit vielfältigen Schüleraufsätzen evaluiert und in allen 25.996 Aufsätzen keine Fehlalarme festgestellt. Pangram erzeugte in jeder untersuchten Untergruppe keine Fehlalarme.
Es ist wichtig zu verstehen, wie Pangram bei verschiedenen Arten von Autoren abschneidet. Datensätze mit von Menschen verfassten Aufsätzen, die demografische Informationen zu den Autoren enthalten, sind nicht leicht zu beschaffen, doch die Bewertung der Leistung von Pangram anhand von Texten, die von verschiedenen Arten von Autoren verfasst wurden – darunter Studierende mit Behinderungen, Menschen mit Migrationshintergrund, Nicht-Muttersprachler und wirtschaftlich benachteiligte Gruppen –, ist unerlässlich, um zu verstehen, ob das Modell jeden Autor fair behandelt.
Der PERSUADE-Datensatz trägt dazu bei, dieses Problem anzugehen. PERSUADE („Persuasive Essays for Rating, Selecting, and Understanding Argumentative and Discourse Elements“) wurde entwickelt, um die Erstellung unvoreingenommener Algorithmen zur Bewertung von Schülertexten voranzutreiben, und ist eine mit Anmerkungen versehene Sammlung von fast 26.000 Aufsätzen amerikanischer Mittel- und Oberstufenschüler, die zwischen 2010 und 2020 verfasst wurden. Der Datensatz umfasst Schüler*innen mit unterschiedlichen Hintergründen und Leistungsniveaus, und jeder Aufsatz ist mit demografischen Informationen über den Autor oder die Autorin versehen, wie beispielsweise Klassenstufe, Geschlecht, ethnische Zugehörigkeit und sozioökonomischer Hintergrund.
Der PERSUADE-Datensatz bietet aus zwei Gründen eine hervorragende Gelegenheit, Pangram zu bewerten. Erstens wird Pangram nicht mit dem PERSUADE-Datensatz trainiert, sodass wir damit testen können, wie gut Pangram auf bisher unbekannte Schülertexte verallgemeinert. Zweitens ermöglichen uns die demografischen Daten von PERSUADE – einschließlich Schreibproben aus benachteiligten Bevölkerungsgruppen – zu untersuchen, ob Pangram über verschiedene demografische Gruppen hinweg fair abschneidet.
Wichtigste Erkenntnis: Wir haben Pangram 4 anhand des PERSUADE-2.0-Datensatzes mit vielfältigen Schüleraufsätzen evaluiert und bei allen 25.996 Aufsätzen keinerlei Fehlalarme festgestellt. Außerdem haben wir die Ergebnisse nach Behinderungsstatus, Geschlecht, Klassenstufe, Rasse und ethnischer Zugehörigkeit, Status als Englischlernender sowie wirtschaftlicher Benachteiligung untersucht. Pangram erzeugte in jeder der untersuchten Untergruppen keinerlei Fehlalarme.
Die nachstehende Aufschlüsselung beschreibt, wie die Forscher die einzelnen demografischen Merkmale im PERSUADE-Datensatz definiert haben, und gibt die Anzahl der in jeder Gruppe vertretenen Aufsätze an.
Der Begriff „Behinderungsstatus“ im PERSUADE 2.0-Datensatz bezieht sich auf Schüler, die über einen individuellen Förderplan (IEP) oder einen 504-Plan verfügen, und kann Schüler mit einer Vielzahl von Lernbehinderungen oder gesundheitlichen Beeinträchtigungen umfassen.
| Gruppe | n | FPR |
|---|---|---|
| Als behindert eingestuft | 2,688 | 0% |
| Es wurde keine Behinderung festgestellt | 18,135 | 0% |
| Fehlend/nicht gemeldet | 5,173 | 0% |
Das Geschlecht im PERSUADE-Datensatz wird durch Selbstangabe ermittelt; das Verhältnis zwischen Männern und Frauen liegt bei etwa 50:50. Pangram weist bei beiden Geschlechtsgruppen keine beobachteten Fehlalarme auf.
| Gruppe | n | FPR |
|---|---|---|
| Weiblich (F) | 13,142 | 0% |
| Männlich (M) | 12,854 | 0% |
Pangram 4 lieferte in keiner der untersuchten Klassenstufen falsche Positive, was die Robustheit von Pangram für viele verschiedene Niveaustufen der Schreibkompetenz belegt.
| Gruppe | n | FPR |
|---|---|---|
| 6. Klasse | 1,372 | 0% |
| 8. Klasse | 9,629 | 0% |
| 9. Klasse | 2,066 | 0% |
| 10. Klasse | 8,274 | 0% |
| 11. Klasse | 3,083 | 0% |
| 12. Klasse | 404 | 0% |
| Fehlend/nicht gemeldet | 1,168 | 0% |
Die Mehrheit der in der PERSUADE-Datenbank erfassten Autoren gab an, weiß zu sein (45 %), gefolgt von hispanischer Herkunft (25 %) und afroamerikanischer Herkunft (19 %), was in etwa die demografische Verteilung der US-amerikanischen Studierenden widerspiegelt.
| Gruppe | n | FPR |
|---|---|---|
| Weiß | 11,571 | 0% |
| Hispanoamerikaner/Latinos | 6,560 | 0% |
| Schwarz/Afroamerikaner | 4,959 | 0% |
| Asiaten und Pazifikinsulaner | 1,743 | 0% |
| Zwei oder mehr Rennen/Sonstiges | 1,022 | 0% |
| Indianer/Ureinwohner Alaskas | 141 | 0% |
Während einige frühere Untersuchungen darauf hindeuteten, dass ältere KI-Erkennungsprogramme möglicherweise eine Verzerrung gegenüber Englisch als Zweitsprache und Englischlernenden aufwiesen, hat Pangram im Wesentlichen keine Verzerrung gegenüber diesen Autoren gezeigt und weist im PERSUADE-Datensatz eine beobachtete FPR von 0 % bei ELL-Schülern auf.
| Gruppe | n | FPR |
|---|---|---|
| ELL | 2,244 | 0% |
| Nicht ELL | 22,451 | 0% |
| Fehlend/nicht gemeldet | 1,301 | 0% |
Wirtschaftliche Benachteiligung wird im PERSUADE-Korpus als Anspruch der Schüler auf bestimmte staatliche Unterstützungsleistungen definiert, wie beispielsweise kostenlose oder preisreduzierte Schulmahlzeiten und die „Supplemental Nutrition Assistance Programs“ (SNAP).
| Gruppe | n | FPR |
|---|---|---|
| Wirtschaftlich benachteiligt | 9,643 | 0% |
| Wahrscheinlich nicht wirtschaftlich benachteiligt | 11,116 | 0% |
| Fehlend/nicht gemeldet | 5,237 | 0% |
Bei allen 25.996 von Menschen verfassten Aufsätzen im PERSUADE 2.0-Korpus lieferte Pangram 4 in keiner Untergruppe – einschließlich Behinderungsstatus, Geschlecht, Klassenstufe, ethnischer Zugehörigkeit, Status als Englischlernender und wirtschaftlicher Benachteiligung – falsche Positive. Dieses Ergebnis zeigt, dass Pangram sich gut auf vielfältige Autorengruppen übertragen lässt, ohne die Werke dieser Autoren unverhältnismäßig oft fälschlicherweise als KI-generiert einzustufen.
Unser Ziel ist es, Fehlalarme in allen Autorengruppen so selten wie möglich zu halten, und eine kontinuierliche Bewertung ist dabei von großer Bedeutung. Im Rahmen von PERSUADE 2.0 weist Pangram 4 jedoch in jeder demografischen Untergruppe null Fehlalarme auf.

Katherine Thai ist Gründungsmitglied und Forschungswissenschaftlerin im Bereich KI bei Pangram Labs, einem Start-up für KI-Erkennung. Im Dezember 2025 schloss sie ihre Promotion in Informatik unter der Betreuung von Mohit Iyyer an der University of Massachusetts Amherst ab, wo sich ihre Arbeit auf die Bewertung von LLMs bei Aufgaben im Zusammenhang mit der Literaturanalyse konzentrierte.







