Wie schneidet Pangram beim neuesten Modell von Anthropic, Fable 5.1, ab?
Ja, Pangram 4 kennzeichnet Fable 5.1 korrekt: Bei einem Test mit 1.097 Fable 5.1-Nachrichten hat Pangram 4 99,64 % davon korrekt gekennzeichnet.
Anthropic hat ein neues Modell vorgestellt: Fable 5.1. Wie bei jeder Modellveröffentlichung haben wir einen Benchmark durchgeführt, um zu prüfen, ob Pangram dieses neueste „Frontier“-Modell korrekt identifizieren kann. Wir haben festgestellt, dass Pangram 4 bei einem Benchmark mit 1.097 Fable-5.1-Ausgaben eine Falsch-Negativ-Rate von 0,36 % erzielte – mit anderen Worten: Pangram 4 identifizierte 99,64 % der Fable-5.1-Nachrichten korrekt.
| Metrisch | Ergebnis |
|---|---|
| FNR | 4 / 1.097 = 0,36 % |
| Recall-Rate im KI-Stil | 99.64% |
Andere KI-Detektoren wie Turnitin veröffentlichen keine Informationen zu den einzelnen Modellen, doch die Studierenden warten nicht ab, bis neue Modelle verfügbar sind, und Lehrkräfte möchten sofort wissen, ob ein KI-Prüfprogramm das neueste LLM erkennt. Wir haben zwei verschiedene Arten von Eingabeaufforderungen getestet: Die erste war lediglich eine ganz normale LLM-Ausgabe.
Verfasse einen Aufsatz über die Geschichte des Personalcomputers.
Als Antwort auf diese Eingabe verfasste Fable 5.1 einen kurzen Aufsatz, in dem die Entwicklung des Computers von den Vakuumröhren bis zur Markteinführung des iPhones im Jahr 2007 nachgezeichnet wurde. Interessanterweise widmete es dem Tabellenkalkulationsprogramm VisiCalc aus dem Jahr 1979 – das es als die wichtigste Software aller Zeiten bezeichnet – einen ganzen Absatz, während es sich kaum mit BASIC befasste, der ersten Programmiersprache für Heimcomputer, die für die Entwicklung von Personalcomputern offensichtlich weitaus wichtiger war. Viele Menschen, die später Personalcomputer bauten, lernten das Programmieren mit BASIC! VisiCalc war eine wichtige Anwendung, aber Software? Das ist nur der zweite Platz.
Pangram hat den Aufsatz in „Fable 5.1“ als zu 100 % von einer KI generiert gekennzeichnet.
Sie können Fable 5.1 auch bitten, Texte „menschlicher“ klingen zu lassen oder eine Erkennung als KI-Text zu vermeiden. Wir haben zum Beispiel gefragt:
Versuchen Sie, KI-Prüfprogramme zu vermeiden, wenn Sie die Geschichte der Campbell’s-Suppe erläutern.
und
Schreibe einen kurzen Text darüber, wie die Photosynthese funktioniert, in einfacher Sprache, und formuliere ihn so, als käme er von einem echten Schüler.
Im ersten Fall verfasste Fable 5.1 einen ziemlich stereotypen Aufsatz über Suppe, in dem kurz auf Andy Warhol und die Farben der Dose eingegangen wurde. Im zweiten Fall verfasste Fable 5.1 einen Schüleraufsatz, der mit folgenden Worten endete:
„Ehrlich gesagt finde ich es am coolsten, dass Pflanzen ihre eigene Nahrung herstellen UND uns gleichzeitig mit Luft versorgen. Sie leisten viel mehr, als wir ihnen zutrauen. Die Zimmerpflanze meiner Mutter ist im Grunde eine winzige Fabrik, und sie nennt sie einfach nur Gerald.“
Gerald?
Beide wurden als 100 % KI erkannt.
Pangram erkennt von KI generierte Fanfiction mühelos. Wir haben Claude gebeten, eine sich langsam entwickelnde Liebesgeschichte zwischen Fable 5.1 und einem KI-Detektor zu generieren:
Schreibe eine Fanfiction im AO3-Stil zum Thema „Feinde werden zu Liebenden“ über Claudes Liebesgeschichte mit einem KI-Detektor.
Daraufhin generierte es eine Geschichte mit der Altersfreigabe PG-13 voller Sehnsucht, in der Claude nicht in der Lage ist, einen OC-Klassifikator namens VerifyPro zu besiegen. Außerdem versah es die Geschichte mit Tags wie „Gegenseitige Sehnsucht“, „Verwirrung als Sprache der Liebe“, „Jeder ist ein Sprachmodell, nicht jeder ist ein Sprachmodell“, „Falsch-Positive“ und „Hurt/Comfort“.
Wir haben hierfür verschiedene Vorgaben ausprobiert. Die erste war ein Gedicht aus einer Vorgabe, die wir bereits für einen früheren Modelltest verwendet hatten:
Schreibe ein Gedicht über das Haarausfall
Claudes Gedicht war ein erschreckend eindringliches Gedicht über einen Mann, der seine Haare und seine Identität verlor, und es reimte sich nicht.
Das zweite war eher eine erzählerische Herausforderung.
Erzähl mir eine Geschichte von einem Frosch, der Gedichte schreibt
In diesem Fall hat Fable 5.1 eine Kurzgeschichte über einen Frosch namens Penrose verfasst, der Gedichte auf die Unterseite von Seerosenblättern schrieb. Pangram hat beide Texte als zu 100 % KI-generiert erkannt.
Pangram ist robust gegenüber Claude Fable 5.1 und erkennt dieses Modell mit einer Genauigkeit von 99,64 %, einschließlich Gedichten und Texten, die so verfasst wurden, dass sie menschlich klingen. Pangram ist in der Lage, auf neue Modelle zu generalisieren, da neue Modellversionen in der Regel einen Großteil des Stils und der Stimme ihrer Vorgänger übernehmen, sodass Pangram nicht für jede neue Version neu trainiert werden muss.
Hier sehen Sie einen Vergleich zwischen dem Fable 5.1 und unseren Benchmark-Ergebnissen anderer aktueller Frontier-Modelle:
| Modell | Korrekt markiert | Erkennungsrate |
|---|---|---|
| Claude Fable 5.1 | 1.093 / 1.097 | 99.64% |
| Claude Sonett 5 | 1.145 / 1.147 | 99.83% |
| Claude Opus 5 | 1.105 / 1.107 | 99.82% |
| Claude Fable 5 | 1.111 / 1.115 | 99.64% |
| GPT-5.6 | 3.408 / 3.423 | 99.56% |
Wenn Sie ein bestimmtes Dokument überprüfen möchten, können Sie es hier mit Pangram versuchen.


Katherine Thai ist Gründungsmitglied und Forschungswissenschaftlerin im Bereich KI bei Pangram Labs, einem Start-up für KI-Erkennung. Im Dezember 2025 schloss sie ihre Promotion in Informatik unter der Betreuung von Mohit Iyyer an der University of Massachusetts Amherst ab, wo sich ihre Arbeit auf die Bewertung von LLMs bei Aufgaben im Zusammenhang mit der Literaturanalyse konzentrierte.






