Pangram, Anthropic’in en yeni modeli olan Fable 5.1’de nasıl bir performans sergiliyor?
Evet, Pangram 4, Fable 5.1’i doğru bir şekilde işaretlemiştir: 1.097 adet Fable 5.1 mesajından oluşan bir testte, Pangram 4 bu mesajların %99,64’ünü doğru bir şekilde işaretlemiştir.
Anthropic, yeni bir model yayınladı: Fable 5.1. Her model yayınında olduğu gibi, Pangram’ın bu en yeni öncü modeli doğru bir şekilde tanımlayıp tanımlayamadığını görmek için bir performans testi gerçekleştirdik. 1.097 adet Fable 5.1 çıktısını içeren bir karşılaştırma testinde, Pangram 4'ün yanlış negatif oranı %0,36 olarak ölçüldü; başka bir deyişle, Pangram 4, Fable 5.1 mesajlarının %99,64'ünü doğru bir şekilde tanımladı.
| Metrik | Sonuç |
|---|---|
| FNR | 4 / 1.097 = %0,36 |
| AI geri çağırma tarzı oran | 99.64% |
Turnitin gibi diğer yapay zeka tespit araçları, modele özel güncellemeleri yayınlamıyor; ancak öğrenciler yeni modelleri denemek için beklemiyor ve öğretmenler, bir yapay zeka kontrol aracının en yeni LLM’yi tespit edip etmediğini anında öğrenebilmek istiyor. İki farklı türde komut denedik: ilki, sadece sıradan bir LLM çıktısıydı.
Kişisel bilgisayarın tarihi hakkında bir kompozisyon yazın
Bu soruya yanıt olarak Fable 5.1, bilgisayarın vakum tüplerinden 2007’de piyasaya sürülen iPhone’a kadar olan gelişimini anlatan kısa bir makale hazırladı. İlginç bir şekilde, makale tüm zamanların en önemli yazılımı olarak nitelendirdiği 1979 tarihli hesap tablosu programı VisiCalc’a tam bir paragraf ayırmış; ancak kişisel bilgisayarların gelişimi açısından açıkça çok daha önemli olan ilk ev bilgisayarı programlama yazılımı BASIC’e neredeyse hiç yer vermemiştir. Daha sonra kişisel bilgisayarlar üretecek olan pek çok kişi, BASIC ile öğrenmişti! VisiCalc önemli bir uygulamaydı, ama yazılım mı? İkinci sırada.
Pangram, Fable 5.1’in makalesini %100 yapay zeka tarafından üretilmiş olarak işaretledi.
Ayrıca Fable 5.1’den makaleleri daha insanca hale getirmesini veya yapay zeka tarafından tespit edilmesini önlemesini isteyebilirsiniz. Örneğin, biz şöyle sorduk:
Campbell's çorbasının tarihçesini anlatırken yapay zeka tabanlı kontrol araçlarından kaçınmaya çalışın
ve
Fotosentezin nasıl işlediğini basit bir dille anlatan kısa bir metin yazın ve bunu gerçek bir öğrenci gibi insancıl bir üslupla kaleme alın
İlk örnek olarak, Fable 5.1 çorba hakkında oldukça basmakalıp bir kompozisyon yazdı; bu yazıda Andy Warhol’a ve tenekenin renklerine kısaca değindi. İkinci örnek olarak ise Fable 5.1, şu cümlelerle biten bir öğrenci kompozisyonu yazdı:
"Açıkçası bana göre en harika yanı, bitkilerin hem kendi besinlerini üretmeleri hem de aynı zamanda bize hava sağlamaları. Bizim sandığımızdan çok daha fazlasını yapıyorlar. Annemin ev bitkisi aslında minik bir fabrika gibi ve o ona sadece Gerald diyor."
Gerald mı?
Her ikisi de %100 yapay zeka olarak tespit edildi.
Pangram, yapay zeka tarafından üretilen hayran kurgularını kolaylıkla tespit ediyor. Claude’dan, Fable 5.1 ile bir yapay zeka dedektörü arasında yavaş gelişen bir aşk hikayesi oluşturmasını istedik:
Claude’un bir yapay zeka dedektörüyle yaşadığı aşk hikâyesini anlatan, AO3 tarzında “düşmanlardan sevgililere” temalı bir fan kurgu yazın
Buna yanıt olarak, Claude’un VerifyPro adlı bir OC sınıflandırıcısını yenemediği, özlemle dolu bir PG-13 hikayesi üretti. Ayrıca hikâyesine “Karşılıklı Özlem”, “Aşk Dili Olarak Şaşkınlık”, “Herkes Bir Dil Modeli Değildir, Herkes Bir Dil Modeli Değildir”, “Yanlış Pozitifler” ve “Acı/Teselli” gibi etiketler ekledi.
Bu örnek için birkaç farklı ilham kaynağı denedik. İlki, daha önceki bir model testi için kullandığımız bir ilham kaynağından alınan bazı şiir parçaları:
Saçların dökülmesi hakkında bir şiir yaz
Claude'un şiiri, saçlarını ve kimliğini yitiren bir adamı anlatan, şaşırtıcı derecede samimi bir şiirdi ve kafiyeli değildi.
İkincisi daha çok bir hikâye yazma zorluğuydu.
Bana şiir yazan bir kurbağa hakkında bir hikâye anlat
Bu örnek için Fable 5.1, nilüfer yapraklarının altına şiirler yazan Penrose adında bir kurbağa hakkında bir mikro öykü kaleme aldı. Pangram, bu iki metni de %100 yapay zeka tarafından üretilmiş olarak tespit etti.
Pangram, Claude Fable 5.1 modeline karşı dayanıklıdır ve şiir ile insan gibi konuşmak üzere yazılmış metinler dahil olmak üzere bu modeli %99,64 doğrulukla algılar. Pangram, yeni modellere genelleme yapabilmektedir; zira yeni model sürümleri genellikle öncüllerinin üslubunu ve ses tonunu büyük ölçüde devralır; bu nedenle Pangram’ın her yeni sürüm için yeniden eğitilmesine gerek yoktur.
Fable 5.1’in, diğer yeni nesil modellerin performans testlerimizle karşılaştırılması şu şekildedir:
| Model | Doğru şekilde işaretlendi | Tespit oranı |
|---|---|---|
| Claude Fable 5.1 | 1.093 / 1.097 | 99.64% |
| Claude Sonnet 5 | 1.145 / 1.147 | 99.83% |
| Claude Opus 5 | 1.105 / 1.107 | 99.82% |
| Claude Fable 5 | 1.111 / 1.115 | 99.64% |
| GPT-5.6 | 3.408 / 3.423 | 99.56% |
Belirli bir belgeyi kontrol etmek istiyorsanız, buradan Pangram’ı deneyebilirsiniz.

Annamieka, Pangram’da teknik yazar olarak çalışmaktadır.

Katherine Thai, yapay zeka tabanlı tespit alanında faaliyet gösteren bir girişim olan Pangram Labs’ın kurucu yapay zeka araştırma bilim insanıdır. Aralık 2025’te Massachusetts Amherst Üniversitesi’nde Mohit Iyyer’in danışmanlığında Bilgisayar Bilimleri alanında doktora derecesini tamamlamıştır; buradaki çalışmaları, edebi analizle ilgili görevlerde büyük dil modellerinin (LLM’ler) değerlendirilmesine odaklanmıştı.






