Pangram 4, PERSUADE 2.0 külliyatındaki 25.996 adet insan tarafından yazılmış kompozisyonun tamamında, engellilik durumu, cinsiyet, sınıf seviyesi, etnik köken, İngilizceyi ikinci dil olarak öğrenen (ELL) statüsü ve ekonomik dezavantaj gibi tüm alt gruplar dahil olmak üzere, sıfır yanlış pozitif sonuç verdi.
Çeşitli öğrenci kompozisyonlarından oluşan PERSUADE 2.0 veri seti üzerinde Pangram 4’ü değerlendirdik ve 25.996 kompozisyonun tamamında sıfır yanlış pozitif sonuç tespit ettik. Pangram, raporlanan her alt grupta sıfır yanlış pozitif sonuç verdi.
Pangram’ın farklı türden yazarların metinlerinde nasıl bir performans sergilediğini anlamak önemlidir. Yazarların demografik bilgilerini içeren, insan tarafından yazılmış deneme metinlerinden oluşan veri kümelerine ulaşmak kolay değildir; ancak Pangram’ın, engelli öğrenciler, farklı etnik kökenlerden gelen kişiler, ana dili İngilizce olmayanlar ve ekonomik açıdan dezavantajlı gruplar da dahil olmak üzere farklı türden yazarların ürettiği metinler üzerindeki performansını değerlendirmek, modelin her yazara adil davranıp davranmadığını anlamak açısından hayati önem taşır.
PERSUADE veri kümesi bu sorunun çözümüne katkıda bulunur. Öğrencilerin yazdıklarını değerlendirmek üzere önyargısız algoritmaların geliştirilmesini desteklemek amacıyla oluşturulan PERSUADE (“Argüman ve Söylem Unsurlarını Değerlendirme, Seçme ve Anlama Amaçlı İkna Edici Denemeler”), 2010 ile 2020 yılları arasında Amerikan ortaokul ve lise öğrencileri tarafından yazılmış yaklaşık 26 bin denemeden oluşan etiketli bir koleksiyondur. Veri kümesi, farklı geçmişlere ve yetenek düzeylerine sahip öğrencileri kapsamaktadır ve her deneme, sınıf seviyesi, cinsiyet, etnik köken ve sosyoekonomik geçmiş gibi yazara ait demografik bilgilerle etiketlenmiştir.
PERSUADE veri kümesi, iki nedenden ötürü Pangram’ı değerlendirmek için mükemmel bir fırsat sunuyor. Birincisi, Pangram, PERSUADE veri kümesi üzerinde eğitilmemiştir; bu nedenle bu veri kümesini, Pangram’ın daha önce görülmemiş öğrenci yazıları üzerinde ne kadar genelleme yapabildiğini test etmek için kullanabiliriz. İkincisi, PERSUADE’nin demografik verileri — dezavantajlı gruplardan alınan yazma örnekleri de dahil olmak üzere — Pangram’ın farklı demografik gruplar arasında adil bir performans sergilip sergilemediğini incelememize olanak tanır.
Önemli sonuç: Pangram 4’ü, çeşitli öğrenci kompozisyonlarından oluşan PERSUADE 2.0 veri seti üzerinde değerlendirdik ve 25.996 kompozisyonun tamamında sıfır yanlış pozitif sonuç elde ettik. Ayrıca sonuçları engellilik durumu, cinsiyet, sınıf seviyesi, ırk ve etnik köken, İngilizce öğrenen statüsü ve ekonomik dezavantaj açısından inceledik. Pangram, raporlanan her alt grupta sıfır yanlış pozitif sonuç verdi.
Aşağıdaki döküm, araştırmacıların PERSUADE veri setindeki her bir demografik özelliği nasıl tanımladıklarını açıklamakta ve her grupta yer alan makale sayısını göstermektedir.
PERSUADE 2.0 veri setindeki “engellilik durumu” ifadesi, Bireyselleştirilmiş Eğitim Programı (IEP) veya 504 Planı’na sahip öğrencileri ifade eder ve çok çeşitli öğrenme güçlükleri veya sağlık sorunları olan öğrencileri kapsayabilir.
| Grup | n | FPR |
|---|---|---|
| Engelli olduğu tespit edilen | 2,688 | 0% |
| Engelli olduğu tespit edilmemiştir | 18,135 | 0% |
| Eksik/bildirilmemiş | 5,173 | 0% |
PERSUADE veri setinde cinsiyet, kişinin kendi beyanına dayanmaktadır ve erkek ile kadın arasında yaklaşık olarak 50/50 oranında bir dağılım söz konusudur. Pangram, her iki cinsiyet grubunda da gözlemlenen yanlış pozitif sonuç sayısının sıfır olduğunu göstermektedir.
| Grup | n | FPR |
|---|---|---|
| Kadın (K) | 13,142 | 0% |
| Erkek (M) | 12,854 | 0% |
Pangram 4, gözlemlenen tüm sınıf seviyelerinde sıfır yanlış pozitif sonuç verdi; bu da Pangram'ın birçok farklı yazma yeterlilik seviyesi açısından ne kadar sağlam olduğunu göstermektedir.
| Grup | n | FPR |
|---|---|---|
| 6. sınıf | 1,372 | 0% |
| 8. sınıf | 9,629 | 0% |
| 9. sınıf | 2,066 | 0% |
| 10. sınıf | 8,274 | 0% |
| 11. sınıf | 3,083 | 0% |
| 12. sınıf | 404 | 0% |
| Eksik/bildirilmemiş | 1,168 | 0% |
PERSUADE veritabanında tespit edilen yazarların çoğunluğu Beyaz (%45) olarak tanımlanmıştır; bunu Hispanik (%25) ve ardından Siyah (%19) izlemektedir; bu da ABD öğrenci nüfusunun demografik dağılımını kabaca yansıtmaktadır.
| Grup | n | FPR |
|---|---|---|
| Beyaz | 11,571 | 0% |
| Hispanik/Latin kökenli | 6,560 | 0% |
| Siyah/Afrikalı-Amerikalı | 4,959 | 0% |
| Asya/Pasifik Adalı | 1,743 | 0% |
| İki veya daha fazla ırk/Diğer | 1,022 | 0% |
| Amerikan Yerlisi/Alaska Yerlisi | 141 | 0% |
Bazı erken dönem araştırmalar, eski yapay zeka algılama programlarının İngilizceyi ikinci dil olarak konuşanlara ve İngilizce öğrenenlere karşı önyargılı olabileceğini göstermiş olsa da, Pangram bu yazarlara karşı esasen hiçbir önyargı sergilememiştir ve PERSUADE veri kümesindeki İngilizce öğrenen öğrencilerde gözlemlenen FPR oranı %0’dır.
| Grup | n | FPR |
|---|---|---|
| ELL | 2,244 | 0% |
| ELL değil | 22,451 | 0% |
| Eksik/bildirilmemiş | 1,301 | 0% |
PERSUADE veri kümesinde ekonomik dezavantaj, öğrencilerin ücretsiz veya indirimli okul öğle yemeği ve Ek Beslenme Yardım Programları gibi belirli federal yardımlardan yararlanma hakkı olarak tanımlanmaktadır.
| Grup | n | FPR |
|---|---|---|
| Ekonomik açıdan dezavantajlı | 9,643 | 0% |
| Muhtemelen ekonomik açıdan dezavantajlı değiller | 11,116 | 0% |
| Eksik/bildirilmemiş | 5,237 | 0% |
PERSUADE 2.0 metin derlemesindeki insan tarafından yazılmış toplam 25.996 deneme üzerinde yapılan değerlendirmede, Pangram 4, engellilik durumu, cinsiyet, sınıf seviyesi, etnik köken, İngilizce öğrenen statüsü ve ekonomik dezavantaj dahil olmak üzere tüm alt gruplarda sıfır yanlış pozitif sonuç vermiştir. Bu sonuç, Pangram’ın çeşitli yazar gruplarına iyi bir şekilde genelleme yapabildiğini ve bu yazarların çalışmalarını orantısız bir şekilde yapay zeka tarafından üretilmiş olarak yanlış sınıflandırmadığını göstermektedir.
Tüm yazar grupları genelinde yanlış pozitif sonuçların sayısını olabildiğince az tutmayı hedefliyoruz ve bu konuda sürekli değerlendirme yapmak önemlidir. Bununla birlikte, PERSUADE 2.0 kapsamında Pangram 4, her demografik alt grupta sıfır yanlış pozitif sonuç sergilemektedir.

Katherine Thai, yapay zeka tabanlı tespit alanında faaliyet gösteren bir girişim olan Pangram Labs’ın kurucu yapay zeka araştırma bilim insanıdır. Aralık 2025’te Massachusetts Amherst Üniversitesi’nde Mohit Iyyer’in danışmanlığında Bilgisayar Bilimleri alanında doktora derecesini tamamlamıştır; buradaki çalışmaları, edebi analizle ilgili görevlerde büyük dil modellerinin (LLM’ler) değerlendirilmesine odaklanmıştı.

Annamieka, Pangram’da teknik yazar olarak çalışmaktadır.






