Şimdiye kadarki en gelişmiş modelimizi piyasaya sürdük: Pangram 4! Ayrıntıları buradan okuyabilirsiniz.

Ürün Güncellemeleri

Pangram 4 Teknik Raporu

29 Temmuz 2026

Pangram 4, en son teknolojiye sahip yapay zeka metin algılama modelimizdir. Önceki sürümüne kıyasla Pangram 4, tamamen yapay zeka tarafından üretilen, farklı yazarların katkılarıyla oluşturulmuş ve yapay zeka destekli metinleri ayırt etme konusunda belirgin bir gelişme gösterirken, bir belge içindeki insan ve yapay zeka tarafından yazılmış bölümler arasında daha ince bir ayrım yapılmasına olanak tanıyan üstün bir ayrıntı düzeyi sunar. Ayrıca, metinleri insan diline benzeten araçlara ve düşmanca komutlara karşı dayanıklıdır ve en yeni öncü modellerde önemli ölçüde daha yüksek doğruluk gösterir.

Bildiğimiz kadarıyla, Pangram 4, tek bir işlemde hem yapay zeka destekli yazıları hem de yapay zeka ile insan tarafından ortaklaşa yazılmış metinleri aynı anda ayırt edebilen ilk yapay zeka algılama modelidir.

Önemli sonuçlar:

  • Yaptığımız karşılaştırmalı testlerde, Pangram 4, yapay zeka tarafından üretilen belgelerin %99,66’sını doğru bir şekilde tespit ederken, insan tarafından yazılmış metinleri yapay zeka ürünü olarak işaretleme oranı yalnızca %0,0041’dir; bu da yaklaşık olarak her 24.000 belgede bir yanlış pozitif sonuç anlamına gelir.
  • Pangram 4, Pangram 3’e kıyasla her iki açıdan da daha iyi performans sergiliyor; yanlış negatif sonuçlar neredeyse 6 kat, yanlış pozitif sonuçlar ise 14 kat daha az.
  • Pangram 4, yapay zeka ile hafifçe düzeltilmiş metinleri tamamen yapay zeka tarafından üretilmiş metinlerle karıştırmaz: Yapay zeka ile düzeltilmiş insan yazımını tamamen yapay zeka tarafından üretilmiş olarak işaretleme oranı yalnızca %0,009’dur; bu, Pangram 3’e kıyasla 20 kat daha düşük bir orandır.
  • 13 popüler ticari insanlaştırma aracıyla karşılaştırıldığında, Pangram 4, insanlaştırılmış yapay zeka metinlerinde yapay zeka kullanımını %98,83 oranında tespit etmektedir.

Ortak yazarlık ve yapay zeka desteği

Günümüzde üretilen birçok yazılı belge, artık tamamen yapay zeka tarafından oluşturulmuş ya da tamamen insan eliyle yazılmış kategorilerinden birine net bir şekilde sığmamaktadır; aksine, bir metnin üslubu ile argümanının makul bir şekilde farklı kaynaklara dayanabileceği bir dönemde yaşıyoruz.

Bu belge kategorisini, hem tamamen yapay zeka tarafından üretilen hem de tamamen insan tarafından yazılan metinlerden ayırmanın önemli olduğuna inanıyoruz. Bu konu bizim için önemlidir; çünkü hem şeffaf yazarlık ilkesine inanıyoruz, hem de popüler ve gelişmekte olan bir teknoloji olarak dil modellerinin dünyayı henüz tam olarak anlamadığımız şekillerde şekillendirdiğine inanıyoruz – ancak bu konuda bazı ipuçlarımız var. Bazı araştırmalar, metni düzenlemek için dil modellerinin kullanılmasının metnin üslubunu ölçülebilir şekillerde değiştirdiğini göstermektedir; örneğin, bir LLM tarafından yeniden yazılan akademik makaleler, belirsizlik ifade eden kelimeler (“olabilir”, “genellikle”, “önerir”) ve vurgu kelimeleri (“güçlü”, “sağlam”, “tutarlı”) biriktirme eğilimindedir. İlgili çalışmalarda, LLM düzenlemelerinin, modele yalnızca grameri düzeltmesi talimatı verilmiş olsa bile metnin anlamını değiştirdiği ve LLM tarafından yazılan akran değerlendirmelerinin, netlik ve önem unsurlarına insan değerlendiricilerden farklı bir ağırlık verdiği tespit edilmiştir. Başka çalışmalarda ise, kapsamlı düzenlemeler yapılsa bile yapay zeka tarafından üretilen bir taslağın izlerini ortadan kaldırmanın zor olduğuna dair göstergeler bulunmaktadır: LLM çıktısını kendi kişisel üsluplarına göre düzenleyen yazarlar bile, kendi yazımlarından ziyade LLM yazımına daha yakın bir metin üretmektedir.

Bu sorunu ele almak için, insan ve yapay zeka yazarlığının birleştirilebileceği iki ana yolu değerlendiriyoruz. Segmentlerin ya bir yapay zeka ya da bir insan yazara net bir şekilde atfedilebildiği heterojen belgeler için Pangram, token bazında tahmin yöntemini kullanır. Öte yandan, hiçbir tokenin tek bir yapay zeka ya da insan yazara kesin olarak atfedilemediği, yinelemeli olarak düzenlenmiş bir segment için Pangram, söz konusu segmenti “yapay zeka destekli” olarak işaretler.

Pangram, insanlaştırma tekniklerine ve düşmanca komutlara karşı dayanıklıdır

Yapay zeka algılama teknolojisi geliştikçe, otomatik algılamadan kaçınmak amacıyla yapay zeka tarafından üretilen metinleri yeniden yazan yazılımlara olan talep de artmaktadır. Bu araçlar genellikle akademi, araştırma veya yayıncılık gibi yazarlığın hayati önem taşıdığı ortamlarda algılama sistemlerini atlatmayı amaçlamaktadır. Buna karşı koymak için Pangram 4, insan tarafından yazılmış gibi görünen metinleri tespit etmeye yönelik özel bir özelliğe sahiptir. 13 popüler ticari insanlaştırma aracıyla karşılaştırıldığında, Pangram, insanlaştırılmış yapay zeka çıktılarında yapay zeka kullanımını %98,83 oranında tespit etmektedir.

Tespitten kaçınmaya yönelik bir başka yaygın saldırgan strateji ise, Blader humanizer gibi “saldırgan komut verme” yöntemidir; bu yöntemde kullanıcı, bir Büyük Dil Modeli’ne (LLM) tipik yazım tarzından sapması talimatını verir. Bu alanda gösterdiğimiz performansı değerlendirmek amacıyla, tekrarlanabilir yanlış negatif sonuçlar elde etmek amacıyla bir yapay zeka ajanıya (Codex GPT 5.6 Sol) 24 saat boyunca Pangram 4 API’sine erişim izni verdik.

GPT 5.6, bu çalışmasında stil taklidi, özlü profesyonel üslup ve insan kaynaklı metinlerle bağlamın önceden yüklenmesi gibi çeşitli stratejileri test etti. Test döneminde, dikte edilen cerrahi patoloji notlarını taklit ederek yalnızca tek bir başarılı atlatma gerçekleştirebildi. Her ne kadar etkileyici olsa da, hem girdinin çıktından daha fazla bağlam içermesi hem de ortaya çıkan metnin, genellikle hedeflediğimiz açık uçlu düz yazı yerine kısa ve öz madde işaretleri şeklinde olması nedeniyle, bu girişimi nihayetinde kapsam dışı kabul ediyoruz.

Eğitim ve Mimari

Yazarlık durumunu belirlemek amacıyla, yapay zeka tarafından üretilen metni, bir LLM’nin açık uçlu bir yazma görevi veya soruya yanıt olarak ürettiği özgün, doğal dilde yazılmış düz yazı olarak tanımlıyoruz. Ayrıca, LLM’nin özgün token’lar katkıda bulunmasını şart koşuyoruz ve modelin insan tarafından yazılmış metni kelimesi kelimesine tekrarladığı durumları hariç tutuyoruz; örneğin, bağlam penceresinden alıntı yapmak, ezberlenmiş içeriği aktarmak veya insan tarafından girilen dizeleri özetlemek gibi durumlar.

Eğitim verileri

Pangram 4’ü, çok çeşitli alanlardan, dillerden ve yapay zeka modellerinden elde edilen hem insan tarafından yazılmış hem de yapay zeka tarafından üretilmiş metinler üzerinde eğittik.

Önceki sürümlerde olduğu gibi, insan tarafından yazılmış tüm eğitim verileri ticari lisans kapsamındadır veya şirketin mülkiyetindedir. Her zamanki gibi, Pangram 4, kullanıcılar tarafından gönderilen veriler, API kullanıcılarına ait müşteri verileri veya izinsiz internet taramaları yoluyla elde edilen veriler kullanılarak eğitilmemiştir.

İnsan veri setimizdeki alanların genel dağılımı aşağıda gösterilmiştir.

İnsan kaynaklı metnin kategorilere göre yaklaşık dağılımı.İnsan kaynaklı metnin kategorilere göre yaklaşık dağılımı.

Veri setimizin yapay zeka kısmı için, şu anda mevcut olan tüm OpenAI ve Anthropic modelleri de dahil olmak üzere en popüler 75 modeli kullanarak tüm sentetik örnekleri kurum içinde oluşturuyoruz. Sentetik veri setimizi oluştururken amacımız, yapay zeka metinlerindeki konu, dil veya üslup göstergelerini özümsemek yerine, modelin bir metnin nasıl yazıldığını öğrenmesine yardımcı olacak bir bağlam sağlamaktır.

Olağandışı el yazılarında yanlış pozitif sonuçları azaltmak için, aday modeli insan metinlerinden oluşan bir yedek havuz üzerinde çalıştırarak, adayın yapay zeka tarafından üretilmiş olarak yanlış etiketlediği öğeleri tespit ediyoruz. Ardından, yanlış etiketlenen öğelerin sentetik kopyalarını oluşturuyor ve aday modeli birleştirilmiş küme üzerinde yeniden eğitiyoruz. Bu yönteme “sert negatif madenciliği” adını veriyoruz.

Mimarlık

Pangram 4, Pangram 3.3’e kıyasla 6 kat daha fazla parametreye sahip, bugüne kadarki en büyük modelimizdir. Pangram 4, önceki versiyonuna kıyasla birkaç önemli mimari değişiklik barındırmaktadır. Ayrıca, seyrek yönlendirme mekanizmasının farklı türdeki girdileri sinir ağının farklı bölümlerine yönlendirdiği ilk “uzmanlar karışımı” modelimizdir. Girdi olasılıklarının geniş yelpazesi nedeniyle, bu tür bir mimarinin yapay zeka tabanlı algılama için son derece uygun olacağına inanıyoruz.

Tahmin mekanizmaları

Tahminlerinin doğruluğunu artırmak amacıyla Pangram 4, belirli bir girdi dizisindeki her bir token için üç puan hesaplar; bu puanlar, söz konusu tokenin insan tarafından yazılmış, yapay zeka destekli mi yoksa yapay zeka tarafından üretilmiş mi olduğuna dair tahminine karşılık gelir. Daha uzun belgeler, birbiriyle örtüşen 512 tokenlik pencereler halinde puanlanır; böylece her pencere için, token düzeyindeki puanların toplamının yanı sıra bir pencere düzeyinde puan da elde ederiz. Daha sonra, tek tek token tahminlerinde görülen gereksiz dalgalanmaları önlemek amacıyla tüm puanların ortalaması alınır ve pürüzsüzleştirilir. Bu yöntem, ön işleme aşamasında metni basitçe parçalara ayırmaya dayanan önceki yaklaşımın yerini alır ve yapay zeka ile insan tarafından üretilen içerik arasındaki sınırı kesin olarak belirlememizi sağlar.

Performans ve karşılaştırma testleri

Gerçek dünyadaki büyük dil modelleri (LLM) kullanım senaryolarını doğru bir şekilde modellemek amacıyla, Pangram 4’ü insan tarafından yazılmış, yapay zeka tarafından üretilmiş ve yapay zeka destekli metinler üzerinde çeşitli standart ve zorlu test setlerinde değerlendirdik.

Yanlış pozitifler

Test kümesinin insan kaynaklı kısmı için, Pangram 4, model eğitiminin dışında tutulan, 2022 öncesine ait 2 milyon adet ticari lisanslı belge kümesinde karşılaştırmalı değerlendirmeye tabi tutuldu. Bu karşılaştırmada Pangram 4, %95 güven aralığı (%0,0032 – %0,0050) ile %0,0041 oranında yanlış pozitif sonuç vermiştir. Bu, yaklaşık her 24.000 belgede bir yanlış pozitif sonuç anlamına gelmektedir.

Yapay zeka tarafından oluşturulan veri kümesindeki yanlış negatif sonuçlar

Bu karşılaştırma setini, Chatbot Arena Conversations’tan kullanıcı istemlerini derleyerek oluşturduk; bu istem koleksiyonunu, kullanıcıların büyük dil modellerine (LLM’ler) gönderdiği istemlerin gerçek dünyadaki dağılımını yansıtmak amacıyla seçtik. Ardından, küçük bir dil modeli (Mistral-Small-24B-Instruct-2501) kullanarak, matematik veya kodlama yardımı talep eden istemlerin yanı sıra çoktan seçmeli cevapları da filtreledik; zira bunları kapsam dışı kabul ettik. Filtreleme işleminden sonra, modellerden açık uçlu yanıtlar elde ettiğimiz 20.000 komuttan oluşan kapsamlı bir küme elde ettik. Bu kümedeki her bir komuttan, GPT-5.5, Claude Opus 4.8 ve Gemini 3.1 Pro dahil olmak üzere 26 dil modelinden oluşan kümedeki her bir model için bir yanıt ürettik; böylece toplamda 519.993 adet başarıyla puanlanan örnek elde ettik.

Bu karşılaştırma testinde, Pangram 4, aynı veri kümesinde Pangram 3’ün %1,99’luk yanlış negatif oranı (FNR) ile karşılaştırıldığında, %0,3396’lık bir genel yanlış negatif oranı elde etmiştir.

Sınır modellerine karşı dayanıklılık

Pangram 4, öncü dil modellerinin tamamında genel geçerlilik göstermektedir: her model ailesi %0,7’nin altında bir FNR değeriyle tespit edilmektedir ve bir modelin yayınlanma tarihi ile tespit edilebilirliği arasında anlamlı bir korelasyon saptanmamıştır.

ŞirketModel ailesiFNR Ailesi
Düşünen MakinelerSezgi0.190%
AntropikClaude0.195%
NVIDIANemotron0.310%
Alibaba CloudQwen0.315%
OpenAIGPT0.316%
TencentHunyuan0.330%
DeepSeekV40.388%
Moonshot AIKimi0.395%
Mistral AIMistral0.400%
GoogleGemma0.430%
Z.aiGLM0.470%
Googleİkizler0.498%
MetaLama0.550%
xAIGrok0.605%
Genel olarak0.3396%

Karışık ve düzenlenmiş belgelerdeki performans

AI tarafından yapılan küçük düzenlemeleri yanlışlıkla AI kaynaklı olarak işaretleyen bir modelin oranını ifade eden “AI Destekli Yanlış Pozitif Oranı”nı değerlendirmek amacıyla, AI tarafından düzeltilmiş ve son rötuşları yapılmış metinlerden oluşan bir veri kümesi oluşturuyoruz. Tüketiciye yönelik ürünler (Grammarly, Apple Intelligence ve Google Dokümanlar'daki Gemini) ile en yeni büyük dil modelleri (Opus 4.8, Gemini 3.1 ve GPT-5.5) kullanarak ELLIPSE, PELIC ve ICNALE'den alınan öğrenci yazıları üzerinde hafif düzenlemeler uyguluyoruz. Örneğin, bazı metinleri “düzeltmek” için Apple’ın Pages kelime işlemcisine entegre edilmiş Yazma Araçları özelliğini kullandık veya Opus 4.8’e “taslağın insan tarafından yazıldığı anlaşılır şekilde kalmasını sağlarken küçük akademik stil sorunlarını düzelt” talimatını verdik.

Şimdi ne olacak?

Şu anda dünyada türünün en iyisi olduğuna inandığımız bu modeli sizlere sunmaktan büyük heyecan duyuyoruz. Ancak Pangram istatistiksel bir model olduğu için her zaman iyileştirme imkânı vardır; bu nedenle bu model serisi için birkaç hedef belirledik.

Öncelikle, veri sapmasının bir sorun haline gelmeden önce proaktif olarak bu sorunu ele almayı umuyoruz. 2022 öncesine ait bir eğitim kümesinin, standartlarımızın gerektirdiği türden sağlam tahmin modelleri üretmek için ne kadar süreyle yeterli olmaya devam edeceği şu anda bilinmemektedir; bu nedenle, insanlar tarafından hazırlanan eğitim kümesini genişletecek yöntemler bulmak en önemli önceliğimizdir – ancak elbette, eğitimde kullandığımız her organik belge için insan tarafından belirlenen referans değer garantimizden ödün vermeden.

Ardından, Pangram 4’ün tahminlerinin farklı bağlamlarda tutarlılığını sağlamak istiyoruz. Bazen, daha uzun bir metnin bir alt kümesi, tek başına mı yoksa çevreleyen belgeye gömülü mü olduğuna bağlı olarak farklı tahminler alabilir. Bu durum, ek bağlamın modele daha fazla bilgi veya daha güçlü bir sinyal sağladığını yansıtıyor olabilir; ancak daha iyi bir kalibrasyonla bu etkiyi en aza indirebilmeyi umuyoruz.

Son olarak, özellik atıfları, gömülme uzayı ve üretici tanımlama konularındaki anlayışımızı geliştirmek amacıyla yorumlanabilirlik çalışmalarımızı sürdürmek istiyoruz. Bu, en iddialı çalışmalarımızdan biridir ve önümüzdeki aylarda bu alandaki ilerlemelerimizi paylaşmayı sabırsızlıkla bekliyoruz.

Model kartı

Tüm ayrıntılar Pangram 4 model kartında yer almaktadır.


Annamieka Aerts

Annamieka, Pangram’da yazar olarak çalışmaktadır.

Annamieka Aerts'tan daha fazlası
    Pangram 4 Teknik Raporu | Pangram Labs