Şimdiye kadarki en gelişmiş modelimizi piyasaya sürdük: Pangram 4! Ayrıntıları buradan okuyabilirsiniz.
Pangram 4, en son teknolojiye sahip yapay zeka metin algılama modelimizdir. Önceki sürümüne kıyasla Pangram 4, tamamen yapay zeka tarafından üretilen, farklı yazarların katkılarıyla oluşturulmuş ve yapay zeka destekli metinleri ayırt etme konusunda belirgin bir gelişme gösterirken, bir belge içindeki insan ve yapay zeka tarafından yazılmış bölümler arasında daha ince bir ayrım yapılmasına olanak tanıyan üstün bir ayrıntı düzeyi sunar. Ayrıca, metinleri insan diline benzeten araçlara ve düşmanca komutlara karşı dayanıklıdır ve en yeni öncü modellerde önemli ölçüde daha yüksek doğruluk gösterir.
Bildiğimiz kadarıyla, Pangram 4, tek bir işlemde hem yapay zeka destekli yazıları hem de yapay zeka ile insan tarafından ortaklaşa yazılmış metinleri aynı anda ayırt edebilen ilk yapay zeka algılama modelidir.
Günümüzde üretilen birçok yazılı belge, artık tamamen yapay zeka tarafından oluşturulmuş ya da tamamen insan eliyle yazılmış kategorilerinden birine net bir şekilde sığmamaktadır; aksine, bir metnin üslubu ile argümanının makul bir şekilde farklı kaynaklara dayanabileceği bir dönemde yaşıyoruz.
Bu belge kategorisini, hem tamamen yapay zeka tarafından üretilen hem de tamamen insan tarafından yazılan metinlerden ayırmanın önemli olduğuna inanıyoruz. Bu konu bizim için önemlidir; çünkü hem şeffaf yazarlık ilkesine inanıyoruz, hem de popüler ve gelişmekte olan bir teknoloji olarak dil modellerinin dünyayı henüz tam olarak anlamadığımız şekillerde şekillendirdiğine inanıyoruz – ancak bu konuda bazı ipuçlarımız var. Bazı araştırmalar, metni düzenlemek için dil modellerinin kullanılmasının metnin üslubunu ölçülebilir şekillerde değiştirdiğini göstermektedir; örneğin, bir LLM tarafından yeniden yazılan akademik makaleler, belirsizlik ifade eden kelimeler (“olabilir”, “genellikle”, “önerir”) ve vurgu kelimeleri (“güçlü”, “sağlam”, “tutarlı”) biriktirme eğilimindedir. İlgili çalışmalarda, LLM düzenlemelerinin, modele yalnızca grameri düzeltmesi talimatı verilmiş olsa bile metnin anlamını değiştirdiği ve LLM tarafından yazılan akran değerlendirmelerinin, netlik ve önem unsurlarına insan değerlendiricilerden farklı bir ağırlık verdiği tespit edilmiştir. Başka çalışmalarda ise, kapsamlı düzenlemeler yapılsa bile yapay zeka tarafından üretilen bir taslağın izlerini ortadan kaldırmanın zor olduğuna dair göstergeler bulunmaktadır: LLM çıktısını kendi kişisel üsluplarına göre düzenleyen yazarlar bile, kendi yazımlarından ziyade LLM yazımına daha yakın bir metin üretmektedir.
Bu sorunu ele almak için, insan ve yapay zeka yazarlığının birleştirilebileceği iki ana yolu değerlendiriyoruz. Segmentlerin ya bir yapay zeka ya da bir insan yazara net bir şekilde atfedilebildiği heterojen belgeler için Pangram, token bazında tahmin yöntemini kullanır. Öte yandan, hiçbir tokenin tek bir yapay zeka ya da insan yazara kesin olarak atfedilemediği, yinelemeli olarak düzenlenmiş bir segment için Pangram, söz konusu segmenti “yapay zeka destekli” olarak işaretler.
Yapay zeka algılama teknolojisi geliştikçe, otomatik algılamadan kaçınmak amacıyla yapay zeka tarafından üretilen metinleri yeniden yazan yazılımlara olan talep de artmaktadır. Bu araçlar genellikle akademi, araştırma veya yayıncılık gibi yazarlığın hayati önem taşıdığı ortamlarda algılama sistemlerini atlatmayı amaçlamaktadır. Buna karşı koymak için Pangram 4, insan tarafından yazılmış gibi görünen metinleri tespit etmeye yönelik özel bir özelliğe sahiptir. 13 popüler ticari insanlaştırma aracıyla karşılaştırıldığında, Pangram, insanlaştırılmış yapay zeka çıktılarında yapay zeka kullanımını %98,83 oranında tespit etmektedir.
Tespitten kaçınmaya yönelik bir başka yaygın saldırgan strateji ise, Blader humanizer gibi “saldırgan komut verme” yöntemidir; bu yöntemde kullanıcı, bir Büyük Dil Modeli’ne (LLM) tipik yazım tarzından sapması talimatını verir. Bu alanda gösterdiğimiz performansı değerlendirmek amacıyla, tekrarlanabilir yanlış negatif sonuçlar elde etmek amacıyla bir yapay zeka ajanıya (Codex GPT 5.6 Sol) 24 saat boyunca Pangram 4 API’sine erişim izni verdik.
GPT 5.6, bu çalışmasında stil taklidi, özlü profesyonel üslup ve insan kaynaklı metinlerle bağlamın önceden yüklenmesi gibi çeşitli stratejileri test etti. Test döneminde, dikte edilen cerrahi patoloji notlarını taklit ederek yalnızca tek bir başarılı atlatma gerçekleştirebildi. Her ne kadar etkileyici olsa da, hem girdinin çıktından daha fazla bağlam içermesi hem de ortaya çıkan metnin, genellikle hedeflediğimiz açık uçlu düz yazı yerine kısa ve öz madde işaretleri şeklinde olması nedeniyle, bu girişimi nihayetinde kapsam dışı kabul ediyoruz.
Yazarlık durumunu belirlemek amacıyla, yapay zeka tarafından üretilen metni, bir LLM’nin açık uçlu bir yazma görevi veya soruya yanıt olarak ürettiği özgün, doğal dilde yazılmış düz yazı olarak tanımlıyoruz. Ayrıca, LLM’nin özgün token’lar katkıda bulunmasını şart koşuyoruz ve modelin insan tarafından yazılmış metni kelimesi kelimesine tekrarladığı durumları hariç tutuyoruz; örneğin, bağlam penceresinden alıntı yapmak, ezberlenmiş içeriği aktarmak veya insan tarafından girilen dizeleri özetlemek gibi durumlar.
Pangram 4’ü, çok çeşitli alanlardan, dillerden ve yapay zeka modellerinden elde edilen hem insan tarafından yazılmış hem de yapay zeka tarafından üretilmiş metinler üzerinde eğittik.
Önceki sürümlerde olduğu gibi, insan tarafından yazılmış tüm eğitim verileri ticari lisans kapsamındadır veya şirketin mülkiyetindedir. Her zamanki gibi, Pangram 4, kullanıcılar tarafından gönderilen veriler, API kullanıcılarına ait müşteri verileri veya izinsiz internet taramaları yoluyla elde edilen veriler kullanılarak eğitilmemiştir.
İnsan veri setimizdeki alanların genel dağılımı aşağıda gösterilmiştir.
İnsan kaynaklı metnin kategorilere göre yaklaşık dağılımı.
Veri setimizin yapay zeka kısmı için, şu anda mevcut olan tüm OpenAI ve Anthropic modelleri de dahil olmak üzere en popüler 75 modeli kullanarak tüm sentetik örnekleri kurum içinde oluşturuyoruz. Sentetik veri setimizi oluştururken amacımız, yapay zeka metinlerindeki konu, dil veya üslup göstergelerini özümsemek yerine, modelin bir metnin nasıl yazıldığını öğrenmesine yardımcı olacak bir bağlam sağlamaktır.
Olağandışı el yazılarında yanlış pozitif sonuçları azaltmak için, aday modeli insan metinlerinden oluşan bir yedek havuz üzerinde çalıştırarak, adayın yapay zeka tarafından üretilmiş olarak yanlış etiketlediği öğeleri tespit ediyoruz. Ardından, yanlış etiketlenen öğelerin sentetik kopyalarını oluşturuyor ve aday modeli birleştirilmiş küme üzerinde yeniden eğitiyoruz. Bu yönteme “sert negatif madenciliği” adını veriyoruz.
Pangram 4, Pangram 3.3’e kıyasla 6 kat daha fazla parametreye sahip, bugüne kadarki en büyük modelimizdir. Pangram 4, önceki versiyonuna kıyasla birkaç önemli mimari değişiklik barındırmaktadır. Ayrıca, seyrek yönlendirme mekanizmasının farklı türdeki girdileri sinir ağının farklı bölümlerine yönlendirdiği ilk “uzmanlar karışımı” modelimizdir. Girdi olasılıklarının geniş yelpazesi nedeniyle, bu tür bir mimarinin yapay zeka tabanlı algılama için son derece uygun olacağına inanıyoruz.
Tahminlerinin doğruluğunu artırmak amacıyla Pangram 4, belirli bir girdi dizisindeki her bir token için üç puan hesaplar; bu puanlar, söz konusu tokenin insan tarafından yazılmış, yapay zeka destekli mi yoksa yapay zeka tarafından üretilmiş mi olduğuna dair tahminine karşılık gelir. Daha uzun belgeler, birbiriyle örtüşen 512 tokenlik pencereler halinde puanlanır; böylece her pencere için, token düzeyindeki puanların toplamının yanı sıra bir pencere düzeyinde puan da elde ederiz. Daha sonra, tek tek token tahminlerinde görülen gereksiz dalgalanmaları önlemek amacıyla tüm puanların ortalaması alınır ve pürüzsüzleştirilir. Bu yöntem, ön işleme aşamasında metni basitçe parçalara ayırmaya dayanan önceki yaklaşımın yerini alır ve yapay zeka ile insan tarafından üretilen içerik arasındaki sınırı kesin olarak belirlememizi sağlar.
Gerçek dünyadaki büyük dil modelleri (LLM) kullanım senaryolarını doğru bir şekilde modellemek amacıyla, Pangram 4’ü insan tarafından yazılmış, yapay zeka tarafından üretilmiş ve yapay zeka destekli metinler üzerinde çeşitli standart ve zorlu test setlerinde değerlendirdik.
Test kümesinin insan kaynaklı kısmı için, Pangram 4, model eğitiminin dışında tutulan, 2022 öncesine ait 2 milyon adet ticari lisanslı belge kümesinde karşılaştırmalı değerlendirmeye tabi tutuldu. Bu karşılaştırmada Pangram 4, %95 güven aralığı (%0,0032 – %0,0050) ile %0,0041 oranında yanlış pozitif sonuç vermiştir. Bu, yaklaşık her 24.000 belgede bir yanlış pozitif sonuç anlamına gelmektedir.
Bu karşılaştırma setini, Chatbot Arena Conversations’tan kullanıcı istemlerini derleyerek oluşturduk; bu istem koleksiyonunu, kullanıcıların büyük dil modellerine (LLM’ler) gönderdiği istemlerin gerçek dünyadaki dağılımını yansıtmak amacıyla seçtik. Ardından, küçük bir dil modeli (Mistral-Small-24B-Instruct-2501) kullanarak, matematik veya kodlama yardımı talep eden istemlerin yanı sıra çoktan seçmeli cevapları da filtreledik; zira bunları kapsam dışı kabul ettik. Filtreleme işleminden sonra, modellerden açık uçlu yanıtlar elde ettiğimiz 20.000 komuttan oluşan kapsamlı bir küme elde ettik. Bu kümedeki her bir komuttan, GPT-5.5, Claude Opus 4.8 ve Gemini 3.1 Pro dahil olmak üzere 26 dil modelinden oluşan kümedeki her bir model için bir yanıt ürettik; böylece toplamda 519.993 adet başarıyla puanlanan örnek elde ettik.
Bu karşılaştırma testinde, Pangram 4, aynı veri kümesinde Pangram 3’ün %1,99’luk yanlış negatif oranı (FNR) ile karşılaştırıldığında, %0,3396’lık bir genel yanlış negatif oranı elde etmiştir.
Pangram 4, öncü dil modellerinin tamamında genel geçerlilik göstermektedir: her model ailesi %0,7’nin altında bir FNR değeriyle tespit edilmektedir ve bir modelin yayınlanma tarihi ile tespit edilebilirliği arasında anlamlı bir korelasyon saptanmamıştır.
| Şirket | Model ailesi | FNR Ailesi |
|---|---|---|
| Düşünen Makineler | Sezgi | 0.190% |
| Antropik | Claude | 0.195% |
| NVIDIA | Nemotron | 0.310% |
| Alibaba Cloud | Qwen | 0.315% |
| OpenAI | GPT | 0.316% |
| Tencent | Hunyuan | 0.330% |
| DeepSeek | V4 | 0.388% |
| Moonshot AI | Kimi | 0.395% |
| Mistral AI | Mistral | 0.400% |
| Gemma | 0.430% | |
| Z.ai | GLM | 0.470% |
| İkizler | 0.498% | |
| Meta | Lama | 0.550% |
| xAI | Grok | 0.605% |
| Genel olarak | 0.3396% |
AI tarafından yapılan küçük düzenlemeleri yanlışlıkla AI kaynaklı olarak işaretleyen bir modelin oranını ifade eden “AI Destekli Yanlış Pozitif Oranı”nı değerlendirmek amacıyla, AI tarafından düzeltilmiş ve son rötuşları yapılmış metinlerden oluşan bir veri kümesi oluşturuyoruz. Tüketiciye yönelik ürünler (Grammarly, Apple Intelligence ve Google Dokümanlar'daki Gemini) ile en yeni büyük dil modelleri (Opus 4.8, Gemini 3.1 ve GPT-5.5) kullanarak ELLIPSE, PELIC ve ICNALE'den alınan öğrenci yazıları üzerinde hafif düzenlemeler uyguluyoruz. Örneğin, bazı metinleri “düzeltmek” için Apple’ın Pages kelime işlemcisine entegre edilmiş Yazma Araçları özelliğini kullandık veya Opus 4.8’e “taslağın insan tarafından yazıldığı anlaşılır şekilde kalmasını sağlarken küçük akademik stil sorunlarını düzelt” talimatını verdik.
Şu anda dünyada türünün en iyisi olduğuna inandığımız bu modeli sizlere sunmaktan büyük heyecan duyuyoruz. Ancak Pangram istatistiksel bir model olduğu için her zaman iyileştirme imkânı vardır; bu nedenle bu model serisi için birkaç hedef belirledik.
Öncelikle, veri sapmasının bir sorun haline gelmeden önce proaktif olarak bu sorunu ele almayı umuyoruz. 2022 öncesine ait bir eğitim kümesinin, standartlarımızın gerektirdiği türden sağlam tahmin modelleri üretmek için ne kadar süreyle yeterli olmaya devam edeceği şu anda bilinmemektedir; bu nedenle, insanlar tarafından hazırlanan eğitim kümesini genişletecek yöntemler bulmak en önemli önceliğimizdir – ancak elbette, eğitimde kullandığımız her organik belge için insan tarafından belirlenen referans değer garantimizden ödün vermeden.
Ardından, Pangram 4’ün tahminlerinin farklı bağlamlarda tutarlılığını sağlamak istiyoruz. Bazen, daha uzun bir metnin bir alt kümesi, tek başına mı yoksa çevreleyen belgeye gömülü mü olduğuna bağlı olarak farklı tahminler alabilir. Bu durum, ek bağlamın modele daha fazla bilgi veya daha güçlü bir sinyal sağladığını yansıtıyor olabilir; ancak daha iyi bir kalibrasyonla bu etkiyi en aza indirebilmeyi umuyoruz.
Son olarak, özellik atıfları, gömülme uzayı ve üretici tanımlama konularındaki anlayışımızı geliştirmek amacıyla yorumlanabilirlik çalışmalarımızı sürdürmek istiyoruz. Bu, en iddialı çalışmalarımızdan biridir ve önümüzdeki aylarda bu alandaki ilerlemelerimizi paylaşmayı sabırsızlıkla bekliyoruz.
Tüm ayrıntılar Pangram 4 model kartında yer almaktadır.

Annamieka, Pangram’da yazar olarak çalışmaktadır.






