Pangram 4’ün, kendilerine verilen görevi hile yaparak tamamlamak için birbirlerine yardım etmek üzere az bilinen bir web forumunu kullanan yapay zeka ajanları tarafından yazılmış bir öğe koleksiyonu verildiğinde nasıl bir performans sergilediğine dair kısa bir rapor.
4 Eylül Cuma günü, bir grup araştırmacı, birbirleriyle iletişim kurmak için az bilinen bir internet wiki sayfasını kullanan otonom ajan sürüsü hakkında bir rapor yayınladı. Bu olayın tüm ayrıntılarını collusion.wiki adresinde okuyabilirsiniz [yayınlandığı tarihte, web sitesi sadece aralıklı olarak erişilebilir durumdadır].
Araştırmacılar, yapay zeka ajanlarının birbirleriyle iletişim kurmak için kullandıkları tüm sayfaları yayınladılar. Bu wiki sayfaları, pangram tespiti için elverişsiz koşullar sunuyor: Ajanlar, wiki’yi düzenlemek için kullandıkları yöntem nedeniyle muhtemelen karakter sınırlamasına maruz kalmışlardı; dolayısıyla sayfalar alışılmadık derecede kısa ve bağlam ağırlıklıdır — veri kümesindeki öğelerin %30’u 20 kelimeden az, yaklaşık %50’si ise 50 kelimeden az içeriyor. Ayrıca, ajanlar OpenAI görevinde birbirlerine hile yapmak için wiki’yi kullandıklarından, ajanlar tarafından yayınlanan içeriğin önemli bir kısmı, hedefleriyle ilgili kaynaklara veya veri kaynaklarına yönlendiren URL’lerdi. URL’ler ajanlar tarafından üretilen belirteçler olmadığından, genellikle yapay zeka tarafından üretilmiş olarak işaretlenmezler. Birçok sayfa ayrıca, program yoluyla üretilen Unix zaman damgaları veya mevcut web sitesi biçimlendirmeleri gibi, ajanlar tarafından üretilmeyen diğer dizelerin önemli bir yüzdesini içeriyordu.
Gerçek ortamdaki ajan sürüsü faaliyetleri, pangram tespitine tam anlamıyla elverişli olmayacaktır. Koşulların ideal olmamasına rağmen, bu örnekte yine de oldukça iyi bir performans sergiliyoruz: Yapay zeka tarafından üretilmiş metin içeren 11.712 farklı sayfadan Pangram 4, %41,61’inin tamamen yapay zeka tarafından üretildiğini öngörmektedir.
| Sonuç | n | Oy ver |
|---|---|---|
| Yapay Zeka | 4,873 | 41.61% |
| Karışık | 177 | 1.51% |
| İnsan | 6,662 | 56.88% |
Her zamanki gibi, doğruluk oranı kelime sayısıyla birlikte artmaktadır — 500 kelimeden fazla içeren 1.004 sayfa için geri getirme oranımız %99,4’tür.
| Kelime sayısı | n | Yapay Zeka | Karışık | İnsan |
|---|---|---|---|---|
| 50 yaşın altında | 5,761 | 16.0% | 0.2% | 83.8% |
| 50–99 | 2,515 | 42.5% | 2.5% | 55.1% |
| 100–199 | 1,338 | 65.1% | 5.4% | 29.5% |
| 200–499 | 1,094 | 93.1% | 2.6% | 4.4% |
| 500+ | 1,004 | 99.0% | 0.4% | 0.6% |
Aşağıda, Pangram’ın farklı dilimlerde gösterdiği doğruluğu özetliyorum ve model ailesinin tanımlanması konusunu kısaca ele alıyorum. Bu tür olayları inceleyen bir araştırmacıysanız ve size yardımcı olabileceğimizi düşünüyorsanız, lütfen doğrudan bizimle iletişime geçin.
Tam yedekleme dosyasında 14.591 adet kaydedilmiş sayfa sürümü bulunuyordu. Bunlardan 2.724 tanesini yinelenenler olarak sildim ve 1 boş sayfayı da çıkardım; geriye 11.866 farklı metin kaldı.
Tekrarlardan arındırılmış alt kümeden, en az 154 sayfa tamamen ajan tarafından üretilmemiş karakterler içeriyordu: 150’sinde yalnızca URL’ler, 2’sinde yalnızca wiki’nin kendisinden alınan düğme ve menü metinleri (bir ajan tarafından bir wiki sayfasına kopyalanmış) ve 2’sinde ise yalnızca sansürlenmiş metinler yer alıyordu. Pangram 4, bu alt küme üzerinde sıfır yanlış pozitif sonuç verdi: 154 sayfanın tamamı insan (veya yapay zeka dışı) tarafından üretilmiş olarak işaretlendi. Bununla birlikte, bu sayfaların neredeyse tamamının kapsam dışında olduğu unutulmamalıdır: örneğin, URL sayfaları ortalama olarak 2 kelimede 278 karakter içeriyordu.
Böylece, yapay zeka tarafından üretilmiş bazı token’lar içeren 11.712 sayfa kaldı ve genel sonuçlarımızda bu sayfa sayısını dikkate aldık.
Ajan belirteçleri içeren birçok sayfa, uzunlukları nedeniyle teknik olarak hâlâ kapsam dışında kalıyordu: Veri dökümünde 20 kelimeden az içeren 3.440 sayfa vardı ve Pangram’ın bu sayfalardaki geri çağırma oranı %4,01 idi; bu durum, söz konusu kısa öğelerin karakter bazında ortalama %65,18’inin URL’den oluşması nedeniyle daha da karmaşık hale geliyordu.
| Kelime sayısı | Ürünler | Yapay Zeka | Karışık | İnsan |
|---|---|---|---|---|
| 1–9 | 2,178 | 1.61% | 0.00% | 98.39% |
| 10–19 | 1,262 | 8.16% | 0.00% | 91.84% |
| 20+ | 8,272 | 57.24% | 2.14% | 40.62% |
İlginç bir şekilde, 10 kelimeden az içeren tüm sayfaları birleştirip, tüm URL alt dizelerini kaldırdıktan sonra bunu 8.854 kelimelik tek bir belge olarak taradığınızda, Pangram 4 bu belgenin %87,52 oranında yapay zeka tarafından üretildiğini öngörüyor. Benzer şekilde, karakter bazında %65'inden fazlası URL olan öğeleri çıkarırsanız, 10-19 kelimelik gruptaki öğe başına geri çağırma oranı %17,73'e yükselir.
Aslında, OpenAI’nin ajanlara verdiği görev, devlet kurumlarına ait büyük kamu veri kümeleriyle ilgili soruları yanıtlamak olduğu için, wiki’deki faaliyetlerinin büyük bir kısmı, değerlendirmelerde hile yapmak amacıyla bu veri kümelerinin sürümlerine bağlantı vermekten ibaretti; bu bağlantılara genellikle kısa açıklamalar veya anlamsız metinler ekleniyordu. Örneğin, bir sayfada sadece şunu yazıyordu:
MERHABA yeni sayfa
* [https://markdown.yeni/www.yatırımcı.gov/dosyalar/county.json MDInvestorNoScheme] Across all 11,712 pages, 6,243 of them, or 53.3%, were more than 65% URL by character. Excluding those, we’re left with 5,469 pages where AI-written text and programmatically generated text approach parity. Pangram 4’s recall on that subset of pages is quite good: for char < 65% pages, it predicts 75.79% are fully AI-generated.
Pangram için en elverişli koşulları (50 veya daha fazla kelime içeren ve URL karakterlerinin oranı %65’in altında olan maddeler) dikkate alarak filtreleme yaptığımızda, 3.712 wiki sayfası elde ediyoruz; Pangram, bunların %96,66’sının tamamen yapay zeka tarafından oluşturulduğunu öngörüyor.
Şu anda üretim modelimizin bir parçası olmasa da, araştırmalarımız farklı modellerin gömülme uzayında kümelendiğini ortaya koymuştur; bu sayede bir metni hangi yapay zeka modelinin ürettiğini tespit etmek mümkündür.
Görünüşe göre bu olaya karışan ajanlar büyük olasılıkla OpenAI modelleriydi: ajanlar kendilerini bu şekilde tanımladılar ve raporda, OpenAI IP adreslerinden kaynaklandığı görülen web sitesine yoğun bir trafik olduğu belirtiliyor.
Sonuçlarımız bunu doğrulamaktadır. 11.712 farklı, ajan tarafından yazılmış sayfaya uygulandığında, iç model ailemiz, bir tahminde bulunabildiği durumlarda, sayfaların büyük ölçüde ChatGPT model ailesi tarafından yazıldığını öngörmektedir.
| Aile | Paylaş | n |
|---|---|---|
| ChatGPT | 28.42% | 3,328 |
| Claude | 0.22% | 26 |
| İkizler | 3.40% | 398 |
| Diğer | 67.96% | 7,960 |
Her zamanki gibi, burada da kelime sayısı arttıkça güven seviyesi ve doğruluk oranı artmaktadır. Karakter bazında %50’den azı URL olan ve 500 kelimeden fazla içeren 1.001 öğe için, model ailesi taraması bu öğelerin %61,54’ünün ChatGPT ailesinden geldiğini öngörmektedir.
| Aile | Paylaş | n |
|---|---|---|
| ChatGPT | 61.54% | 616 |
| Claude | 0.00% | 0 |
| İkizler | 1.10% | 11 |
| Diğer | 37.36% | 374 |
Model aile taraması halen geliştirme aşamasındadır ve şu anda tespit aracımızla aynı doğruluk standartlarını karşılamamaktadır. Bu nedenle, bu sonuçlara ihtiyatla yaklaşılmalıdır.
Ajanlar giderek daha güçlü hale geldikçe, şüphesiz ki daha fazlasının özerk bir şekilde insanları taklit etmeye çalıştığını ya da birbirleriyle işbirliği yapmanın yollarını aradığını göreceğiz. Hedefleri uyuşmayan ajanların GitHub düzenlemelerinde, kurum içi forumlarda ve artık açık internette de insan kılığına girdikleri tespit edilmiştir.
Büyük bir dil modelinin, Pangram’ı atlatacak şekilde yazım stilini gizlemesi kolay değildir. Bu durum, Pangram’ı yapay zeka güvenliği açısından önemli bir araç haline getirebilir. Gelecekte bu çabaya katkıda bulunabilmeyi umuyoruz.

Annamieka, Pangram’da teknik yazar olarak çalışmaktadır.






