Eğitim sonrası süreç, Büyük Dil Modellerini (LLM) yararlı yardımcılar haline getirir ve bu sayede, bu modellerin yazdıklarını insan metinlerinden farklı, tutarlı ve tespit edilebilir kalıplara indirger.
Bazı kişiler, büyük dil modellerinin (LLM'ler) insan metinlerini taklit edecek şekilde eğitildikleri için yapay zeka tespitinin mümkün olmadığını düşünür, ancak durum böyle değildir. Aslında, büyük dil modelleri insanlardan belirgin bir şekilde farklı bir şekilde yazar ve işte bu da yapay zeka tespitini mümkün kılan unsurdur.
Freddie DeBoer, Substack’teki makalesinde şöyle yazıyor:
"[AI ile yazım] kalıpları nereden geliyor? Bunlar, büyük dil modellerinin (LLM) oluşturulmasında kullanılan eğitim metin derlemelerinde yer alan, insanlar tarafından yazılmış metinlerden geliyor. Her bir LLM metin kalıbı — her bir LLM metin kalıbı — nihayetinde insan metin üretiminin bir ürünüdür. Bir LLM’nin doğası gereği, insan metinlerini insan metinlerine dayalı olarak modellemekten ibarettir."
Bu nedenle, son derece düşük bir yanlış pozitif oranına sahip bir yapay zeka algılayıcısı geliştirmenin mümkün olmadığı sonucuna varıyor; zira her zaman, bir insanın bir büyük dil modelinin (LLM) üreteceği metin dizisini aklına getirip yazma ihtimali bulunmaktadır.
Bunun farklı versiyonlarını sık sık duyarız:
"Büyük dil modelleri (LLM'ler), insan yazımının bir dağılımından örneklem almaktadır; bu nedenle, LLM'lerin eğitim dağılımı insan yazımından oluştuğu için, LLM tarafından üretilen metni tespit edemezsiniz."
"Büyük dil modelleri (LLM'ler) insanlar gibi yazacak şekilde eğitilir; dolayısıyla işlerini doğru yaparlarsa, yapay zeka ile yazılan metinler herhangi bir tespit sistemini alt edecektir."
Bu argümanlar ilk bakışta mantıklı görünse de, modern büyük dil modellerinin (LLM’ler) karmaşık sistemler olduğu gerçeğini göz ardı ediyorlar. Modern LLM’ler, yalnızca insan metin dağılımına uymaktan çok daha fazlasını yapmak üzere eğitilmiştir. Bu blog yazısında, ChatGPT, Claude ve Gemini gibi modern LLM’lerin insan metin dağılımından neden ve hangi noktalarda saptığını ve yazdıklarını tespit edilebilir kılan benzersiz üslup ve seslerini neyin sağladığını ele alacağız.
Özet: Büyük Dil Modelleri (LLM’ler), insan metinlerini taklit etmek üzere eğitildikleri için, ürettikleri metinlerin insan yazısından ayırt edilemez hale geleceğine inanmak cazip gelebilir. Ancak gerçekte, LLM’ler sadece insan metinlerine yaklaşmakla kalmaz: talimatları yerine getiren yararlı yardımcılar olmaları için ek eğitimden geçerler; bu da yazdıklarını, algoritmik olarak tespit edilebilen dar bir seçenekler kümesiyle sınırlar.
Dil modellerinin öyküsü, tamamlama modelleriyle başladı . Bu ilk dil modelleri oldukça basitti: Geniş bir metin veri kümesinden kelimelerin birbirini genellikle nasıl takip ettiğini öğreniyorlardı. Ardından, kullanıcı tamamlama modeline birkaç başlangıç kelimesi girerdi ve model de bunlardan yola çıkarak bir sonraki kelimenin en olası olanını tahmin ederdi.
Bir tamamlama modeli, bir sonraki token üzerinde bir olasılık dağılımını tahmin eder
Görsel kaynağı: AIML.com
Temelinde, bir tamamlama modeli “Derin öğrenme çok” gibi bir başlangıç dizisini veya önekini alır ve ardından sonraki kelimenin ne olabileceğine dair bir olasılık listesi üretir. Bu olasılıklar, çoğunlukla internet verilerinden oluşan çok büyük bir eğitim külliyatındaki tüm tamamlamalar üzerinden toplama yoluyla hesaplanır. Sonuç, tüm insan yazımlarına ilişkin bir olasılık modeliydi; bu model, eğitim veri kümesindeki kelimelerin doğal sıklıkları göz önüne alındığında, sırayla hangi kelimelerin ortaya çıkma olasılığının en yüksek olduğunu tahmin edebiliyordu.
Bu gelişme, ilk dil modellerinin ortaya çıkmasına yol açtı: GPT-1, GPT-2 ve GPT-3. Bu modellere günümüzde “temel modeller” deniyor: İnsan dilindeki ham dağılımları temsil ediyorlar, ancak çıktıları ham ve işlenmemiş durumda; talimatlara uymuyorlar ve sohbet edemiyorlar. Günümüzde, dil modeli geliştirmenin bu ilk aşamasına ön eğitim diyoruz ve bu , bir yapay zeka asistanı veya sohbet robotu oluşturmanın yalnızca ilk aşamasıdır — bundan sonra gerçekleşecek çok daha fazla adım vardır.
Kelimeler üzerindeki ham dağılımdan, bir dil modeliyle bir insan gibi iletişim kurabilme noktasına ne zaman geldik? Bu soruyu yanıtlamak için, dil modellerini asistanlara dönüştürme konusunda ilk büyük atılımın gerçekleştiği Mart 2022’ye geri dönmemiz gerekiyor: OpenAI tarafından piyasaya sürülen InstructGPT.
InstructGPT, bir dil modelinin sadece insan dilini taklit etmekle kalmayıp, kullanıcı tarafından verilen talimatları —ki bunlara günümüzde “prompt” adını veriyoruz— yerine getirmek üzere açıkça eğitildiği ilk örnek oldu.
InstructGPT makalesinde belirtilen eğitim sonrası üç adım: denetimli ince ayar, ödül modeli eğitimi ve pekiştirmeli öğrenme
İşte InstructGPT’nin orijinal makalesinden bir şekil. Orijinal makale, “eğitim sonrası” olarak adlandırılan bir tekniği uygulayarak bir temel modeli — bu örnekte GPT-3’ü — yararlı ve talimatları yerine getiren bir asistan haline getirebileceğinizi göstermiştir; bu süreçte modelin üslubu, belirli bir kişiliğe bürünmesi için değiştirilir.
Bu makale üç adımı açıklamaktadır:
Bu, psikolojideki Pavlov koşullanmasına benziyor! Araştırmacılar, modelin bazı çıktılarını ödüllendirirken diğerlerini ödüllendirmiyorlar; tekrarlama yoluyla model, daha önce tarafsız olan bir şeyi —yani insanın tercih ettiği bir çıktı tepkisini— ödül fonksiyonundaki olumlu bir değerle ilişkilendirmeyi öğreniyor. Bu tekniğe “talimat ayarlama” denir ve bu teknik , modeli bir temel modelden, sohbet edebilen ve kullanıcı talimatlarını takip edebilen bir “talimat modeli”ne dönüştüren unsurdur.
Talimat ayarlaması, dil modellerinin yoldan sapmasını, komut satırındaki önemli bilgileri unutmasını veya mantıksız yönlere sapmasını önler. Ayrıca OpenAI ve Anthropic gibi geliştiricilere modellerinin davranışları üzerinde kontrol sağlar. Örneğin, modeller, kullanıcının istediği yanıt bu olsa bile, bir kullanıcıya bomba yapmayı veya banka soymayı anlatmayı reddetmelidir. Eğitim sonrası süreçler olmasaydı, model uyumu, yani büyük dil modellerini yararlı, zararsız ve güvenli hale getirme yeteneği mümkün olmazdı. Anthropic, “Constitutional AI” başlıklı makalesiyle bu tür model davranış spesifikasyonunun öncülerinden biri olmuştur. Bu makalede, Anthropic’in anayasasında belirtilen bir dizi ilkeye uyan bir yapay zeka oluşturmak için eğitim sonrası teknikleri nasıl kullandıkları anlatılmaktadır. Son olarak, teorik olarak talimat ayarlaması, modellerle konuşmayı daha keyifli hale getirir. İnsan değerlendiriciler, hoş yanıtlar verdiği için modeli ödüllendirdikçe, model daha dostane hale gelir ve daha iyi bir kişilik geliştirir.
Eğitim sonrası süreçte her şey yolunda gitmiyor. Çıktıların yeniden şekillendirilmesi, modelin davranışını ciddi şekilde etkiliyor ve modelin ürettiği çıktıları orijinal temel modelinkinden çok farklı hale getiriyor.
Bir LLM’yi insan tercihlerine göre optimize etmek, LLM’nin doğruluktan ziyade insanları memnun etmeyi önceliklendirmesine neden olabilir. Bu durum aşırıya kaçarsa, LLM kullanıcının yanlış inançlarını çürütmek yerine pekiştirecektir. Nisan 2025’te, OpenAI’nin GPT-4o’nun yeni sürümünün, kullanıcılara zarar verecek derecede aşırı iltifatkar ve uyumlu olduğunu itiraf etmesiyle, bu tür dalkavukça model davranışları konusunda büyük bir tartışma yaşandı.
Eğitim sonrası süreç, LLM yanıtlarının daha az yaratıcı ve özgün olmasına da yol açmaktadır. Bazı araştırmacılar, eğitim sonrası sürecin LLM metinlerinin düz, taklitçi, tekdüze ya da yapay zeka ürünü gibi görünmesine neden olduğu hipotezini ortaya koymaktadır.
2024 yılında yayınlanan “Creativity has Left the Chat” başlıklı makale, Meta’nın yapay zeka modeli Llama 2’nin “instruct” ve “base” sürümlerinin çeşitliliğini karşılaştırmaktadır. Araştırmacılar, Llama 2’nin “instruct” modelinin çıktılarında anlamsal ve üslup açısından önemli ölçüde daha az çeşitlilik sergilediğini tespit etmişlerdir; örneğin, hikâyelerde karakter seçerken Llama 2 “instruct” modeli tutarlı bir şekilde aynı yaş, milliyet ve kişilik tiplerine sahip karakterleri seçmiş ve hatta onlara aynı isimleri vermiştir. Aşağıda, temel ve "instruct" modellerinin seçtiği isimlerin kelime bulutu yer almaktadır.
"Creativity Has Left the Chat" adlı makaleden, temel model ile hizalanmış modeller tarafından oluşturulan isimlere ait kelime bulutları
Bu bağlamda, eğitim sonrası süreç, sözde “düzleştirilmiş logitler”e yol açar; bu durumda, eğitim sonrası aşamadan geçen büyük dil modelleri (LLM’ler), olası sonraki kelimelerin çeşitlilik gösteren bir dağılımını üretmek yerine, deterministik bir şekilde tek bir sonraki kelimeyi seçerler.
İlk bakışta bu kulağa kötü gelmese de, bu durum “mod çöküşü” olarak adlandırılan bir duruma yol açar; bu çöküş, büyük dil modellerinin (LLM’ler) zengin ve çeşitli ifadeler üretmeyi bırakıp, bunun yerine aynı sınırlı seçenekleri tekrar tekrar kullanmaya başladıkları zaman ortaya çıkar.
Modun daralması ve mod kapsama alanı: Daralmış bir model, olasılığı tek bir modda yoğunlaştırır
İşte mod çöküşünün görsel bir örneği: Bir şeyi ifade etmenin genel olarak üç yaygın yolu olduğunda, mod çöküşü yaşayan bir LLM, olasılığını tüm ifade biçimlerine dağıtmak yerine, varsayılan olarak en yaygın ifade biçimini tercih eder.
LLM’lerin bu şekilde eğitilmiş olması, algılama açısından bazı sonuçlar doğurmaktadır. LLM’ler belirli insan tercihlerine göre optimize edildiğinden, çok belirgin kişilikler sergileme eğilimindedirler. Bu kişiliklerin, bir algılama modelinin insan yazısından ayırt edebileceği tuhaflıkları, tikleri ve kendine özgü özellikleri vardır. Düzleştirilmiş logitler ve mod çöküşü, aynı zamanda hizalanmış LLM'lerin metin üretirken çok tutarlı seçimler yapma eğiliminde oldukları anlamına gelir; bu da, büyük miktarda insan ve yapay zeka verisine bakarak bu seçimlerin neler olduğunu öğrenebileceğimiz anlamına gelir.
Buna ek olarak, günümüzde geliştirilen büyük dil modelleri (LLM’ler), sade ve basit bir şekilde internetteki metinlerin giderek daha da kalitesizleşmesi nedeniyle, eğitim süreçleri boyunca kendi çıktılarından beslenmeye başlıyorlar. Örneğin, 2024 yılının sonlarında, yeni İnternet makalelerinin üçte birinden fazlası yapay zeka tarafından üretiliyordu; bu kadar çok yapay zeka kaynaklı metin, yeni modellerin, o metni üreten eski modellerin kişiliklerini benimsemesine yol açan bir amplifikasyon etkisine neden oluyor; bu durum, model aileleri arasında bile geçerli. İşte bu nedenle, tamamen farklı laboratuvarlar tarafından geliştirilmiş olsalar bile birçok büyük dil modeli (LLM), orijinal ChatGPT ile stil açısından benzerlikler sergiliyor! Bazen bu, kasıtlı olarak bile yapılıyor: Çinli laboratuvarların, Claude gibi öncü Amerikan modellerinin çıktıları üzerinde eğitim yaparak bu modellerden bir nevi “özü çıkarmaya” çalıştığına dair yaygın spekülasyonlar var. Bu da söz konusu dil modellerine Claude benzeri bir kişilik kazandırıyor!
Mod çöküşünü anlamak ve çözmek, yapay zeka araştırmalarının halen devam eden ve aktif bir alanıdır. Büyük dil modelleri (LLM’ler) bir gün daha çeşitli çıktı dağılımları üretebilecek mi? Benim görüşüm evet, hatta halihazırda oldukça çeşitli olan bazı dil modelleri bile var: Aslında, bunlar temel modeller şeklinde zaten elimizde mevcut!
Ancak, “eğitim sonrası” paradigması ortadan kalkmayacak. Büyük dil modellerinin (LLM’ler) tutarlı seçimler yapmasının ve belirli tercihlere sahip olmasının nedenleri, geliştiricilerinin tercihlerini yansıtıyor. Bir Çin dil modeline 1989’da Tiananmen Meydanı’nda neler olduğunu sorarsanız, o geliştiricinin tercihlerini hemen fark edebilirsiniz! Gerçek şu ki, sonradan eğitim olmadan, yardımcı ve zararsız davranan, güvenli ve uyumlu dil modellerine sahip olamayız. Sonuçta, LLM şirketleri davranışsal gereklilikleri olan tüketici ürünleri geliştiriyorlar: insan metin alanının bazı bölümleri (zehirli içerik, yanlış bilgi vb.) var ki, LLM şirketleri modellerinin bu alanlardan örnek almasını istemiyorlar. Son olarak, LLM şirketleri modellerini hoş kişiliklere sahip olacak şekilde optimize etmek de isterler — insanlar modelleriyle etkileşim kurarken ne kadar çok eğlenirlerse, belirli bir modeli kullanma ve rakip modelleri kullanmama olasılıkları o kadar artar. Bunun nasıl ortaya çıktığını, bazı GPT-4o hayranlarının OpenAI’nin bu modeli üretimden kaldırmasına nasıl tepki verdiklerinden görebilirsiniz.
Bu geliştirici ve insan tercihleri, nihayetinde modellerde, uyum, davranış şekillendirme ve kişilik optimizasyonu karşılığında bu büyük dil modellerinin (LLM’lerin) kişilik ve çıktı alanını daraltma şeklinde ortaya çıkmaktadır. Dolayısıyla, bu model geliştiricileri model davranışına ilişkin belirli tercih ve seçimlerde bulunmaya devam ettikleri sürece, Pangram’ın bu tür tercihleri tutarlı bir şekilde tespit edebilmesi gerektiğini düşünüyorum.

Bradley, bir yapay zeka araştırmacısı ve endüstride derin öğrenme ürünleri geliştirme konusunda uzman bir isimdir. Son olarak, üretken yapay zeka ile ilaç keşfi yapan Absci şirketinde derin öğrenme araştırma grubuna liderlik etmiş ve daha önce Tesla Autopilot’un temel bilgisayar görme ekibinin bir üyesi olarak görev yapmıştır.






