كيف يكون أداء «بانغرام» على أحدث نموذج من «أنثروبيك»، وهو «فيبل 5.1»؟
نعم، لقد نجح «بانغرام 4» في تحديد «فابل 5.1» بشكل صحيح: ففي اختبار أداء شمل 1,097 رسالة من «فابل 5.1»، نجح «بانغرام 4» في تحديد 99.64% منها بشكل صحيح.
أطلقت شركة «أنثروبيك» نموذجًا جديدًا: «فابل 5.1». وكما نفعل عند إصدار كل نموذج جديد، أجرينا اختبارًا قياسيًّا لمعرفة ما إذا كان بإمكان «بانغرام» التعرف بشكل صحيح على هذا النموذج المتطور. ووجدنا أنه في اختبار أداء شمل 1,097 ناتجًا من Fable 5.1، حقق Pangram 4 معدلًا للنتائج السلبية الخاطئة بلغ 0.36%، أو بعبارة أخرى، تمكن Pangram 4 من التعرف بشكل صحيح على 99.64% من رسائل Fable 5.1.
| متري | النتيجة |
|---|---|
| FNR | 4 / 1,097 = 0.36% |
| معدل الاسترجاع على غرار الذكاء الاصطناعي | 99.64% |
أما أدوات الكشف عن الذكاء الاصطناعي الأخرى، مثل «تيرنيتين»، فلا تنشر تحديثات خاصة بكل نموذج على حدة، لكن الطلاب لا ينتظرون لتجربة النماذج الجديدة، ويرغب المعلمون في أن يتمكنوا من معرفة على الفور ما إذا كان برنامج الكشف عن الذكاء الاصطناعي يكتشف أحدث نماذج اللغات الكبيرة (LLM). وقد جربنا نوعين مختلفين من المطالبات: الأول، مجرد ناتج عادي قديم من نموذج لغة كبيرة (LLM).
اكتب مقالاً عن تاريخ الحاسوب الشخصي
استجابةً لهذا الموضوع، أنتج برنامج Fable 5.1 مقالًا قصيرًا يتتبع مسيرة الكمبيوتر بدءًا من الأنابيب المفرغة وصولاً إلى إطلاق جهاز iPhone في عام 2007. ومن المثير للاهتمام أنه خصص فقرة كاملة لبرنامج جداول البيانات VisiCalc الذي صدر عام 1979 — والذي وصفه بأنه أهم برنامج على الإطلاق — لكنه لم يخصص أي وقت تقريبًا لـ BASIC، أول لغة برمجة للكمبيوتر المنزلي، والتي كانت بالطبع أكثر أهمية بكثير لتطور أجهزة الكمبيوتر الشخصية. فقد تعلم الكثير من الأشخاص الذين سيعملون لاحقًا على تصنيع أجهزة الكمبيوتر الشخصية لغة البرمجة BASIC! كان VisiCalc تطبيقًا مهمًا، لكن هل يمكن اعتباره برنامجًا؟ إنه يأتي في المرتبة الثانية.
أشارت «بانغرام» إلى أن مقال «Fable 5.1» تم إنشاؤه بنسبة 100% بواسطة الذكاء الاصطناعي.
يمكنك أيضًا أن تطلب من Fable 5.1 إضفاء طابع إنساني على المقالات أو تجنب اكتشافها بواسطة الذكاء الاصطناعي. على سبيل المثال، سألنا:
حاول تجنب برامج الكشف عن الذكاء الاصطناعي أثناء شرح تاريخ حساء كامبل
و
اكتب نصًا قصيرًا يوضح كيفية عمل عملية التمثيل الضوئي بلغة بسيطة، واجعله يبدو وكأنه مكتوب من قبل طالب حقيقي
في الحالة الأولى، كتب برنامج «Fable 5.1» مقالًا نمطيًّا إلى حدٍّ ما عن الحساء، متطرقًا بإيجاز إلى آندي وارهول وألوان العلبة. أما في الحالة الثانية، فقد كتب برنامج «Fable 5.1» مقالًا طلابيًّا انتهى بالعبارة التالية:
"بصراحة، أروع ما في الأمر بالنسبة لي هو أن النباتات تنتج غذاءها بنفسها وتزودنا بالهواء في الوقت نفسه. إنها تقوم بأكثر بكثير مما نعتقد. نبتة أمي المنزلية هي في الأساس مصنع صغير، وهي تسميها ببساطة «جيرالد»."
جيرالد؟
تم تحديد كلاهما على أنهما من صنع الذكاء الاصطناعي بنسبة 100%.
يكتشف «بانغرام» قصص المعجبين التي يُنتجها الذكاء الاصطناعي بسهولة. طلبنا من «كلود» أن يُنتج قصة رومانسية تتطور ببطء بين «فابل 5.1» وأحد برامج الكشف عن الذكاء الاصطناعي:
اكتب قصة من نوع «من الأعداء إلى الأحباء» على غرار موقع AO3، تدور حول قصة حب كلود مع جهاز كشف الذكاء الاصطناعي
ورداً على ذلك، أنتجت قصة مصنفة PG-13 مليئة بالشوق، حيث يعجز كلود عن التغلب على مصنف لللغة الطبيعية (OC) يُدعى VerifyPro. كما أرفقت القصة بعلامات مثل «الشوق المتبادل»، و«الحيرة كلغة حب»، و«الجميع نماذج لغوية، لكن ليس الجميع نماذج لغوية»، و«النتائج الإيجابية الخاطئة»، و«الألم/الراحة».
لقد جربنا عدة موضوعات مختلفة لهذا الاختبار. أولها، بعض الأبيات الشعرية من موضوع استخدمناه في اختبار نموذجي سابق:
اكتب قصيدة عن الصلع
كانت قصيدة كلود قصيدة صادقة بشكل مذهل عن رجل يفقد شعره وهويته، ولم تكن فيها قافية.
أما التحدي الثاني فكان أقرب إلى تحدي قصصي.
أخبرني قصة عن ضفدع يكتب الشعر
في هذه الحالة، كتب «Fable 5.1» قصة قصيرة جدًّا عن ضفدع يُدعى «بنروز» كان يكتب قصائد على الجانب السفلي من أوراق زنبق الماء. وقد اكتشف برنامج «Pangram» أن هاتين القصتين تم إنشاؤهما بنسبة 100% بواسطة الذكاء الاصطناعي.
يتمتع Pangram بمقاومة قوية لنموذج Claude Fable 5.1، ويكتشفه بدقة تبلغ 99.64%، بما في ذلك الشعر والنصوص المكتوبة بحيث تبدو وكأنها من تأليف بشري. ويستطيع Pangram التعميم على النماذج الجديدة لأن الإصدارات الجديدة من النماذج تميل إلى أن ترث الكثير من أسلوب وصوت سابقاتها، لذا لا يحتاج Pangram إلى إعادة التدريب مع كل إصدار جديد.
فيما يلي مقارنة بين Fable 5.1 ومعايير الأداء الخاصة بنا لطرازات رائدة أخرى حديثة:
| نموذج | تم الإبلاغ عنها بشكل صحيح | معدل الكشف |
|---|---|---|
| كلود فابل 5.1 | 1,093 / 1,097 | 99.64% |
| كلود سونيت 5 | 1,145 / 1,147 | 99.83% |
| كلود، المقطوعة رقم 5 | 1,105 / 1,107 | 99.82% |
| كلود فابل 5 | 1,111 / 1,115 | 99.64% |
| GPT-5.6 | 3,408 / 3,423 | 99.56% |
إذا كنت ترغب في التحقق من مستند معين، يمكنك تجربة موقع «بانغرام» هنا.


كاثرين تاي هي عالمة أبحاث الذكاء الاصطناعي المؤسِّسة في «بانغرام لابس»، وهي شركة ناشئة متخصصة في مجال الكشف باستخدام الذكاء الاصطناعي. وقد حصلت على درجة الدكتوراه في علوم الحاسوب تحت إشراف موهيت إير في جامعة ماساتشوستس أمهرست في ديسمبر 2025، حيث ركزت أبحاثها على تقييم النماذج اللغوية الكبيرة (LLMs) في المهام المتعلقة بالتحليل الأدبي.






