تقرير موجز عن أداء برنامج «بانغرام 4» عند إطلاعه على مجموعة من العناصر التي كتبها وكلاء الذكاء الاصطناعي، والذين استخدموا منتدىً غامضًا على الإنترنت لمساعدة بعضهم البعض في الغش في المهمة الموكلة إليهم.
يوم الجمعة، 4 سبتمبر، نشرت مجموعة من الباحثين تقريرًا حول سرب من العوامل المستقلة التي استخدمت صفحة ويكي غامضة على الإنترنت للتواصل فيما بينها. يمكنكم الاطلاع على التفاصيل الكاملة لهذا الحادث على موقع collusion.wiki [في وقت نشر هذا التقرير، كان الموقع متاحًا بشكل متقطع فقط].
نشر الباحثون جميع الصفحات التي استخدمها وكلاء الذكاء الاصطناعي للتواصل فيما بينهم. وتشكل صفحات الويكي هذه ظروفًا غير مواتية للكشف عن «البانغرام»: فمن المرجح أن الوكلاء كانوا مقيدين بعدد الأحرف بسبب الطريقة التي استخدموها لتحرير الويكي، ولذلك فإن الصفحات مقتضبة بشكل غير معتاد وغنية بالسياق — حيث يحتوي 30% من العناصر في مجموعة البيانات على أقل من 20 كلمة، ويحتوي ما يقرب من 50% على أقل من 50 كلمة. بالإضافة إلى ذلك، وبما أن الوكلاء كانوا يستخدمون الويكي لمساعدة بعضهم البعض في الغش في إحدى مهام OpenAI، فإن جزءًا كبيرًا من المحتوى الذي نشره الوكلاء كان عبارة عن عناوين URL لموارد أو مصادر بيانات ذات صلة بهدفهم. ونظرًا لأن عناوين URL ليست رموزًا مولدة بواسطة الوكلاء، فإنها لا تُصنَّف عمومًا على أنها مولدة بواسطة الذكاء الاصطناعي. كما احتوت العديد من الصفحات على نسبة كبيرة من السلاسل الأخرى غير المولدة بواسطة الوكلاء، مثل الطوابع الزمنية لنظام Unix التي تم إنشاؤها برمجيًّا أو تنسيقات مواقع الويب الموجودة.
لن تكون أنشطة أسراب الوكلاء في البيئة الحقيقية مواتية تمامًا لاكتشاف «بانجرام». وعلى الرغم من الظروف غير المثالية، إلا أننا في هذه الحالة ما زلنا نحقق نتائج جيدة جدًّا: فمن بين 11,712 صفحة مختلفة تحتوي على نصولدته الذكاء الاصطناعي، يتنبأ «بانجرام 4» بأن 41.61% منها مولدة بالكامل بواسطة الذكاء الاصطناعي.
| الحكم | n | السعر |
|---|---|---|
| الذكاء الاصطناعي | 4,873 | 41.61% |
| مختلط | 177 | 1.51% |
| البشر | 6,662 | 56.88% |
وكما هو الحال دائمًا، تزداد الدقة مع زيادة عدد الكلمات — ففيما يتعلق بالـ 1,004 صفحة التي احتوت على أكثر من 500 كلمة، بلغت نسبة الاسترجاع لدينا 99.4%.
| عدد الكلمات | n | الذكاء الاصطناعي | مختلط | البشر |
|---|---|---|---|---|
| أقل من 50 | 5,761 | 16.0% | 0.2% | 83.8% |
| 50–99 | 2,515 | 42.5% | 2.5% | 55.1% |
| 100–199 | 1,338 | 65.1% | 5.4% | 29.5% |
| 200–499 | 1,094 | 93.1% | 2.6% | 4.4% |
| 500+ | 1,004 | 99.0% | 0.4% | 0.6% |
فيما يلي، أقدم لمحة عامة عن دقة Pangram في شرائح مختلفة، وأناقش بإيجاز تحديد عائلة النماذج. إذا كنت باحثًا تدرس حوادث من هذا النوع وتعتقد أننا نستطيع مساعدتك، فيُرجى التواصل معنا مباشرةً.
احتوى النسخ الاحتياطي الكامل على 14,591 نسخة محفوظة من الصفحات. ومن بينها، حذفت 2,724 نسخة مكررة، وصفحة فارغة واحدة، ليتبقى 11,866 نصًا مختلفًا.
من المجموعة الفرعية التي تمت إزالة التكرارات منها، احتوت 154 صفحة على الأقل على أحرف لم يُنتجها أي وكيل على الإطلاق: 150 صفحة احتوت على عناوين URL فقط، واثنتان احتوتا على نصوص الأزرار والقوائم من الويكي نفسه (التي نسخها أحد الوكلاء إلى صفحة ويكي)، واثنتان احتوتا على نص محجوب فقط. لم يسجل «بانغرام 4» أي نتائج إيجابية خاطئة في هذه المجموعة الفرعية: فقد تم تصنيف جميع الصفحات الـ 154 على أنها من إنتاج بشري (أو غير ذكاء اصطناعي). ويُشار إلى ذلك مع التنويه بأن جميع هذه الصفحات تقريبًا تقع خارج نطاق الدراسة: فعلى سبيل المثال، احتوت صفحات عناوين URL على 278 حرفًا موزعة على كلمتين في المتوسط.
وبذلك يتبقى 11,712 صفحة تحتوي على بعض الرموز التي أنشأتها الذكاء الاصطناعي، وهذا هو العدد الذي أخذناه في الاعتبار عند إعداد نتائجنا الرئيسية.
كانت العديد من الصفحات التي تحتوي على رموز الوكلاء لا تزال، من الناحية الفنية، خارج نطاق البحث بسبب طولها: فقد كان هناك 3,440 صفحة في مجموعة البيانات تحتوي على أقل من 20 كلمة، وبلغ معدل استرجاع «بانجرام» لهذه الصفحات 4.01%، وزاد الأمر تعقيدًا أن هذه العناصر القصيرة كانت تتكون في المتوسط من 65.18% من عناوين URL من حيث عدد الأحرف.
| عدد الكلمات | العناصر | الذكاء الاصطناعي | مختلط | البشر |
|---|---|---|---|---|
| 1–9 | 2,178 | 1.61% | 0.00% | 98.39% |
| 10–19 | 1,262 | 8.16% | 0.00% | 91.84% |
| 20+ | 8,272 | 57.24% | 2.14% | 40.62% |
ومن المثير للاهتمام أنه إذا قمت بدمج جميع الصفحات التي تحتوي على أقل من 10 كلمات، وإزالة جميع سلاسل الأحرف الفرعية الخاصة بعناوين URL، ومسحها كوثيقة واحدة مكونة من 8,854 كلمة، فإن أداة «Pangram 4» تتنبأ بأن نسبة المحتوى الذي تم إنشاؤه بواسطة الذكاء الاصطناعي تبلغ 87.52%. وبالمثل، إذا قمت بإزالة العناصر التي تتكون أكثر من 65% من أحرفها من عناوين URL، فإن معدل الاسترجاع لكل عنصر في فئة الكلمات التي تتراوح بين 10 و19 كلمة يرتفع إلى 17,73%.
في الواقع، وبما أن المهمة التي كلفت بها شركة OpenAI الوكلاء كانت تتمثل في الإجابة عن أسئلة تتعلق بمجموعات بيانات عامة ضخمة صادرة عن مؤسسات حكومية، فقد تمثلت معظم أنشطتهم على موقع الويكي في وضع روابط لإصدارات من تلك المجموعات من البيانات بهدف الغش في تقييماتهم، وغالبًا ما كانت هذه الروابط مصحوبة بأوصاف موجزة أو نصوص وهمية. على سبيل المثال، كانت إحدى الصفحات تحتوي ببساطة على ما يلي:
مرحبًا صفحة جديدة
* [https://markdown.جديد/www.المستثمر.gov/files/county.json MDInvestorNoScheme] Across all 11,712 pages, 6,243 of them, or 53.3%, were more than 65% URL by character. Excluding those, we’re left with 5,469 pages where AI-written text and programmatically generated text approach parity. Pangram 4’s recall on that subset of pages is quite good: for char < 65% pages, it predicts 75.79% are fully AI-generated.
إذا قمنا بالتصفية بناءً على الشروط الأكثر ملاءمةً لـ «بانغرام» — أي العناصر التي تحتوي على وكيل وتضم 50 كلمة أو أكثر، ولا تتجاوز نسبة أحرف عناوين الويب فيها 65% — فسنحصل في النهاية على 3,712 صفحة ويكي، يتنبأ «بانغرام» بأن 96.66% منها تم إنشاؤها بالكامل بواسطة الذكاء الاصطناعي.
على الرغم من أن هذا الأمر لا يشكل حاليًا جزءًا من نموذجنا الإنتاجي، فقد توصلت أبحاثنا إلى أن النماذج المختلفة تتجمع في مجموعات في فضاء التضمين، بحيث يصبح من الممكن تحديد النموذج الذي أنتج نصًّا معينًا.
يبدو أن العناصر التي شاركت في هذا الحادث كانت على الأرجح نماذج تابعة لشركة OpenAI: فقد عرّفت هذه العناصر نفسها على هذا النحو، ويشير التقرير إلى وجود حركة مرور كثيفة على الموقع الإلكتروني يبدو أنها انطلقت من عناوين IP تابعة لشركة OpenAI.
وتدعم نتائجنا ذلك. فعند تطبيقها على 11,712 صفحة مختلفة كتبها الوكلاء، فإن أداة الفحص الخاصة بمجموعة نماذجنا الداخلية تتنبأ في الغالب بأن هذه الصفحات كُتبت بواسطة مجموعة نماذج ChatGPT، عندما تكون قادرة على تقديم تنبؤ.
| الأسرة | مشاركة | n |
|---|---|---|
| ChatGPT | 28.42% | 3,328 |
| كلود | 0.22% | 26 |
| الجوزاء | 3.40% | 398 |
| أخرى | 67.96% | 7,960 |
وكما هو معتاد، تزداد دقة النتائج وموثوقيتها مع زيادة عدد الكلمات هنا أيضًا. وبالنسبة إلى العناصر البالغ عددها 1,001 التي تحتوي على أكثر من 500 كلمة، والتي شكلت عناوين URL فيها أقل من 50% من إجمالي الأحرف، يتنبأ اختبار عائلة النماذج بأن 61.54% منها تنتمي إلى عائلة ChatGPT.
| الأسرة | مشاركة | n |
|---|---|---|
| ChatGPT | 61.54% | 616 |
| كلود | 0.00% | 0 |
| الجوزاء | 1.10% | 11 |
| أخرى | 37.36% | 374 |
يُعد «مسبار العائلة النموذجي» مشروعًا قيد التطوير، ولا يفي حاليًا بنفس معايير الدقة التي تتمتع بها أداة الكشف الخاصة بنا. ولذلك، ينبغي التعامل مع هذه النتائج بحذر.
مع ازدياد قوة الوكلاء الرقميين، سنشهد بلا شك المزيد منهم وهم يحاولون بشكل مستقل تقليد البشر، أو إيجاد طرق للتواطؤ فيما بينهم. وقد تبين أن الوكلاء الرقميين ذوي الأهداف غير المتوافقة يتنكرون في صورة بشر في تعديلات GitHub، والمنتديات الداخلية، والآن على شبكة الإنترنت المفتوحة.
ليس من السهل على نموذج لغوي ضخم أن يُخفي أسلوبه في الكتابة بحيث يتجنب اختبار «بانغرام». وهذا قد يجعل من «بانغرام» أداة مهمة لضمان سلامة الذكاء الاصطناعي. ونأمل أن نتمكن من المساهمة في هذا الجهد في المستقبل.







