لقد أطلقنا أحدث طراز لدينا حتى الآن: Pangram 4! اقرأ المزيد عنه هنا.

تحديثات المنتجات

تقديم ميزة «الكشف عن الصور في الجمل الكاملة» (نسخة تجريبية للأبحاث)

يسعدنا أن نعلن عن إصدار نسخة تجريبية بحثية لإضافة جديدة تمامًا إلى عائلة نماذج Pangram: Pangram Image.

يُعد «Pangram Image» نموذجًا للكشف عن الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي. وهو يكتشف الصور الناتجة عن جميع مزودي الصور الرئيسيين الذين يعتمدون على الذكاء الاصطناعي، بما في ذلك «GPT Image» من OpenAI، و«Nano Banana» من Gemini، و«Midjourney»، و«FLUX»، و«Grok Imagine»، بالإضافة إلى بعض مزودي مقاطع الفيديو التي تعتمد على الذكاء الاصطناعي، مثل «Kling» و«Seedance» و«Veo» و«Wan».

يتفوق نظام «بانغرام إيميج» (Pangram Image) بفارق كبير على أداء أحدث الأساليب الأكاديمية والتجارية للكشف عن الصور باستخدام الذكاء الاصطناعي. في اختبار مقارنة داخلي شمل 5 أجهزة كشف تجارية، حققت Pangram Image دقة بلغت 99.5٪، مقارنة بأقرب منافس لها الذي سجل 98٪. وفي اختبارات المقارنة الخارجية، مثل تحدي NTIRE 2026 للذكاء الاصطناعي في مجال الصور، وSynthbuster، وMirage، تحقق Pangram Image باستمرار معدل AUROC يزيد عن 99٪ وتتفوق على المنافسين بعدة نقاط مئوية.

نحن ندرك أن الاتهامات الكاذبة التي توجهها الذكاء الاصطناعي إلى الأعمال الفنية الأصيلة، من وجهة نظر الفنانين والمبدعين، تسبب ضررًا جسيمًا، ولذلك حرصنا بشكل خاص على منع حدوث ذلك مع نموذجنا. على مجموعة فرعية مكونة من 2,000 صورة في WikiArt، قمنا بتصنيف كل صورة بدقة على أنها من صنع الإنسان. أما على ReLAION، وهي مجموعة بيانات متنوعة من الصور التي تعود إلى ما قبل عام 2022 من الإنترنت، بما في ذلك الصور الفوتوغرافية والرسومات على الويب والصور المولدة بالحاسوب (CGI) وغيرها، فقد أظهر Pangram Image معدل إيجابية كاذبة بنسبة 0.16%، أي ما يقارب 1 من كل 625.

وكما هو الحال مع نموذج النص الرائد لدينا، فإننا ننشر منهجيتنا بشكل مفتوح ونتفاعل مع الأوساط البحثية. يتوفر «Pangram Image» في لوحة التحكم على الويب لجميع مستخدمي Pangram، سواء المجانيين أو المدفوعين، وسيتوفر قريبًا في ملحق Chrome الخاص بنا وفي غيره من التطبيقات المدمجة.

ورغم أننا فخورون للغاية بهذا النموذج، إلا أنه لا يمثل الشكل النهائي لـ «Pangram Image»، وسنواصل تطوير النموذج وزيادة دقته خلال الأسابيع المقبلة. نعتقد أننا أحرزنا بالفعل تقدماً كبيراً، ونحن متحمسون لمشاركة هذا النموذج الأولي مع الجمهور. وخلال مرحلة العرض التمهيدي للبحث، سيكون الوصول إلى واجهة برمجة تطبيقات «Pangram Image» متاحاً بدعوة فقط. يرجى التواصل معنا إذا كنت مهتمًا بالشراكة معنا في ظل سعينا المستمر لتطوير هذا النموذج بسرعة.

لماذا الآن؟

أصبحت الصور التي يُنتجها الذكاء الاصطناعي واقعية بشكل لا يُصدق. في الماضي، كان بإمكانك عد الأصابع أو البحث عن أخطاء في النص كدليل على أن الصورة من إنتاج الذكاء الاصطناعي. أما اليوم، فإن الصور التي يُنتجها الذكاء الاصطناعي تتبع التعليمات وأصبحت أكثر واقعية من أي وقت مضى.

بالإضافة إلى ذلك، أصبح من الشائع بشكل متزايد العثور على صور تم إنشاؤها بواسطة الذكاء الاصطناعي. على الإنترنت، يمكنك العثور على صور من هذا النوع في كل مكان، بدءًا من مقاطع «Fruit Love Island» على تيك توك وصولاً إلى مقاطع الفيديو المتعلقة بالحرب في إيران التي تم إنشاؤها بواسطة الذكاء الاصطناعي. نسمع قصصًا عن أشخاص يستخدمون الذكاء الاصطناعي لإضافة حشرات إلى صورة لوعاء طعامهم للحصول على استرداد أموالهم من خدمة التوصيل. بل إننا نرى صورًا من الواضح أنها تم إنشاؤها بواسطة الذكاء الاصطناعي مطبوعة على قوائم الطعام واللافتات.

تمامًا مثل النصوص، ليست جميع حالات استخدام الصور التي تُنتجها الذكاء الاصطناعي ضارة. لكن هناك العديد من السيناريوهات التي نرغب حقًّا في معرفة الحقيقة بشأنها. ففي الأشهر الأخيرة، انتشرت صورة لميتش ماكونيل في المستشفى توقع الناس أنها من إنتاج الذكاء الاصطناعي (لكنها لم تكن كذلك). كما انتشرت على وسائل التواصل الاجتماعي صورًا لزفاف تايلور سويفت تم إنشاؤها بواسطة الذكاء الاصطناعي. بل إن صورةً أنتجها الذكاء الاصطناعي وصلت إلى المرحلة النهائية في مسابقة تصوير فوتوغرافي كبرى.

على عكس النصوص، تُبذل جهود كبيرة لضمان إمكانية تتبع مصدر الصور ومقاطع الفيديو. ومن بين هذه الجهود استخدام بيانات التعريف مثل SynthID وC2PA والعلامات المائية غير المرئية على الصور، والتي تحدد سلسلة المنشأ لكل من الصور الحقيقية والصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي. وللأسف، يمكن تجاوز العلامات المائية بسهولة باستخدام أدوات تعمل على عكس هندستها وإزالة بيانات التعريف. بالإضافة إلى ذلك، في حين أن كل من OpenAI وGoogle تطبقان تقنية SynthID، فإن مزودي الصور الآخرين الذين يستخدمون الذكاء الاصطناعي لا يفعلون ذلك، مما يعني أن الاعتماد على العلامات المائية وحدها لن يسمح أبدًا للمرء بأن يكون واثقًا تمامًا من منشأ صورة تفتقر إلى بيانات التعريف.

قدرات الكشف عن الصور

قمنا بتدريب نموذج الصور الخاص بنا على التعرف على الصور الناتجة عن مجموعة واسعة من أدوات إنشاء الصور بالذكاء الاصطناعي، بما في ذلك GPT Image من OpenAI، وNano Banana من Gemini، وFLUX، وMidjourney، وGrok Imagine. كما يمكن لهذا النموذج التعرف على لقطات الفيديو الناتجة عن أدوات إنشاء الفيديو بالذكاء الاصطناعي، بما في ذلك Kling وSeedance وVeo وWan.

في معظم الحالات، سيقوم نموذجنا بتمييز الصور التي تم تعديلها باستخدام الذكاء الاصطناعي على أنها صور مُنتجة بالكامل بواسطة الذكاء الاصطناعي، وذلك بسبب الطريقة التي تعيد بها أدوات إنشاء الصور الحديثة إنشاء الصورة بأكملها حتى عند إجراء تعديلات طفيفة عليها.

يمكننا أيضًا اكتشاف الصور المختلطة باستخدام ميزة «خريطة الحرارة» الخاصة بنا، والتي توضح لك أجزاء الصورة التي تم تمييزها على أنها من إنتاج الذكاء الاصطناعي. على الصعيد الداخلي، وجدنا هذه الميزة مفيدة لاختبار لقطات الشاشة أو الصور الواقعية التي تتضمن بعض العناصر المُنتجة بالذكاء الاصطناعي ضمن المشهد، ولكنها ليست مُنتجة بالكامل بواسطة الذكاء الاصطناعي. ونعتقد أن مشاركة معلومات «خريطة الحرارة» هذه يمكن أن تساعد المستخدمين على فهم نموذجنا بشكل أفضل، لذا فإننا نعرض «خريطة الحرارة» هذه مباشرةً في لوحة التحكم.

في هذه النسخة التجريبية الأولية من البحث، لا تزال بعض فئات الصور خارج نطاق الدراسة. ولا يمكننا حاليًا معالجة الصور التي تقل أبعادها عن 512 × 512 بكسل، وذلك بسبب انخفاض كمية المعلومات المتاحة لنموذجنا بشكل كبير في هذه الصور الأصغر حجمًا. كما أننا غير قادرين على الكشف بثقة عن الصور المزيفة باستخدام تقنية «ديب فايك» وعمليات تبديل الوجوه، حيث ركزنا في هذا الإصدار الأولي على برامج إنشاء الصور الأكثر شيوعًا بين المستهلكين.

ولأسباب تتعلق بالسلامة، لا يمكننا حاليًا معالجة المحتوى الذي أشارت أنظمة المراقبة لدينا إلى أنه يحتوي على صور غير مناسبة للعرض في مكان العمل (NSFW). وسنتمكن من رفع هذا القيد في المستقبل مع تطوير المزيد من إجراءات الأمان والخروج من مرحلة العرض المسبق للأبحاث.

كيف قمنا ببنائه

العمارة

يعتمد نموذجنا على بنية DINOv3 القياسية في هذا المجال. DINOv3 هو نموذج تمثيل قوي للرؤية الحاسوبية متعدد الأغراض، يعمل على تمثيل الصور كمتجهات، تُعرف أيضًا باسم «التضمينات» أو «السمات»: وهي قوائم من الأرقام التي تشفر جميع العناصر البصرية المهمة في الصورة بتنسيق مضغوط.

تتمتع هذه التضمينات بقوة كافية بحيث تحتوي على جميع المعلومات اللازمة لحل مجموعة متنوعة من مهام الرؤية الحاسوبية، مثل التصنيف، وتقدير العمق، أو التجزئة، بدرجة استثنائية من الدقة. وكانت فرضيتنا هي أنه، نظراً للطبيعة العامة لهذه التضمينات، وقدرتها على فهم الخصائص المحلية والعامة للصور على حد سواء، فإنها ستشكل نقطة انطلاق طبيعية لاكتشاف الصور باستخدام الذكاء الاصطناعي.

يستخرج DINOv3 سمات الصور ذات الاستخدام العام التي تدعم التصنيف، والبحث، والتحليل المكونات الرئيسية (PCA)، والكشف، والتجزئة، وتقدير العمقيستخرج DINOv3 سمات الصور ذات الاستخدام العام التي تدعم التصنيف، والبحث، والتحليل المكونات الرئيسية (PCA)، والكشف، والتجزئة، وتقدير العمق

الصورة مقدمة من: مدونة Meta Research

ما يجعل هذه الميزات قوية للغاية هو التطور الذي حققته سلسلة طويلة من الأبحاث تُعرف باسم «التعلم الذاتي الإشرافي». يتم اكتساب هذه الميزات من خلال نموذج يتعلم الخصائص العامة للصور على مجموعات بيانات واسعة النطاق، بدلاً من ضبطه لمهمة محددة. ويستخدم «DINO» على وجه الخصوص تقنية تُسمى «التقطير الذاتي»، حيث يتعين على شبكة عصبية «تلميذة» أن تطابق ناتج شبكة عصبية «معلمة» عبر وجهات نظر مختلفة وتعديلات متنوعة للصورة. الأنماط والمعرفة بالعالم التي يكتسبها DINO خلال فترة تدريبه تجعله أقوى بكثير مما لو قمنا بتهيئة شبكة عصبية عشوائياً وبدأنا تعلم مهمة الكشف عن الصور بالذكاء الاصطناعي من الصفر.

إلا أننا نجد أن الكشف عن الذكاء الاصطناعي ليس مجرد مهمة عادية في مرحلة لاحقة. فبدلاً من الإجراء المعتاد المتمثل في مجرد تدريب وحدة التصنيف على ميزات DINO الثابتة، نستخدم بدلاً من ذلك «التدريب المستمر» لإجراء ضبط دقيق كامل للهيكل الأساسي جنبًا إلى جنب مع وحدة تصنيف الكشف عن الذكاء الاصطناعي: مما يسمح لميزات DINO بالتطور مع اكتساب نموذجنا فهمًا لكيفية اختلاف الصور البشرية عن صور الذكاء الاصطناعي خلال المرحلة الثانية من التدريب.

بيانات التدريب

تعد جودة البيانات وتنوعها وحجمها عوامل حاسمة لأي نموذج أساسي، ولا يُستثنى من ذلك نموذج «بانغرام إيميج». وقد وجدنا أن التركيبة المحددة للبيانات، سواءً كانت الصور التي التقطها البشر أو تلك التي أنتجها الذكاء الاصطناعي، كان لها التأثير الأكبر على الدقة النهائية للنموذج مقارنةً بأي عامل آخر جربناه.

لقد كتبنا بشكل مستفيض عن نظامنا لتوليد البيانات الاصطناعية الخاص بكاشف النصوص المكتوبة بواسطة الذكاء الاصطناعي، والذي نطلق عليه اسم «الانعكاس الاصطناعي». يعمل نظام «الانعكاس الاصطناعي» على إنشاء أمثلة متنوعة من نصوص الذكاء الاصطناعي من خلال حث نماذج الذكاء الاصطناعي على إنتاج نصوص تبدو مشابهة جدًّا للنصوص البشرية، دون أن تكون مطابقة لها تمامًا. يربط هذا النظام كل مثال من أمثلة الذكاء الاصطناعي بمواضيع وأساليب وأنواع أدبية حقيقية، بالإضافة إلى معلومات محددة، ويمنع النموذج من الإفراط في التكيف مع الاختلافات بين أزواج النصوص البشرية ونصوص الذكاء الاصطناعي التي لا علاقة لها بأسلوب كتابة الذكاء الاصطناعي. في الواقع، فإن مجموعة بيانات الذكاء الاصطناعي المستخدمة لتدريب أداة الكشف عن النصوص هي مجموعة بيانات اصطناعية بحتة: بمعنى أننا نولد جميع البيانات بأنفسنا باستخدام واجهات برمجة تطبيقات نماذج اللغة الكبيرة (LLM).

بالنسبة لـ «Pangram Image»، ما زلنا نستخدم تقنية «الانعكاس الاصطناعي». نستخدم نموذج الرؤية واللغة (VLM) — وهو نموذج لغوي يمكنه أيضًا استيعاب الصور كمدخلات — لتوليد تعليق تفصيلي للغاية لصورة من العالم الحقيقي في البداية. ثم نُدخل هذا التعليق مرة أخرى في نموذج توليد الصور كموجه. وفي بعض الأحيان، تبدو الصور متشابهة بشكل مخيف!

صورة لفريقنا ومرآته الاصطناعية التي تعمل بالذكاء الاصطناعيصورة لفريقنا ومرآته الاصطناعية التي تعمل بالذكاء الاصطناعي

صورة لفريقنا ومرآته الاصطناعية التي تعمل بالذكاء الاصطناعي

كان أحد التحديات التي واجهناها في المراحل المبكرة من تطوير «Pangram Image» هو أن أنواع الصور التي أنتجتها «المرايا الاصطناعية» الخاصة بنا لم تتطابق مع توزيع صور الذكاء الاصطناعي الواقعية التي كان الناس ينشرونها عبر الإنترنت. أدركنا أن تقنية «الانعكاس الاصطناعي» التي نستخدمها لم تكن كافية لمحاكاة التوزيع المعقد لصور الذكاء الاصطناعي التي يمكن العثور عليها عبر الإنترنت «في بيئتها الطبيعية». فعند إنشاء الصور التي يولدها الذكاء الاصطناعي، غالبًا ما يقوم الناس بقصها وتحريرها بطرق يصعب محاكاتها.

كان الحل الذي توصلنا إليه في النهاية هو الاعتماد بشكل أكبر بكثير على صور الذكاء الاصطناعي الواقعية المستمدة من الإنترنت، بالإضافة إلى الصور التي قمنا بإنشائها اصطناعيًا داخليًّا. قمنا ببناء مجموعات البيانات الواقعية الخاصة بنا وفقًا لمبادئ الاستخراج الأخلاقي لضمان احترامنا لعمل المبدعين، وتجنب التقاط البيانات الشخصية عن غير قصد أو البيانات التي لن يوافق المبدعون على استخدامها من قبلنا. بالإضافة إلى ذلك، نقوم بتطبيق تعزيزات قوية خلال عملية التدريب لضمان التقاط الطرق التي يتم بها تشويه الصور وضغطها وتحريرها أثناء مشاركتها عبر الإنترنت.

الصورة الأصلية قبل التجميلالصورة الأصلية قبل التجميل

نفس الصورة بعد التعديل — تم اقتصاصها وتقليص حجمها وضغطهانفس الصورة بعد التعديل — تم اقتصاصها وتقليص حجمها وضغطها

الصورة الأصلية قبل التجميلالصورة الأصلية قبل التجميل

نفس الصورة بعد التعديل — تم اقتصاصها وتقليص حجمها وضغطهانفس الصورة بعد التعديل — تم اقتصاصها وتقليص حجمها وضغطها

الأصلي المُحسَّن

كما نعتمد على نظام جديد، يُعرف بالتدريب المركب، لتقديم خرائط حرارية عالية الجودة تساعد في تفسير الصور المختلطة بين الذكاء الاصطناعي والصور البشرية. في التدريب المركب، نقوم بتركيب صور الذكاء الاصطناعي والصور البشرية لتدريب نموذجنا على فهم السمات المحلية والعامة على حد سواء. وهذا يتيح لنا عرض خرائط حرارية في نموذجنا، وهو ما نجد أنه يعزز ثقة المستخدم بشكل كبير ويسمح بمسح الأجسام الواقعية التي تحتوي على صور من الذكاء الاصطناعي.

يقوم التدريب المركب بدمج صور الذكاء الاصطناعي والصور البشرية بحيث يتعلم النموذج السمات المحلية والعامة على حد سواء، مما ينتج عنه خرائط حرارية قابلة للتفسيريقوم التدريب المركب بدمج صور الذكاء الاصطناعي والصور البشرية بحيث يتعلم النموذج السمات المحلية والعامة على حد سواء، مما ينتج عنه خرائط حرارية قابلة للتفسير

التقييم والاختبار

تعد عمليات التقييم الشاملة عنصراً أساسياً في استراتيجيتنا التي تشمل جميع منتجاتنا. وبالنسبة لـ «Pangram Image»، قمنا بإنشاء عدد كبير من مجموعات التقييم لقياس أدائنا في مجالات متنوعة. ويُعد الحصول على البيانات بطريقة أخلاقية أمراً بالغ الأهمية لمهمتنا وقيمنا كشركة؛ وفي إطار هذا الالتزام، تعاونا مع العديد من الأشخاص داخل «Pangram» وخارجها للحصول على صور تبرع بها أصحابها دعماً لتطوير تقنية الكشف عن الصور باستخدام الذكاء الاصطناعي.

اختبار أداء أجهزة الكشف المتقاطعة

قمنا بإنشاء اختبار مقارنة داخلي يضم 1,130 صورة نموذجية لمقارنة مجموعة متنوعة من أدوات الكشف عن الصور التجارية القائمة على الذكاء الاصطناعي بطريقة فعالة من حيث التكلفة. وقد جمعنا 500 صورة نموذجية لأشخاص معروفين، بما في ذلك 100 صورة من ألبوم الصور الشخصي على هاتف آيفون الخاص بمديرنا التقني برادلي، وذلك لضمان أن بعض الصور المستخدمة في الاختبار لم يسبق لأي من نماذج الكشف عن الصور القائمة على الذكاء الاصطناعي أن شاهدتها من قبل.

ثم طلبنا من كلود إنشاء 100 موجه تعكس حالات استخدام حقيقية لتوليد الصور بالذكاء الاصطناعي، وقمنا بإدخال هذه الموجهات إلى 5 نماذج رائدة لتوليد الصور بالذكاء الاصطناعي: Flux 2 Pro، وBytedance Seedream، وGemini 3.1 Flash Image (Nano Banana)، وGPT Image، وRiverflow v2. وأخيرًا، حصلنا على 30 صورة من موقع Midjourney الإلكتروني (نظرًا لعدم توفر واجهة برمجة تطبيقات (API) لديهم).

نقدم في هذا التقرير نتائجنا على كل من البيانات النظيفة والبيانات المعززة، والتي تتضمن تقليص حجم الصورة إلى 1024×1024، وتحويلها إلى تنسيق JPEG بجودة 50. ويُعد هذا مستوى ضغط أعلى مقارنة بمعظم الصور الواقعية، لذا نرى أنه يوفر مقياسًا جيدًا للجودة في أسوأ السيناريوهات.

نظيف

جهاز الكشفالدقةFPRFNR
صورة بانغرام100.00%0.00%0.00%
SightEngine99.13%0.40%1.32%
تشبه الذكاء الاصطناعي98.35%2.40%0.94%
وينستون AI94.27%10.60%1.13%
الذكاء الاصطناعي أم لا87.67%14.40%10.38%

المعزز

جهاز الكشفالدقةFPRFNR
صورة بانغرام99.03%0.40%1.51%
SightEngine97.57%0.40%4.34%
وينستون AI95.83%3.60%4.72%
تشبه الذكاء الاصطناعي90.68%1.60%16.60%
الذكاء الاصطناعي أم لا84.17%10.20%21.13%

معدل الإيجابية الكاذبة

لفهم أداء نموذج FPR الخاص بنا على نطاق واسع، قمنا بإجراء التقييم على صور تعود إلى ما قبل عام 2022 من مجموعة بيانات ReLAION، المستمدة من Common Crawl، والتي توفر مجموعة متنوعة للغاية من الصور من جميع أنحاء الويب. وقمنا بتحديد الصور التي تعود إلى ما قبل عام 2022 لتجنب تلوث البيانات الناتج عن نماذج توليد الصور.

التقييمالصورالدقة النظيفة / معدل الإبلاغ الخاطئ (FPR)
ReLAION قبل عام 202210,000 شخص99.84% / 0.16%

التعميم على مقاطع الفيديو المتعلقة بالذكاء الاصطناعي

وللتحقق مما إذا كان بإمكاننا أيضًا الكشف عن محتوى الفيديو الذي تم إنشاؤه بواسطة الذكاء الاصطناعي، قمنا أيضًا بإنشاء مجموعة بيانات داخلية تضم مقاطع فيديو تم إنتاجها باستخدام أحدث نماذج إنشاء الفيديو. وقد تم إنشاء هذه المقاطع باستخدام صور حقيقية لأشخاص من مجموعة البيانات الخاصة بنا.

تم تصنيف إطارات الفيديو هذه باستخدام نموذج Gemini VLM. ونقدم في هذا التقرير نتائجنا على 9 نماذج فيديو، وهي: Google Veo 3.1 وVeo3.1 Fast، وWan2.7، وGrok Image Video، وKling Video O1 و3.0 Standard، وSeedance 2.0 و2.0 Fast.

نموذج الفيديوNتم الكشف عن مادة نظيفةالدقة في التنظيفتم الكشف عن Augدقة شهر أغسطس
فيديو «Grok Imagine»27627599.64%27599.64%
Kling 3.0 Pro14013999.29%13797.86%
Kling 3.0 القياسي26025096.15%24594.23%
فيديو كلينغ O112011495.00%10285.00%
Seedance 2.0140140100.00%13898.57%
Seedance 2.0 Fast216216100.00%21398.61%
Veo 3.11009999.00%9393.00%
Veo 3.1 Fast276276100.00%27499.28%
وان 2.7220220100.00%220100.00%
بشكل عام1,7481,72998.91%1,69797.08%

التعميم على صور الذكاء الاصطناعي في وسائل التواصل الاجتماعي في العالم الواقعي

كان حسابنا الجديد @PangramData أحد المصادر التي استندنا إليها في هذه التقييمات. ونود أن نشكر المجتمع على مساعدتنا في فهم الاستخدامات العملية للذكاء الاصطناعي، وعلى تخصيص الوقت لمشاركة هذه النتائج معنا. وبعد تنقية البيانات يدويًّا لإزالة الصور التي كانت إما خارج النطاق أو من الواضح أنها لا تتعلق بالذكاء الاصطناعي، وجدنا أن نموذجنا اختلف مع الصور المرسلة في صورتين فقط من أصل 43 صورة تلقيناها. وتعد هذه مجموعة بيانات مفيدة للغاية بالنسبة لنا، حيث تمنحنا فهمًا عميقًا لأنواع الصور التي يعتقد مستخدمونا أنها نتاج الذكاء الاصطناعي.

حالات الخلاف في النتائج السلبية الكاذبة:

تباين في النتائج السلبية الكاذبة بين نموذجنا والتقديم المقدم من المجتمع العلميتباين في النتائج السلبية الكاذبة بين نموذجنا والتقديم المقدم من المجتمع العلمي

تباين في النتائج السلبية الكاذبة بين نموذجنا والتقديم المقدم من المجتمع العلميتباين في النتائج السلبية الكاذبة بين نموذجنا والتقديم المقدم من المجتمع العلمي

اختبارات الأداء التي تجريها جهات خارجية

بالإضافة إلى مجموعات التقييم الداخلية الخاصة بنا، نقوم أيضًا بمقارنة نتائجنا مع معايير الأداء ذات الصلة الصادرة عن أطراف ثالثة. يحقق نموذج «Pangram Image» أداءً رائدًا مقارنةً بالمنهجيات السابقة. تختلف المقاييس المحددة التي توردها معايير الأداء المختلفة، مثل دقة الماكرو أو mAP أو AUROC، لذا نقوم بحساب هذه المقاييس وفقًا للورقة البحثية المعنية، ونورد أقرب مقارنة وفقًا لما ورد فيها.

معيار مرجعينتيجة البانجرامFPRFNRأفضل نتيجة سابقةأفضل نتيجة سابقة
تقييم الطب الشرعي المجتمعي [1]دقة ماكرو بنسبة 97.29٪؛ mAP بنسبة 99.70٪0.413%6.355%Ours-38489.3٪؛ 98.7٪
Synthbuster + RAISE-1K [2]دقة ماكرو بنسبة 98.49٪؛ mAP بنسبة 99.96٪0.100%2.911%B-Free94.9٪؛ 98.8٪
اختبار ميراج [3]دقة الماكرو للمجال: 99.66٪؛ متوسط الدقة (mAP): 99.995٪0.056%0.618%OmniAID-Mirage88.39٪؛ 96.81٪
AIGenImages2026 [4]دقة بنسبة 99.463٪؛ AUROC بنسبة 99.943٪0.537%0.537%RINE92.13٪؛ 97.75٪
اختبار NTIRE 2026 المفتوح [5]99.999% AUROC0.500%0.000%MICV99.78% AUROC

دراسة حالة على منتدى Reddit r/IsThisAI

يُعد منتدى /r/IsThisAI أحد أفضل المصادر المتاحة لنا لتقييم رأي المجتمع حول ما إذا كانت الصور الواقعية ناتجة عن الذكاء الاصطناعي أم لا. وهذا يجعله دراسة حالة تمثيلية جيدة لتقييم مدى توافق نموذجنا مع تفضيلات البشر، كما يتيح لنا اكتشاف أوجه القصور في نموذجنا. في هذه الدراسة، قمنا بجمع مجموعة من 100 منشور من هذا المنتدى الفرعي. ومن بينها، لم يحظَ 27 منشورًا بإجماع واضح من أعضاء المنتدى، ونتيجةً لذلك تم استبعادها من مجموعة التقييم الخاصة بنا. وقد تم تقييم الإجماع من قبل مُعَلِّم بشري.

من بين الصور الـ73 المتبقية، صوّت المجتمع على أن 48 صورة منها من إنتاج الذكاء الاصطناعي، بينما صوّت على أن الـ25 صورة المتبقية من إنتاج بشري. وقد اتفق نظام «Pangram Image» بشكل صحيح مع قرار موقع Reddit بشأن جميع العينات البشرية الـ25، وبشأن 40 عينة من أصل 45 عينة من إنتاج الذكاء الاصطناعي، حيث صنّفها على أنها من إنتاج الذكاء الاصطناعي. ويتوافق ذلك مع سياستنا الرامية إلى معايرة نماذجنا لتقليل احتمالات حدوث نتائج إيجابية خاطئة إلى أدنى حد ممكن.

ما هي الخطوة التالية لشركة «بانغرام إيميج»؟

ورغم أننا نعتبر هذا النموذج رائعًا، ونشعر بالتفاؤل تجاه المستقبل، فإننا ندرك أن هناك الكثير مما يتعين علينا القيام به. وعلى صعيد الأبحاث، ندرك أنه يمكن تحسين الأداء في الحالات التنافسية، مثل حالات إزالة العلامات المائية أو تعديل الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي بعد إنشائها. بالإضافة إلى ذلك، نخطط لمواصلة خفض معدل الإيجابيات الخاطئة إلى مستوى أقرب إلى ذلك الذي يتمتع به نموذج النصوص لدينا.

على صعيد المنتج، توقعوا رؤية تحسينات مع مرور الوقت. سيتمكن «X bot» قريبًا من الكشف عن الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي، وستتمكن لوحة التحكم من قبول مقاطع الفيديو كمدخلات. وفي النهاية، سنقوم بإدماج «Pangram Image» في ملحق Chrome، بحيث يحصل جميع مستخدمي Pangram على علامات استباقية من الذكاء الاصطناعي على الصور الموجودة في موجزات مواقع التواصل الاجتماعي الخاصة بهم.

المراجع

1: بارك وآخرون، «التحليل الجنائي المجتمعي: استخدام آلاف المولدات لتدريب أجهزة كشف الصور المزيفة»، CVPR 2025. https://huggingface.co/datasets/OwensLab/CommunityForensics-Eval/blob/main/README.md 2: Qin et al., “توسيع نطاق الكشف عن الصور المولدة بالذكاء الاصطناعي باستخدام نماذج أولية مدركة للمولدات,” CVPR 2026، الجدول 1. https://openaccess.thecvf.com/content/CVPR2026/papers/Qin_Scaling_Up_AI-Generated_Image_Detection_with_Generator-Aware_Prototypes_CVPR_2026_paper.pdf 3: Guo وآخرون، «OmniAID: فصل الدلالات والآثار الاصطناعية من أجل الكشف الشامل عن الصور المولدة بالذكاء الاصطناعي في البيئة الطبيعية»، https://arxiv.org/pdf/2511.08423 4: Pantsios وآخرون، «جمع البيانات الآلي في البيئة الطبيعية للكشف المستمر عن الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي»، https://arxiv.org/pdf/2605.02567 5: Gushchin وآخرون، «تحدي NTIRE 2026 حول الكشف القوي عن الصور التي تم إنشاؤها بواسطة الذكاء الاصطناعي في البيئة الطبيعية»، https://arxiv.org/pdf/2604.11487

شكر وتقدير

نود أن نشكر أرتيم فرينك على مساهماته في مجال البحث، وبن غليكنهاوس على الجوانب الهندسية، ولو ليو وفاني بان على التصميم وواجهة المستخدم، وتيانشو تشو على دمج ملحق Chrome.


راشيل ستاجدوهار
راشيل ستاجدوهارباحثة علمية

راشيل ستاجدوهار هي باحثة متدربة في شركة «بانغرام». ومن المقرر أن تتخرج هذا الخريف من جامعة نيو هامبشاير بدرجة في علوم الحاسوب. وفي أوقات فراغها، تحب التصوير الفوتوغرافي بالكاميرا الفيلمية.

المزيد من راشيل ستاجدوهار
برادلي إيمي
برادلي إيميالرئيس التنفيذي للتكنولوجيا، الشريك المؤسس

برادلي باحث في مجال الذكاء الاصطناعي وخبير في تطوير منتجات التعلم العميق في القطاع الصناعي. وقد تولى مؤخرًا قيادة مجموعة أبحاث التعلم العميق في شركة «أبسكي» (Absci)، وهي شركة متخصصة في اكتشاف الأدوية باستخدام الذكاء الاصطناعي التوليدي، وكان قبل ذلك عضوًا في الفريق الأساسي للرؤية الحاسوبية في نظام «تيسلا أوتوبيلوت» (Tesla Autopilot).

المزيد من برادلي إيمي

مقالات ذات صلة

يُظهر «كاشف الذكاء الاصطناعي» من Pangram أداءً قوياً في أكثر من 20 لغة
تحديثات المنتجات

يُظهر «كاشف الذكاء الاصطناعي» من Pangram أداءً قوياً في أكثر من 20 لغة

4 سبتمبر 2024
تُظهر دراسة بحثية أجرتها جهة خارجية أن «بانغرام» هو أقوى أداة للكشف عن الذكاء الاصطناعي
تحديثات المنتجات

تُظهر دراسة بحثية أجرتها جهة خارجية أن «بانغرام» هو أقوى أداة للكشف عن الذكاء الاصطناعي

30 أكتوبر 2024
توسيع النطاق باستخدام LoRA
تحديثات المنتجات

توسيع النطاق باستخدام LoRA

22 مارس 2024
هل تستطيع أدوات الكشف التي تعمل بالذكاء الاصطناعي اكتشاف GPT-4.5؟
تحديثات المنتجات

هل تستطيع أدوات الكشف التي تعمل بالذكاء الاصطناعي اكتشاف GPT-4.5؟

27 فبراير 2025
نقدم لكم Pangram 3.0 المزود بخاصية الكشف عن المساعدة بالذكاء الاصطناعي
تحديثات المنتجات

نقدم لكم Pangram 3.0 المزود بخاصية الكشف عن المساعدة بالذكاء الاصطناعي

11 ديسمبر 2025
بانغرام 3.0: قياس مدى استخدام الذكاء الاصطناعي في تحرير النصوص
تحديثات المنتجات

بانغرام 3.0: قياس مدى استخدام الذكاء الاصطناعي في تحرير النصوص

11 ديسمبر 2025
    تقديم ميزة «الكشف عن الصور» في Pangram (نسخة تجريبية للأبحاث) | Pangram Labs