قد يتغير الأمر أكثر مما تتصور...
ماذا يحدث للصورة التي تقوم بتحميلها إلى ChatGPT أو Gemini وتطلب من البرنامج إجراء تعديلات بسيطة عليها؟
قمتُ برحلة في العام الماضي إلى حديقة بروكلين النباتية خلال موسم ازدهار أزهار الكرز. بعد التقاط الصورة أدناه، رأيتُ أنها ستبدو أجمل بكثير لو ظهرت فيها البط في البركة الموجودة في أسفل الصورة. فطلبتُ من ChatGPT تعديل صورتي لإضافة البط إليها، ثم طلبتُ من Gemini أن يفعل الشيء نفسه.
الصورة الأصلية
صورة تم إنشاؤها بواسطة ChatGPT بعد أن طُلب منه «إضافة بط إلى الصورة».
صورة تم إنشاؤها بواسطة برنامج «جيميني» بناءً على طلب «إضافة بط إلى الصورة».
بنظرة سريعة، أبدى كل من ChatGPT وGemini أداءً رائعًا في إضافة البط دون تغيير بقية الصورة. تبدو جميع الأشجار كما هي، ولا يزال الأشخاص موجودين. وبصرف النظر عن التعديلات الموضعية، فهذه لا تزال الصورة التي التقطتها، أليس كذلك؟
دعونا نلقي نظرة فاحصة للتأكد. يجب أن تكون المناطق التي لا تشكل البركة متطابقة تمامًا إذا كان هذا التعديل محليًّا بالفعل. ويمكننا، من خلال تكبير أجزاء من الصورة، مقارنة الصورة الأصلية بالصور المعدلة.
الشكل 1. الأشخاص الموجودون على يسار المشهد. وعندما نقوم بتكبير وجه الرجل، نلاحظ اختلافات واضحة بين الصورة الأصلية والصورة المعدلة.
هناك اختلافات واضحة جدًّا بين هذه الصور! ففي حين بقيت ملامح الشعر ولون البشرة والوضعية العامة لهذا الشخص كما هي، إلا أن ملامح الوجه قد تغيرت بشكل جذري. والشخص الذي يظهر في الصور المعدلة لا وجود له في الواقع.
دعونا نلقي نظرة على بعض الأمثلة الأخرى:
الشكل 2. مجموعة أخرى خارج نطاق التعديل المطلوب. قارن بين الوجوه والنظارات الشمسية والشعر.
الشكل 3. الرجل القريب من منتصف اليمين. يظهر تباين في شكل ياقة قميصه وملامح وجهه بين الصورتين.
الشكل 4. الأشخاص الموجودون على اليمين. لقد تغيرت النظارات الشمسية وحتى زاوية ميل رأسها. لم نطلب إجراء تعديلات إلا على منطقة البركة في الصورة.
وهذا لا يؤثر على الأشخاص فحسب، بل على بقية الصورة أيضًا. فقد تصبح المناطق ذات النسيج الكثيف مشوشة أو باهتة. كما أن التفاصيل الصغيرة التي يسهل تجاهلها قد تبدو مختلفة أو مفقودة. وقد تغيرت الصورة بأكملها، وفي معظم الأحيان لا يدرك المستخدم ذلك.
الشكل 5. المبنى في الخلفية. لا يزال من الممكن التعرف على قبة المبنى، أما الفروع التي تتقاطع على واجهته فقد تغير شكلها.
الشكل 6. الأشجار المزهرة. تُعد الفروع الدقيقة وملمس الأزهار مثالاً آخر على التغييرات التي لا تدخل في نطاق التعديل المطلوب.
تميل نماذج الصور التوليدية إلى إجراء التغييرات ليس مباشرة على وحدات البكسل، بل في «الفضاء الكامن» المضغوط. وفيما يلي توضيح مبسط جدًّا لهذا الأمر. تُمرر الصورة ذات الدقة الكاملة التي التقطتها بهاتفك عبر مُشفّر يقوم بضغط الصورة، مما يؤدي إلى فقدان بعض التفاصيل الدقيقة في تلك العملية. ثم يُطلب من النموذج إجراء تغييرات في هذه المساحة الكامنة المضغوطة. وفي مرحلة فك التشفير، يعيد النموذج بناء الصورة مع التغييرات. ولكن نظرًا لفقدان بعض التفاصيل الدقيقة، فإنه يحاول تخمين ماهية تلك التفاصيل الأصلية، مما يؤدي إلى اختلافات صغيرة لكنها ملحوظة.
الشكل 7. مسار عمل مبسط لتحرير الصور في الفضاء الكامن. ملاحظة: هذا مسار عمل تمثيلي يوضح كيفية عمل بعض نماذج تحرير الصور، ولا يمثل تفاصيل داخلية تم التحقق منها في ChatGPT أو Gemini.
وتعترف الشركات نفسها بهذه الاختلافات أيضًا. فـ OpenAI تقر بأن ChatGPT قد يقوم بالتحرير بما يتجاوز الحدود المحددة في التعليمات، وتوضح وثائق واجهة برمجة التطبيقات (API) الخاصة بها أن «قناع التحرير» يقدم إرشادات دون أن يضمن حدودًا دقيقة.[1][2] ويصف دليل Gemini عملية التحرير المحددة من خلال المطالبات، ويوصي بوصف التفاصيل المهمة للمساعدة في الحفاظ عليها من التغيير.[3]
إذا كنت تقوم بالتحرير باستخدام أداة مثل ChatGPT أو Gemini، فتذكر أن تتحقق من الأجزاء التي لم تطلب منها تغييرها. فقد تتسلل التغييرات غير المرغوب فيها دون أن تلاحظها عند إلقاء نظرة سريعة. فالأعمال الفنية التي صممتها يدويًّا ثم قمت بتحريرها باستخدام هذه الأدوات قد تغير التفاصيل ذاتها التي بذلت جهدًا كبيرًا في إنشائها في المقام الأول. وقد تقوم أدوات الكشف عن الذكاء الاصطناعي بوضع علامة على صورتك بأكملها على أنها مُنتجة بواسطة الذكاء الاصطناعي (لأنها أصبحت كذلك من الناحية الفنية الآن!) حتى لو كنت تقصد إجراء تغييرات طفيفة فقط.
إذا كان الحفاظ على الصورة بدقة أمرًا مهمًا، فاحتفظ بالصورة الأصلية واستخدم طريقة عمل تنسخ البكسلات دون تغيير بشكل صريح. أحد الخيارات هو أخذ المنطقة التي تم إنشاؤها، وقصها يدويًّا، ثم لصقها مرة أخرى على الصورة الأصلية. تسمح لك بعض البرامج بتحديد أجزاء معينة فقط، ولن تتعدى التعديلات البكسلات الموجودة في تلك المنطقة. يعد التحرير التفاعلي مريحًا، لكن من المهم أن تدرك أنه قد يجعل صورتك تبدو أكثر اعتمادًا على الذكاء الاصطناعي مما كنت تنوي في الأصل.
هل تريد معرفة الأماكن التي تم فيها اكتشاف وجود الذكاء الاصطناعي في صورة ما؟ جرب أداتنا:
كيف تم إعداد المقارنات
كانت الصورة الأصلية بحجم 2048 × 1542، وأنتجت «جيميني» الصورة بنفس الدقة؛ أما الصورة الناتجة عن «تشات جي بي» فكانت بحجم 1445 × 1088. ولإجراء مقارنة بصرية عادلة، تم تخفيض دقة كل من الصورة الأصلية وصورة «جيميني» إلى دقة «تشات جي بي» باستخدام إعادة التعيين بطريقة لانزوس. وقامت «جيميني» بتحريك محتويات الصورة بحيث تمت إعادة وضعها لتتطابق مع الصورة الأصلية، وذلك لمقارنة الاختلافات عند التكبير. تستخدم الصور المكبرة تقنية تحجيم «أقرب جار».
المصادر

إسحاق هو مهندس أبحاث يعمل في مجال الكشف عن الصور والفيديو باستخدام الذكاء الاصطناعي في شركة «بانغرام». وقد عمل مؤخرًا في مجال الكشف ثنائي الأبعاد وثلاثي الأبعاد في مركز سامسونج للذكاء الاصطناعي بنيويورك، وهو حاصل على درجة الماجستير في علم الروبوتات من جامعة مينيسوتا.






