ChatGPTやGeminiに画像をアップロードして、ちょっとした変更を加えてもらうと、その画像はどうなるのでしょうか?
昨年、桜の季節にブルックリン植物園へ出かけてきました。下の写真を撮った後、画像の下の方にある池にアヒルがいたらもっと素敵になるだろうと思いました。そこで、ChatGPTにアヒルを追加するように写真の編集を依頼し、その後、Geminiにも同じことを依頼しました。
元の画像
「写真にアヒルを追加して」とChatGPTに指示して生成された画像。
「写真にアヒルを追加して」という指示に基づき、Geminiが生成した画像。
一見したところ、ChatGPTもGeminiも、画像の他の部分は変えずにアヒルを追加するという点で素晴らしい仕事をしてくれました。木々はすべて同じように見え、人々もそのまま残っています。局所的な編集はありますが、これはやはり私が撮った写真ですよね?
確認のために、さらに詳しく見てみましょう。もしこれが真に部分的な編集であるならば、池以外の部分はまったく同じであるはずです。画像の一部を拡大することで、元の写真と編集後の写真を比較することができます。
図1. シーンの左側にいる人々。男性の顔を拡大すると、元の画像と編集後の画像の間に明らかな違いが見て取れる。
これらの写真には、非常に明らかな違いがあります!この人物の髪や肌の色、ポーズは全体的に同じですが、顔立ちは劇的に変化しています。加工された画像に写っている人物は、実際には存在しません。
さらにいくつかの例を見てみましょう:
図2. 編集依頼の対象外にある別のグループ。顔、サングラス、髪型を比較してみてください。
図3。中央右付近にいる男性。シャツの襟や顔立ちが、写真によって一貫していない。
図4. 右側の人物。サングラスはもちろん、頭の傾きまで変わってしまっています。編集を依頼したのは、写真の池の部分だけだったはずなのに。
これにより、人物だけでなく、画像の他の部分も変化してしまいます。テクスチャの細かい部分は、ぼやけたり色あせたりすることがあります。見落としがちな細かいディテールが、本来とは異なっていたり、欠落していたりすることもあります。画像全体が変化しているにもかかわらず、多くの場合、ユーザーはそのことに気づいていません。
図5. 背景にある建物。ドームは依然として識別できるが、ファサードを横切る枝の様子は異なっている。
図6. 花を咲かせている木々。細い枝や花の質感も、依頼された編集範囲外の変更の例の一つである。
生成型画像モデルは、ピクセルに直接変更を加えるのではなく、圧縮された潜在空間で変更を行う傾向があります。これを非常に簡略化して示した図が以下です。 スマートフォンで撮影したフル解像度の画像は、エンコーダーを通過して圧縮され、その過程で細かいディテール情報が失われます。その後、この圧縮された潜在空間において変更を加えるよう指示されます。デコーダーの段階では、変更を加えた状態で画像が再構成されます。しかし、細かいディテールの情報が一部失われているため、元のディテールがどのようなものであったかを推測することになり、わずかではあるものの目立つ違いが生じます。
図7. 潜在空間編集のワークフロー(簡略化版)。注:これは一部の画像編集モデルの仕組みを示す代表的なワークフローであり、ChatGPTやGeminiの内部構造が検証されたものではありません。
こうした違いは、各企業自身も認めている。OpenAIは、ChatGPTが指示された範囲を超えて編集を行う可能性があることを認め、そのAPIドキュメントでは、編集マスクは指針を提供するものであり、正確な境界を保証するものではないと説明している。[1][2] Geminiのガイドでは、プロンプトを用いた局所的な編集について解説し、重要な詳細を変更されないようにするため、それらを明確に記述することを推奨している。[3]
ChatGPTやGeminiなどのツールを使って編集を行う場合は、変更を依頼していない部分も必ず確認するようにしてください。ざっと目を通しただけでは、意図しない変更が見逃されてしまうことがあります。手作業で作成したアート作品をこれらのツールで編集すると、当初、苦労して作り上げた細部まで変わってしまう可能性があります。たとえわずかな変更しか意図していなかったとしても、AI検出ツールによって画像全体が「AI生成」としてフラグ付けされてしまう可能性があります(技術的には、その通りになってしまうからです!)。
正確な保存が重要な場合は、オリジナル画像を保持し、変更を加えていないピクセルを明示的にコピーするワークフローを採用してください。一つの方法として、生成された領域を手動で切り取り、元の画像に貼り直すという方法があります。一部のソフトウェアでは、特定の領域のみを選択し、その領域内のピクセルのみに変更を加えることが可能です。対話型編集は便利ですが、意図した以上に画像がAI的な仕上がりになってしまう可能性があることに留意することが重要です。
画像のどこにAIが検出されているか確認したいですか?当社のツールをぜひお試しください:
比較資料の作成方法
元の画像は2048×1542ピクセルで、Geminiも同等の解像度で出力しました。一方、ChatGPTの出力は1445×1088ピクセルでした。公平な視覚的比較を行うため、元の画像とGeminiの画像の両方を、ランチョス再サンプリングを用いてChatGPTの解像度にダウンサンプリングしました。また、拡大表示時の違いを比較できるよう、Geminiは画像内の内容を移動させ、元の画像と位置が一致するように調整しました。 拡大表示には、最近傍スケーリングが使用されています。
出典

アイザックは、パングラムでAIによる画像・動画検出の研究に従事する研究エンジニアです。最近では、サムスンAIセンターNYCで2Dおよび3D検出の研究に携わっており、ミネソタ大学でロボット工学の修士号を取得しています。