Es könnte sich mehr ändern, als du denkst...
Was passiert mit einem Bild, das man bei ChatGPT oder Gemini hochlädt und dort geringfügig bearbeiten lässt?
Letztes Jahr habe ich während der Kirschblüte einen Ausflug zum Brooklyn Botanic Garden gemacht. Nachdem ich das untenstehende Foto aufgenommen hatte, dachte ich, es würde viel schöner aussehen, wenn im Teich am unteren Bildrand Enten zu sehen wären. Ich habe ChatGPT gebeten, mein Foto zu bearbeiten und Enten hinzuzufügen, und anschließend habe ich Gemini gebeten, dasselbe zu tun.
Originalbild
Das Bild wurde von ChatGPT generiert, nachdem es die Anweisung „Füge dem Foto Enten hinzu“ erhalten hatte.
Von Gemini generiertes Bild, erstellt mit der Anweisung „Füge dem Foto Enten hinzu“.
Auf den ersten Blick haben sowohl ChatGPT als auch Gemini hervorragende Arbeit geleistet und Enten hinzugefügt, ohne den Rest des Bildes zu verändern. Alle Bäume sehen genauso aus wie zuvor, die Menschen sind immer noch da. Abgesehen von den punktuellen Änderungen ist das doch immer noch das Foto, das ich aufgenommen habe, oder?
Schauen wir uns das einmal genauer an, um sicherzugehen. Die Bereiche, die nicht zum Teich gehören, müssten genau gleich aussehen, wenn es sich um eine wirklich punktuelle Bearbeitung handeln würde. Durch das Vergrößern bestimmter Bildausschnitte können wir das Originalfoto mit den bearbeiteten Versionen vergleichen.
Abbildung 1. Die Personen auf der linken Seite des Bildes. Wenn wir das Gesicht des Mannes vergrößern, erkennen wir deutliche Unterschiede zwischen dem Originalbild und dem bearbeiteten Bild.
Es gibt ganz deutliche Unterschiede zwischen diesen Fotos! Während die allgemeine Haarfarbe, die Hautfarbe und die Pose dieser Person gleich geblieben sind, haben sich die Gesichtszüge dramatisch verändert. Die Person auf den bearbeiteten Bildern existiert in Wirklichkeit gar nicht.
Schauen wir uns noch ein paar weitere Beispiele an:
Abbildung 2. Eine weitere Gruppe außerhalb des gewünschten Bearbeitungsbereichs. Vergleichen Sie die Gesichter, Sonnenbrillen und Frisuren.
Abbildung 3. Der Mann in der Mitte rechts. Der Kragen seines Hemdes und seine Gesichtszüge weichen von Foto zu Foto ab.
Abbildung 4. Die Personen auf der rechten Seite. Die Sonnenbrille und sogar die Neigung ihres Kopfes haben sich verändert. Wir hatten lediglich um Änderungen im Bereich des Teiches auf dem Foto gebeten.
Dadurch werden nicht nur die Personen verändert, sondern auch der Rest des Bildes. Bereiche mit starker Textur können verschwommen oder verblasst wirken. Kleine Details, die leicht übersehen werden, sehen anders aus oder fehlen ganz. Das gesamte Bild hat sich verändert, und meistens ist sich der Nutzer dessen gar nicht bewusst.
Abbildung 5. Das Gebäude im Hintergrund. Seine Kuppel ist noch zu erkennen, die Äste, die sich über die Fassade erstrecken, unterscheiden sich jedoch.
Abbildung 6. Die blühenden Bäume. Die feinen Zweige und die Texturen der Blüten sind ein weiteres Beispiel für Änderungen, die über den gewünschten Bearbeitungsumfang hinausgehen.
Generative Bildmodelle nehmen Änderungen in der Regel nicht direkt an den Pixeln vor, sondern in einem komprimierten Latenzraum. Dies wird im Folgenden auf sehr vereinfachte Weise veranschaulicht. Das Bild in voller Auflösung, das Sie mit Ihrem Smartphone aufgenommen haben, wird durch einen Encoder geleitet, der das Bild komprimiert und dabei feine Detailinformationen verliert. Anschließend wird das Modell angewiesen, Änderungen in diesem komprimierten latenten Raum vorzunehmen. In der Decoder-Phase rekonstruiert es das Bild mit den Änderungen. Da jedoch einige der feinen Details verloren gegangen sind, versucht es zu erraten, wie diese ursprünglichen Details aussahen, was zu kleinen, aber wahrnehmbaren Unterschieden führt.
Abbildung 7. Ein vereinfachter Arbeitsablauf zur Bearbeitung im latenten Raum. Hinweis: Hierbei handelt es sich um einen repräsentativen Arbeitsablauf, der veranschaulicht, wie einige Bildbearbeitungsmodelle funktionieren, und nicht um verifizierte Einblicke in die Interna von ChatGPT oder Gemini.
Diese Unterschiede werden auch von den Unternehmen selbst eingeräumt. OpenAI räumt ein, dass ChatGPT möglicherweise über die vorgegebenen Anweisungen hinaus Bearbeitungen vornimmt, und in der API-Dokumentation wird erläutert, dass eine Bearbeitungsmaske zwar eine Orientierungshilfe darstellt, jedoch keine exakte Abgrenzung garantiert.[1][2] Im Leitfaden von Gemini wird die gezielte Bearbeitung mithilfe von Eingabeaufforderungen beschrieben und empfohlen, wichtige Details zu beschreiben, um zu verhindern, dass diese geändert werden.[3]
Wenn Sie Ihre Bilder mit Programmen wie ChatGPT oder Gemini bearbeiten, denken Sie daran, die Teile zu überprüfen, die Sie nicht ändern lassen wollten. Unerwünschte Änderungen können bei einer oberflächlichen Überprüfung leicht übersehen werden. Bei Kunstwerken, die Sie von Hand erstellt und anschließend mit diesen Tools bearbeitet haben, können genau jene Details verändert werden, in deren Gestaltung Sie ursprünglich so viel Mühe investiert haben. KI-Erkennungstools könnten Ihr gesamtes Bild als KI-generiert kennzeichnen (was es nun technisch gesehen ja auch ist!), obwohl Sie eigentlich nur kleine Änderungen vornehmen wollten.
Wenn es auf die exakte Beibehaltung ankommt, behalten Sie das Original bei und verwenden Sie einen Arbeitsablauf, bei dem unveränderte Pixel explizit kopiert werden. Eine Möglichkeit besteht darin, den generierten Bereich manuell auszuschneiden und wieder in das Quellbild einzufügen. Manche Programme ermöglichen es Ihnen, nur bestimmte Bereiche auszuwählen, sodass nur die Pixel in diesem Bereich bearbeitet werden. Die dialoggesteuerte Bearbeitung ist zwar praktisch, doch sollten Sie sich bewusst sein, dass Ihr Bild dadurch möglicherweise stärker von der KI geprägt wird, als Sie ursprünglich beabsichtigt hatten.
Möchten Sie herausfinden, an welchen Stellen in einem Bild KI erkannt wird? Probieren Sie unser Tool aus:
Vorschau auf die Pangram-Bildrecherche
Wie die Vergleiche erstellt wurden
Das Originalbild hatte eine Auflösung von 2048 × 1542, und Gemini gab dieselbe Auflösung aus; die Ausgabe von ChatGPT betrug 1445 × 1088. Um einen fairen visuellen Vergleich zu ermöglichen, wurden sowohl das Originalbild als auch das von Gemini erstellte Bild mithilfe des Lanczos-Resampling-Verfahrens auf die Auflösung von ChatGPT heruntergerechnet. Gemini verschob den Bildinhalt so, dass er wieder mit dem Original übereinstimmte, um die Unterschiede bei vergrößerter Ansicht vergleichen zu können. Bei den Vergrößerungen wurde die „Nearest-Neighbor“-Skalierung verwendet.
Quellen

Isaac ist Forschungsingenieur bei Pangram und beschäftigt sich mit der Erkennung von Bildern und Videos mithilfe künstlicher Intelligenz. Zuletzt arbeitete er im Samsung AI Center NYC an der 2D- und 3D-Erkennung und hat einen Master-Abschluss in Robotik von der University of Minnesota.






