Potrebbe cambiare più di quanto pensi...
Cosa succede a un’immagine che si carica su ChatGPT o Gemini per farle apportare piccole modifiche?
L'anno scorso ho fatto una gita al Brooklyn Botanic Garden durante la stagione della fioritura dei ciliegi. Dopo aver scattato la foto qui sotto, ho pensato che sarebbe stata molto più bella con delle anatre nello stagno in fondo all'immagine. Ho chiesto a ChatGPT di modificare la mia foto per aggiungere delle anatre, e poi ho chiesto a Gemini di fare lo stesso.
Immagine originale
Immagine generata da ChatGPT in risposta alla richiesta "Aggiungi delle anatre alla foto".
Immagine generata da Gemini in seguito alla richiesta "Aggiungi delle anatre alla foto".
A prima vista, sia ChatGPT che Gemini hanno fatto un ottimo lavoro nell’aggiungere le anatre senza modificare il resto dell’immagine. Tutti gli alberi sembrano gli stessi, le persone sono ancora lì. A parte le modifiche localizzate, questa è pur sempre la foto che ho scattato io, giusto?
Diamo un'occhiata più da vicino per verificarlo. Le aree che non fanno parte dello stagno dovrebbero risultare esattamente identiche se si trattasse di una modifica davvero localizzata. Ingrandendo alcune parti dell'immagine possiamo confrontare la foto originale con quelle modificate.
Figura 1. Le persone sulla sinistra dell'immagine. Ingrandendo il volto dell'uomo, si notano evidenti differenze tra l'immagine originale e quella modificata.
Ci sono differenze molto evidenti tra queste foto! Sebbene l'aspetto generale dei capelli, il colore della pelle e la posa di questa persona siano rimasti gli stessi, i tratti del viso sono cambiati radicalmente. La persona raffigurata nelle immagini modificate non esiste nella realtà.
Vediamo qualche altro esempio:
Figura 2. Un altro gruppo al di fuori dell'area da modificare. Confronta i volti, gli occhiali da sole e i capelli.
Figura 3. L'uomo vicino al centro-destra. Il colletto della camicia e i tratti del viso non sono gli stessi nelle diverse foto.
Figura 4. Le persone sulla destra. Gli occhiali da sole e persino l’inclinazione della testa sono cambiati. Avevamo chiesto di apportare modifiche solo alla zona dello stagno nella foto.
Questo non modifica solo le persone, ma anche il resto dell’immagine. Le aree con texture marcata possono risultare sfocate o sbiadite. Piccoli dettagli che passano facilmente inosservati risultano alterati o mancanti. L’intera immagine è stata modificata e, nella maggior parte dei casi, l’utente non se ne rende conto.
Figura 5. L'edificio sullo sfondo. La sua cupola è ancora riconoscibile, mentre i rami che attraversano la facciata sono diversi.
Figura 6. Gli alberi in fiore. I rami sottili e la trama dei fiori costituiscono un altro esempio di modifiche che esulano dalla richiesta di modifica.
I modelli generativi di immagini tendono ad apportare modifiche non direttamente ai pixel, ma in uno spazio latente compresso. Di seguito viene illustrato un modo molto semplificato per spiegare questo concetto. L’immagine a piena risoluzione scattata con il telefono viene elaborata da un codificatore che la comprime, perdendo così alcune informazioni sui dettagli più fini. Il modello riceve quindi l’istruzione di apportare modifiche in questo spazio latente compresso. Nella fase di decodifica, ricostruisce l’immagine con le modifiche apportate. Tuttavia, poiché ha perso alcuni dei dettagli più fini, il modello cerca di indovinare quali fossero quei dettagli originali, creando differenze piccole ma percettibili.
Figura 7. Un flusso di lavoro semplificato per l'editing nello spazio latente. Nota: si tratta di un flusso di lavoro rappresentativo del funzionamento di alcuni modelli di editing delle immagini, non di dettagli interni verificati di ChatGPT o Gemini.
Queste differenze sono riconosciute anche dalle aziende stesse. OpenAI ammette che ChatGPT potrebbe apportare modifiche oltre i limiti indicati nelle istruzioni, e la documentazione relativa alla sua API spiega che una “maschera di modifica” fornisce indicazioni senza garantire un confine preciso.[1][2] La guida di Gemini descrive la possibilità di effettuare modifiche localizzate tramite prompt e raccomanda di specificare i dettagli importanti per evitare che vengano modificati.[3]
Se stai modificando un'immagine con strumenti come ChatGPT o Gemini, ricordati di controllare attentamente le parti che non hai chiesto di modificare. Alcune modifiche indesiderate potrebbero sfuggire a una rapida occhiata. Le immagini che hai realizzato a mano e poi modificato con questi strumenti potrebbero subire alterazioni proprio nei dettagli su cui hai dedicato tanto impegno in fase di creazione. Gli strumenti di rilevamento dell'IA potrebbero contrassegnare l'intera immagine come generata dall'IA (visto che ora, tecnicamente, lo è!) anche se la tua intenzione era quella di apportare solo piccole modifiche.
Se la conservazione fedele dell’immagine è importante, conserva l’originale e utilizza un flusso di lavoro che copi esplicitamente i pixel senza modificarli. Un’opzione consiste nel selezionare l’area generata, ritagliarla manualmente e incollarla nuovamente sull’immagine di partenza. Alcuni software consentono di selezionare solo determinate sezioni e modificano esclusivamente i pixel presenti in quell’area. La modifica conversazionale è comoda, ma è importante tenere presente che potrebbe rendere l’immagine più “artificiale” di quanto inizialmente previsto.
Vuoi verificare dove viene rilevata l'IA in un'immagine? Prova il nostro strumento:
Anteprima della ricerca sulle immagini Pangram
Come sono stati elaborati i confronti
L'immagine originale era di 2048 × 1542 e Gemini ha prodotto la stessa risoluzione; l'output di ChatGPT era di 1445 × 1088. Per un confronto visivo equo, sia l'immagine originale che quella di Gemini sono state ridimensionate alla risoluzione di ChatGPT utilizzando il ricampionamento di Lanczos. Gemini ha spostato i contenuti dell'immagine in modo da riportarla in corrispondenza con l'originale, per poter confrontare le differenze ingrandite. Gli ingrandimenti utilizzano il ridimensionamento "nearest-neighbor".
Fonti

Isaac è un ingegnere ricercatore che si occupa di rilevamento di immagini e video tramite intelligenza artificiale presso Pangram. Recentemente ha lavorato al rilevamento 2D e 3D presso il Samsung AI Center di New York e ha conseguito un master in robotica presso l’Università del Minnesota.






