人工智能教育

经过人工智能编辑后,你的图片还是真实的吗?

它可能带来的变化,或许比你想象的还要大……

2026年9月28日

本地化 AI 编辑

如果你将一张图片上传到ChatGPT或Gemini,并让它们对图片进行微调,会发生什么?

去年樱花季,我去了布鲁克林植物园游玩。拍下下图后,我觉得如果画面底部的池塘里有几只鸭子,这张照片会好看得多。于是,我请ChatGPT帮我修图添加了鸭子,随后又请Gemini做了同样的操作。

原始图片原始图片

该图片由ChatGPT根据“在照片中添加鸭子”的指令生成。该图片由ChatGPT根据“在照片中添加鸭子”的指令生成。

这张图片由Gemini根据“在照片中添加鸭子”的指令生成。这张图片由Gemini根据“在照片中添加鸭子”的指令生成。

乍一看,ChatGPT和Gemini在添加鸭子的同时,没有改变图片的其他部分,表现都很出色。所有的树看起来都一样,人也都还在那里。除了局部修改之外,这仍然是我拍的照片,对吧?

非预期的差异

让我们仔细看看以确认。如果这确实是一次局部编辑,那么池塘以外的区域应该完全一致。放大图像的某些部分,我们可以将原图与编辑后的图片进行对比。

图1. 画面左侧的人群。当我们放大查看该男子的面部时,可以清楚地看到原始图像与编辑后图像之间的差异。图1. 画面左侧的人群。当我们放大查看该男子的面部时,可以清楚地看到原始图像与编辑后图像之间的差异。

这些照片之间的差异非常明显!虽然此人的整体发型、肤色和姿势保持不变,但面部特征却发生了巨大变化。修图后的照片中出现的人物实际上并不存在。

让我们再来看几个例子:

图2. 另一组人,不在请求编辑的范围内。请比较他们的面部、太阳镜和发型。图2. 另一组人,不在请求编辑的范围内。请比较他们的面部、太阳镜和发型。

图3。位于画面右侧中央附近的那名男子。他在不同照片中的衬衫领口和面部特征并不一致。图3。位于画面右侧中央附近的那名男子。他在不同照片中的衬衫领口和面部特征并不一致。

图4。右侧的人物。太阳镜的位置甚至她头部的倾斜角度都发生了变化。我们只要求对照片中的池塘区域进行修图。图4。右侧的人物。太阳镜的位置甚至她头部的倾斜角度都发生了变化。我们只要求对照片中的池塘区域进行修图。

这不仅会改变人物,还会改变图像的其他部分。纹理丰富的区域可能会变得模糊或褪色。那些容易被忽略的细微之处可能会发生变化或消失。整张图像都发生了改变,而大多数时候用户对此并不知情。

图5. 背景中的建筑。其圆顶依然清晰可辨,但横亘在立面上的树枝却有所不同。图5. 背景中的建筑。其圆顶依然清晰可辨,但横亘在立面上的树枝却有所不同。

图6. 开花的树木。细枝和花朵的质感提供了另一个超出编辑要求的变更示例。图6. 开花的树木。细枝和花朵的质感提供了另一个超出编辑要求的变更示例。

为什么会发生这种情况?

生成式图像模型通常不会直接对像素进行修改,而是在压缩的潜空间中进行调整。下图以非常简化的方式展示了这一过程。 你在手机上拍摄的全分辨率图像会被传入编码器,编码器会对图像进行压缩,在此过程中会丢失一些精细的细节信息。随后,系统会向模型发出提示,要求其在该压缩的潜空间中进行修改。在解码阶段,模型会根据这些修改重建图像。但由于丢失了部分精细细节,模型会尝试推测原始细节原本是什么样子的,从而产生细微但可察觉的差异。

图7. 简化的潜空间编辑工作流。注:这是某些图像编辑模型工作原理的示意性工作流,并非经过验证的ChatGPT或Gemini内部机制。图7. 简化的潜空间编辑工作流。注:这是某些图像编辑模型工作原理的示意性工作流,并非经过验证的ChatGPT或Gemini内部机制。

这些差异也得到了相关公司本身的认可。OpenAI承认ChatGPT可能会超出指令范围进行编辑,其API文档中解释道,编辑掩码虽能提供指导,但无法保证精确的边界。[1][2] Gemini的指南描述了通过提示词进行局部编辑的方法,并建议明确说明重要细节,以防止这些细节被修改。[3]

如果你使用的是ChatGPT或Gemini之类的工具进行编辑,请记得仔细检查那些你并未要求它修改的部分。粗略检查时,可能会漏过一些不想要的改动。你亲手创作的艺术作品,如果用这些工具进行编辑,可能会改变你最初费尽心血才完成的那些细节。即使你原本只想做些微小的改动,AI检测工具也可能将你的整张图片标记为AI生成(因为从技术上讲,它现在确实是AI生成的!)。

如果需要精确保留原始图像,请保留原始文件,并采用一种明确复制未被修改像素的工作流程。一种方法是提取生成的区域,手动将其裁剪出来,然后粘贴回源图像上。有些软件允许你仅选择特定区域,并且只会修改该区域内的像素。对话式编辑虽然方便,但需要注意的是,它可能会使你的图像比你最初预期的更具“AI风格”。

想查看图像中检测到了哪些AI元素吗?试试我们的工具:

Pangram 图像研究预览


比较数据的编制方法

原始图像尺寸为 2048 × 1542,Gemini 生成的图像分辨率与之相同;ChatGPT 生成的图像分辨率为 1445 × 1088。为了进行公平的视觉比较,原始图像和 Gemini 生成的图像均通过兰茨(Lanczos)重采样方法下采样至 ChatGPT 的分辨率。Gemini 将图像内容进行了平移,使其位置恢复到与原始图像一致,以便比较放大后的差异。 放大处理采用最近邻缩放算法。

来源

  1. OpenAI,ChatGPT 中的图片
  2. OpenAI,图像生成
  3. 谷歌、Gemini 图像生成

艾萨克·卡萨哈拉
艾萨克·卡萨哈拉计算机视觉创始工程师

艾萨克是Pangram公司的一名研究工程师,主要从事人工智能图像/视频检测方面的工作。他此前曾在三星纽约人工智能中心从事2D和3D检测相关工作,并拥有明尼苏达大学机器人学硕士学位。

更多来自艾萨克·卡萨哈拉的内容