多人照片是 AI 换脸中最难处理的输入之一。困难不只来自“脸更多”,而是每张脸的尺寸、角度、表情、光照和遮挡程度都可能不同。模型还必须判断哪些检测到的人脸应该应用参考身份。
在当前 faceswap 流程中,你需要上传目标图片,并使用内置人脸参考图或有权使用的自定义参考图。系统没有精确的“第几张脸”选择器。如果你必须控制某一个人,裁剪就是最可靠的目标选择工具。
先明确最终结果要保留什么
编辑前先用一句话描述目标:
- “保留整组人物,但只变换站在中间的人。”
- “只制作左侧人物的近景 meme。”
- “让所有清晰可见的人脸应用同一参考图。”
- “保留两个人,但不要让远处人群参与识别。”
这些是不同任务,单次整图上传不一定能稳定完成所有要求。
如果只需要一个人,就尽量隔离一个人;如果完整群体背景不可缺少,就要接受目标选择和一致性会下降。不要假设模型永远选择最大、最中间或最左侧的人脸。
多人场景为何改变识别结果
人类能立即区分前景人物、远处人脸、镜中倒影、屏幕和海报。模型看到的则是一组可能的人脸图案。
检测结果可能受到以下因素影响:
- 人脸所占像素;
- 清晰度与对比度;
- 脸部可见范围;
- 头部角度;
- 与图片边缘的距离;
- 与他人的重叠;
- 人脸是否出现在屏幕、镜子或海报中;
- AI 服务商内部的预处理方式。
一张较小但正面的背景脸,有时比近处的大侧脸更容易检测。因此,肉眼认为的“明显主角”不一定是系统认为的明显目标。
三类多人照片任务
情况一:只需要一个人,不需要完整群体背景
把图片裁成该人物的头肩照或上半身构图。这种方式控制最强,通常质量也最好。
头发、耳朵和下颌周围要留出一定空间,不要紧贴脸部轮廓裁切。模型需要周围像素来融合边缘并继承场景光线。
情况二:只需要一个人,但必须保留群体背景
这种情况更困难,因为其他不需要变换的人脸仍然可能被检测。
可采用两阶段流程:
- 先制作一张只包含目标人物和必要附近环境的工作裁剪图。
- 在裁剪图上生成并检查换脸结果。
- 如果你拥有相关权利和普通图像编辑能力,再把审核后的结果放回原图副本。
这种方法能控制目标,但最终合成仍需要检查边缘、光线和 AI 标注。不得用它伪造证据或误导观看者。
情况三:需要变换多个人
要预期结果存在差异。同一参考图应用到不同人物时,会受到每张目标脸的几何、角度与光线影响。
对于风格化 meme,这种差异可能可以接受;对于精细作品,建议分别裁剪、处理并逐一审核。一次处理整组人物更快,但对变换对象和融合一致性的控制更弱。
稳定的裁剪流程
第一步:从原始文件开始
如果能获得原图,不要先用截图。截图通常会降低分辨率、加入界面边框并多经历一次压缩。
先复制原始文件,确保随时可以返回。不要反复覆盖唯一的原图。
第二步:找出所有可能被检测的人脸
除了目标人物,还要检查:
- 远处宾客;
- 位于画面边缘的人;
- 手机或显示器中的人脸;
- 镜子与窗户倒影;
- 海报、衣服印花或标牌;
- 被文字或贴纸部分遮住的脸。
只要一张不需要的人脸仍然可辨认,就应假设它可能被检测。
第三步:围绕目标人物制作第一版裁剪
近景应包含完整头部、颈部、肩膀和少量背景;中景可保留上半身和相关物品。
尽量不要裁断:
- 发际线或头顶;
- 下巴或下颌;
- 耳朵;
- 正在接触脸部的手;
- 与下颌边缘重叠的他人肩膀。
裁得太紧虽然能让脸部在画面中变大,却可能损坏边缘信息。目标不是最小的矩形,而是最干净、最有用的上下文。
第四步:裁剪后检查真实像素
裁剪会让脸在屏幕上看起来更大,但不会增加真实细节。请以 100% 缩放检查。如果眼睛和嘴仍然呈现明显像素块,应回到原图并选择其他图片。
好的裁剪应让目标不再含糊,同时保留足够的五官边缘。可以使用上传前照片质量评分表比较原图与裁剪图。
第五步:选择参考图
内置参考图用于提供稳定的默认身份。如果上传自定义参考图,应只包含一个人,并优先使用清晰肖像。
不要把多人照片作为参考图。参考图负责回答“换成谁”,目标图负责提供“什么场景和角度”。两边都含多张脸会形成双重歧义。
第六步:只导出一次
普通照片在需要控制体积时可使用 JPG;需要其他工作流时可以使用 PNG 或 WebP。以较高但不过度的质量导出一次,避免多次保存和重新打开。
当前上传界面会显示支持格式与文件大小限制,应以界面实际显示为准,不要假设大型相机原图一定能直接上传。
第七步:用两种比例检查结果
在正常观看尺寸下,确认目标人物是否正确变化、群体画面是否仍然自然。
在 100% 缩放下检查:
- 眼睛与眼镜;
- 发际线和耳朵;
- 下颌与附近人物的重叠;
- 混合灯光下的肤色;
- 牙齿与张开的嘴;
- 原本不需要变换的人脸是否发生异常。
不能只因为目标脸看起来可以就直接发布,背景人物可能出现更严重的伪影。
人脸大小不同,质量也会不同
假设照片中有三个人:
- A 靠近相机,下巴到额头约 400 像素;
- B 距离更远,脸部约 160 像素;
- C 是模糊的背景人物,脸部只有约 60 像素。
即使三张脸都被识别,模型获得的信息也不相等。A 可能融合自然,B 可能偏软,C 则可能变成扭曲色块。
这不是统一“提高质量设置”就能解决的问题,而是源图片内部的信息量不同。提高输出分辨率不会让 C 的原始五官变得更详细。
如果每个人都重要,应选择脸部大小与焦点状态更接近的照片。
重叠比普通遮挡更难
眼镜遮住一部分脸,但仍属于同一个人。多人照片中,另一人的头发、手、肩膀或脸可能跨过目标边界,模型必须判断像素属于谁。
常见错误包括:
- 目标下颌与邻近脸颊融合;
- 他人的头发穿过变换后的额头;
- 重叠处出现重复眼睛或嘴形;
- 手部周围出现肤色接缝;
- 参考身份部分出现在错误的人脸上。
严重重叠无法仅靠裁剪修复。目标脸被他人明显挡住时,应换一个拍摄瞬间。
换错人脸时怎么办?
不要立即用相同文件再次提交。重复生成可能略有变化,但不会消除输入歧义。
按以下顺序处理:
- 裁掉其他所有可见人脸。
- 保留完整目标头部和少量周围环境。
- 确认目标脸是裁剪图中最大、最清楚的脸。
- 通过裁剪移除截图边框和无关倒影,不要在五官上涂抹。
- 尝试角度更接近的参考图。
- 只生成一次并比较差异。
如果场景必须包含目标周围的其他未变换人物,请使用前述两阶段工作流。
上传前多人照片检查表
- 我能明确说出要变换哪个或哪些人。
- 我有权或有其他合法依据使用照片及其中人物形象。
- 目标脸没有严重遮挡或出框。
- 裁剪已排除无关人脸、屏幕、镜子和海报。
- 目标在 100% 缩放下仍有细节。
- 参考图只包含一张清晰人脸。
- 最终图片不会被当成真实事件证据。
- 在可能产生误解时,我会明确标注为 AI 编辑戏仿内容。
如果第一项都无法明确回答,模型很可能也面临同样歧义。
多人图片更需要考虑隐私与同意
多人照片可能包含从未预期自己的图片会被 AI 服务处理的人。图片公开可见,并不自动代表你获得了所有隐私、公开权、生物识别、著作权或合同许可。
只处理自己有权使用的照片。避免涉及未成年人、私人场所、敏感事件或明确反对的人。公开分享时,应考虑每个可识别人物能否合理理解该内容是玩笑,而不是事实记录。
最终建议
为了获得稳定控制,应把裁剪当作目标选择:
- **只需要一个人:**隔离一个人。
- **需要群体背景:**先测试受控裁剪;确需恢复背景时,使用合法且明确披露的普通编辑流程。
- **需要多张脸:**接受结果差异,并逐一检查每张脸。
最好的多人输入不一定是最宽或像素最高的图片,而是目标脸清楚、光线接近、重叠较少,并且能与其他所有类似人脸的物体明确区分的图片。
裁剪完成后,可打开 faceswap 工具。如果结果出现眼睛、发际线、下颌或肤色异常,请继续查看换脸伪影分区排查指南。

