概念
不随版本变化
特征提取:深度、边缘、姿态与分割
这些是把「一张图」变成「结构提示」的中间产物。搞懂它们的输入输出,才拼得对。
深度、边缘、姿态、分割这些术语听起来抽象,其实都是同一件事:把一张图转换成一个更简单的表示,好让生成阶段按这个结构去画。
这一层在做什么
- 输入通常是一张普通的图(照片、渲染图、手绘)
- 输出是一张「看不懂内容但看得懂结构」的图,或者是坐标点集合
- 它由专门的模型完成,与主生成模型是两套东西,各自需要下载与放置
- 它只负责提取,不负责生成;生成仍然由主模型完成
常见的几种提取
| 提取类型 | 输出长什么样 | 接着用来做什么 |
|---|---|---|
| 边缘 / 线稿 | 白底黑线的轮廓图 | 控制线条与轮廓,上色或换风格 |
| 深度 | 灰度图,越近越亮或越暗 | 控制前后关系与空间层次 |
| 姿态 | 人体骨架或关键点 | 控制动作,换人物但保姿势 |
| 分割 / 抠图 | 按区域上色的色块,或带透明通道的图 | 精确指定每个区域放什么,或直接做局部重绘遮罩 |
| 反推描述 | 文字 | 作为提示词的起点 |
输出怎么用
- 先确认提取结果本身是对的:深度图出现大面积纯色、姿态点错位,后面怎么调都不会好。先单独看这一层输出。
- 再接到生成流程的结构控制入口:把提取结果当提示图接进去,而不是当成图生图的输入图。
- 控制强度从小往大加:先确认有效果,再逐步加强到合适。
- 把这一层单独存一份:提取结果可以复用:同一张参考图的深度图,可以在多次生成里反复用。
常见误解
常见误解
- 把提取结果当成品图
它是中间产物,通常是灰度图或骨架图,不是给人看的成品。 - 以为一个模型能包办所有提取
边缘、深度、姿态、分割各由不同模型负责,工作流里会分别列出依赖。 - 提取模型的输出尺寸与原图不一致
尺寸不匹配会让结构整体错位,接进生成前先确认比例一致。
知仓学习社