概念
不随版本变化
潜空间:模型其实不在像素上画
生成发生在压缩过的表示上,最后才解码成图。这解释了几件常见怪事。
模型不是在 1024×1024 的像素上直接画。它在一个压缩过的表示上计算,这个表示通常叫潜空间,最后再解码成图。
为什么要在潜空间里算
- 直接在像素上算,同样尺寸需要的计算量要大得多
- 压缩之后,模型只需要处理大结构与语义,细节由解码阶段补回来
- 代价是:压缩是有损的,解码补不回没被保留下来的信息
像素与潜空间的关系
潜空间里的长宽通常是像素长宽的若干分之一,通道数更多。所以工作流里会看到「尺寸」与「潜空间尺寸」两个概念:你填的是像素尺寸,程序换算成潜空间尺寸去算,最后解码回像素。
它解释了什么现象
- 为什么小尺寸出图快得多:像素减半,潜空间也变小,计算量按平方级别下降
- 为什么细小文字容易画错:压缩阶段丢掉的高频细节里就包括细小文字。这属于表示能力的限制,不是提示词没写对
- 为什么放大要分两步:先在小潜空间里定构图,再放大重绘补细节,比一步生成大图更省也更稳
- 为什么 VAE 很重要:编码与解码都由它负责,它差一点,最终画面就糊一点或者偏色
这一层也是「显存按总像素涨」的原因:潜空间表示、每一步的中间结果、解码阶段的中间数据都要占地方。
知仓学习社