条件生成要求模型在多样的视觉分布中满足指定信息:文本描述、参考图像、空间布局或时间条件。它既涉及概率路径,也涉及表示压缩、网络结构和求解器。第41章《扩散模型的概率原理》推导了加噪与反向过程;本章解释条件如何进入网络、引导如何改变预测,以及潜空间和视频扩展如何改变成本与误差。
离散视觉词元还可以采用自回归分解逐项生成,再由相应解码器恢复图像;该路线与反向扩散不同,表示接口见第40章《多模态建模》。因此,视觉输出并不必然意味着去噪过程。
42.1条件生成的对象及符号
本章主要符号见表42.1。
表 42.1 条件视觉生成的主要符号。
| 符号 | 含义 |
|---|---|
| \(x,z,c\) | 像素样本、潜变量和条件表示。 |
| \(H,W,C_x,f,C_z\) | 图像高宽、像素通道数、空间压缩因子与潜通道数。 |
| \(N,M,d,d_c\) | 视觉位置数、条件位置数、视觉与条件特征宽度。 |
| \(a_t,b_t\) | 扰动路径中的信号系数与噪声系数。 |
| \(s_t,\epsilon_\theta,w\) | 得分函数、噪声预测与本章 CFG 引导系数。 |
| \(\tau,u_\theta\) | 从噪声走向数据的连续时间与速度场。 |
| \(F,F',p_t,p_h,p_w\) | 原始及潜空间帧数与时空补丁尺寸。 |
文本生成图像关注条件遵循与分布质量,图像编辑还要求保留未编辑区域,视频生成进一步要求跨帧身份、运动与时间一致性。条件可以作为序列、空间张量或全局向量进入网络,不必都转换成一段文本。训练时必须明确每种条件的缺失表示、对齐关系和可见范围。
42.2时间条件及去噪主干
U-Net 的多尺度路径
U形网络(U-Net)由下采样路径、瓶颈与上采样路径构成。下采样减少空间位置数,扩大后续局部算子的有效感受野;跳跃连接将较高分辨率特征传给对应上采样层。它并不自动保证全局建模,感受野仍取决于层数、卷积与注意力配置。
时间编码可采用
再经多层感知机形成调制向量。对特征 \(h\),常见条件调制为
\(\gamma,\beta\) 沿空间维广播;其形状必须与通道一致。离散步编号、归一化时间与对数信噪比不是同一输入,替换时间编码时必须保持训练契约。
图42.1中的时间与语义条件在不同尺度影响预测,跳跃特征仍需经过上采样分支的可训练计算。
交叉注意力及联合注意力
视觉特征 \(X\in\mathbb R^{N\times d}\) 和条件特征 \(C\in\mathbb R^{M\times d_c}\) 通过
建立交叉注意力。这里 \(W_Q\in\mathbb R^{d\times d_h}\),\(W_K\in\mathbb R^{d_c\times d_h}\),\(W_V\in\mathbb R^{d_c\times d_v}\),输出 \(A\in\mathbb R^{N\times d_v}\);\(B\) 排除条件填充等不可见位置。单头打分成本随 \(NMd_h\) 增长,而非视觉自注意力的 \(N^2d_h\)。
把视觉与文本映射到兼容宽度后联合处理,可以让两种表示相互更新,但会产生约 \((N+M)^2\) 的注意力配对数。是否双向更新、是否使用独立投影和调制,是具体架构选择。文本编码器、分词器、截断规则和空条件表示都属于制品,不可只替换编码器名称。
Transformer 主干及目标相互独立
扩散 Transformer(Diffusion Transformer,DiT)把潜变量切分为补丁并使用 Transformer 预测去噪目标(Peebles 和 Xie 2023)。若潜图为 \(H_z\times W_z\times C_z\)、补丁边长为 \(p\),则位置数为 \(N=\frac{H_zW_z}{p^2}\),每补丁输入宽度为 \(p^2C_z\)。输出投影恢复每补丁所需通道,再重排为潜图。
时间或类别可调制归一化与残差门控。补丁变小会增加位置数;边长减半使 \(N\) 增至4倍,完整自注意力配对数增至16倍。主干为 Transformer 并不意味着训练目标必为流匹配:噪声预测、速度参数化和路径速度回归都可以由不同主干实现。
42.3无分类器引导的推导及边界
噪声外推
得分函数(Score Function)在本节指输入密度的梯度 \(s_t(x)=\nabla_x\log p_t(x)\),不是分类分数。给定条件 \(c\),贝叶斯关系给出
将条件信息梯度乘以 \(w\) 加到无条件得分上,得到
对同一高斯扰动 \(x_t=a_tx_0+b_t\epsilon\),密度可微且交换积分与微分合法时,
因此噪声回归的最优条件均值与得分成比例。在相同 \(b_t>0\) 下,式(42.5)对应
无分类器引导(Classifier-Free Guidance,CFG)通过条件丢弃训练,让生成模型提供两种估计,无须另训分类器(Ho 和 Salimans 2022)。丢弃的是语义条件,不是时间;空条件的编码方式也必须在训练中确定。
外推精度边界
本章 \(w=0\) 返回无条件预测,\(w=1\) 返回普通条件预测,\(w>1\) 为外推。有的文献写成 \((1+s)\epsilon_c-s\epsilon_u\),其 \(s=w-1\),不能按相同数值比较。
在固定时间且归一化积分存在时,式(42.5)是形式密度 \(p_t(x\mid c)^w p_t(x)^{1-w}\) 的对数梯度。但不同时间的这种密度族未必满足原前向扩散关系,因此不能据此断言最终采样分布恰为 \(p_0(x\mid c)^w p_0(x)^{1-w}\)。模型近似与求解误差还会进一步改变结果。
设无条件与条件预测分别为 \((0.2,-0.1)\) 与 \((0.5,0.3)\),则 \(w=2\) 得 \((0.8,0.7)\)。这说明差向量被放大,并不说明图像更正确。若两支预测误差为 \(e_u,e_c\),引导误差满足
大引导可能放大误差、改变多样性和产生伪影。以负面提示替代空条件时,基线已变成另一个条件分支,不再是真正无条件密度;其语义应明确说明。1
42.4潜空间表示及重建限制
VAE 目标及重参数化
变分自编码器(Variational Autoencoder,VAE)以 \(q_\phi(z\mid x)\) 近似后验,解码器为 \(p_\psi(x\mid z)\)。由 Jensen 不等式,
对对角高斯 \(q_\phi=\mathcal N(\mu,\operatorname{diag}\sigma^2)\) 与标准正态先验,KL 为
重参数化 \(z=\mu_\phi(x)+\sigma_\phi(x)\odot\eta\)、\(\eta\sim\mathcal N(0,I)\) 将随机输入与参数分离,使梯度沿均值与尺度传播。实际视觉自编码器可能加入感知或对抗重建目标,故不能将所有潜空间编码器都称为仅优化上述标准 ELBO。
潜空间扩散(Latent Diffusion)先学习压缩表示,再在该表示上训练生成过程(Rombach 等 2022)。图像为 \(H\times W\times C_x\)、压缩率为 \(f\) 时,潜元素数为 \(\frac{HWC_z}{f^2}\),原图与潜空间元素比为 \(\frac{f^2C_x}{C_z}\)。例如 \(512\times512\times3\) 到 \(64\times64\times4\),比值为48,空间位置数减少64倍。元素比不等于端到端加速比,编码、解码和主干通道均有成本。
缩放协议及不可恢复信息
若生成器训练使用 \(z'=sz\),采样结束后必须先得到 \(z=\frac{z'}{s}\) 再解码。遗漏缩放改变解码器输入分布;不能将一个模型的常数复制给其他制品。像素归一化、色域、裁剪、潜通道、后验采样或均值选择也必须一致。
编码器丢失的信息不会因为后续生成器更大而被可靠恢复。细小文字、线条与局部身份细节尤其需要独立验证。自编码器重建误差和生成误差属于不同来源:先对真实输入做编码解码对照,才能判断瓶颈是否已出现在表示层。
42.5流匹配及连续路径
(选修)
条件速度回归
本节以 \(\tau\in[0,1]\) 从噪声走向数据,端点记为 \(Z_0\) 与 \(Z_1\),区别于第41章《扩散模型的概率原理》从干净样本出发的离散加噪记号。取一个端点联合分布,定义线性路径
流匹配(Flow Matching)可以通过条件路径监督速度场(Lipman 等 2022)。平方损失
在固定 \((z,\tau,c)\) 下的最优解为 \(u^*(z,\tau,c)=\mathbb E[U\mid Z_\tau=z,c]\)。证明来自平方展开:任意预测与条件均值之差的平方,加上与预测无关的条件方差,构成全部条件风险。
对光滑紧支撑测试函数 \(\varphi\),若微分与期望可以交换,
因此该边缘速度满足对应密度路径的弱形式连续性方程。若速度场具备适当正则性与可积性,求解 \(\frac{dZ_\tau}{d\tau}=u^*(Z_\tau,\tau,c)\) 可以运输这些边缘分布。端点配对可以独立,也可来自其他耦合;它会改变条件速度与学习难度。
直线路径的生成边界
(选修)
训练样本路径是直线,但同一中间位置可能对应多对端点,其条件平均速度会随位置与时间变化。故学习到的边缘轨迹不必是各训练端点之间的那条直线,不能从线性插值直接推出一次网络调用即可精确生成。
Euler 更新为 \(z_{k+1}=z_k+h_k u_\theta(z_k,\tau_k,c)\)。若场足够光滑,单步局部截断误差为二阶、固定区间的全局误差通常为一阶;网络误差另计。以一维 \(u(z)=z,z(0)=1\) 为例,精确终点为 \(e\),单步 Euler 得2,两步得2.25,都不精确。该构造说明减少步数需要相应的求解或训练依据。
扩散中的 \(v\) 参数化常表示信号与噪声的特定线性组合,流匹配的 \(u\) 则是路径导数。两者都可能被接口称为 velocity,却不能只凭名称互换。预测对象、时间方向和求解器必须共同确定。
42.6编辑、视频及联合媒体
(选修) 图像编辑将参考图、遮罩或结构控制作为额外条件。若要求未编辑区域严格保持,应区分像素级约束与模型倾向;潜空间遮罩经过编码解码可能影响边缘及邻近区域。多次去噪中的已知区域替换还需匹配当前噪声尺度,不能直接把干净像素与高噪状态混合后宣称符合原模型。
视频潜变量可写为 \([B,C_z,F',H',W']\),时空补丁数为
这里假设尺寸可整除,真实实现的补齐与边界另计。设每帧有 \(S\) 个空间位置,共 \(F'\) 帧,全时空注意力配对数为 \(F'^2S^2\);空间与时间分解注意力约为 \(F'S^2+SF'^2\),但其连接结构不同,不能称为完全相同算子的无损替换。
(选修) 例如16个潜帧,每帧 \(32\times32\) 位置,补丁为 \(1\times2\times2\),则 \(S=256,N=4096\),完整打分矩阵每头有约1678万项。帧数翻倍使全注意力项增至4倍,而空间分支仅翻倍。帧率、时长与潜时间压缩共同决定 \(F'\);某些因果时间编码器对首帧采用特殊处理,不能简单假设所有模型都有 \(F'=\frac{F}{f_t}\)。
音视频联合生成需要共同时间基准、采样率与对齐条件。视觉连续不证明声画同步,片段看似合理也不证明物理动力学正确。所谓世界模型还需要动作条件、状态覆盖和闭环任务验证;视频观感不能替代控制稳定性证据。
42.7训练、采样及制品一致性
算法42.1 计算过程
条件潜空间生成的数据流。
固定像素预处理、编码器与潜缩放,取得训练潜变量及条件表示;记录条件缺失规则。
按训练目标采样时间和噪声,构造扰动或路径状态,计算噪声、样本或路径速度目标。
训练主干,确保输出形状、监督对象与时间权重一致;条件丢弃只按已定义策略执行。
推理时从匹配先验初始化,用匹配的预测参数化和时间方向逐步求解;需要引导时组合两支预测。
恢复潜缩放并解码,保留精确组件版本、生成配置与输出来源记录。
分别评价重建限制、条件遵循、质量、多样性、编辑保持与视频时间一致性;不以单张图代替分布评估。
图42.2显示预测与状态更新的分工;只有组件协议相容时,循环才具有所声明的概率含义。质量评估需同时检查条件遵循、分布多样性及任务细节:图文相似度只检查所用表示空间中的接近程度,不能独立证明计数、否定或局部文字正确;某种分布距离很小,也不能证明每个条件下都生成了正确结果。
服务预算应同时限制分辨率、帧数、采样步数、候选数和并发;请求数本身不足以描述工作量。组件清单包含主干、文本编码器、分词器、自编码器、缩放、求解器与控制模块。代码可获取、权重可获取和特定部署用途允许是不同事实,应依据所用精确制品记录,不能继承同家族其他版本的结论。
将两支合并为一个批次可以减少某些调度开销,但仍需处理两组条件前向,不等于只计算一支的成本。↩︎