知行札记
专题AI 模型与系统多模态表示与生成

扩散、流匹配与图像生成

推导加噪训练、条件引导、潜空间生成和采样误差。

将生成改写为去噪学习

DDPM 的前向过程逐步给数据 x0x_0 加高斯噪声。令 αt=1−βt\alpha_t=1-\beta_t、αˉt=∏s≤tαs\bar\alpha_t=\prod_{s\le t}\alpha_s,可以直接构造任意噪声时刻:

xt=αˉtx0+1−αˉtϵ,ϵ∼N(0,I).x_t=\sqrt{\bar\alpha_t}x_0+\sqrt{1-\bar\alpha_t}\epsilon,\qquad \epsilon\sim\mathcal N(0,I).

这使训练无需先模拟全部加噪步骤。抽取真实图、时间和噪声,训练网络预测噪声,常见简单目标为 E∥ϵ−ϵθ(xt,t,c)∥2E\|\epsilon-\epsilon_\theta(x_t,t,c)\|^2,cc 表示条件。网络在数据分布上学习去噪规律,不需要知道生成过程中曾经存在的某一张“原图”。DDPM

反向生成从噪声开始,多次使用网络预测并按采样器推进。噪声预测、原数据预测和速度预测是相关参数化,噪声日程、方差与损失权重决定具体关系。简单 MSE 是特定重新加权的目标,不能直接说它与所有最大似然目标完全相同。

score 是对数概率密度对当前输入的梯度,指向局部更高密度方向。去噪学习可与 score matching、SDE 和 probability-flow ODE 联系,随机与确定性采样器各有不同误差和多样性条件。score-based 框架

潜空间改变计算位置

潜扩散先用编码器把图像压成较小表示,在潜表示中生成,再由解码器还原图像。空间压缩减少位置数,注意力和卷积工作都可能减少;总收益需计编码解码、通道、patch 和骨干结构。Latent Diffusion

构造尺寸例子:512×512 像素经每边八倍空间缩小得到 64×64 网格,位置数减少 64 倍。若相同 patch 和全注意力规则成立,注意力交互数减少 4096 倍;真实模型 patch、通道和其他计算不同,不能将这个比例直接当端到端速度。压缩还会损失小字、纹理和几何细节,生成模型无法保证恢复编码器丢掉的真实内容。

U-Net 通过多尺度卷积和跳跃连接组织去噪;DiT 在潜网格 patch 上用 Transformer,并注入时间与条件。DiT 的特定 scaling 实验说明加计算可改善其指标,卷积仍可以用于其他成本、分辨率和数据条件。网络家族并不由单一排行榜永久淘汰。DiT

条件引导怎样影响分布

Classifier-Free Guidance 在训练中包含有条件与无条件任务,生成时组合预测:

ϵ~=ϵu+w(ϵc−ϵu).\tilde\epsilon=\epsilon_u+w(\epsilon_c-\epsilon_u).

在这套记号下,w=0w=0 为无条件,w=1w=1 为直接条件预测,更大值外推条件差。实现可能把参数定义为从条件预测额外外推,数值不能直接互换。CFG

引导可提高某些条件对应,同时降低多样性、增加饱和或伪影。两个预测可拼批,并不意味成本等于一次预测;蒸馏后的 guidance 模型又可能改变调用方式。固定“3到8最佳”无法覆盖所有模型、任务和调度。

流匹配学习随时间的速度

流匹配选择从噪声到数据的概率路径,学习向量场 vθ(x,t)v_\theta(x,t),用 ODE dx/dt=vθ(x,t)dx/dt=v_\theta(x,t) 推进。构造线性条件路径 xt=(1−t)ϵ+tx0x_t=(1-t)\epsilon+tx_0 时,条件速度为 x0−ϵx_0-\epsilon,可以直接回归,无需在训练中运行完整 ODE。Flow Matching

单对样本的线性路径是直线,学到的边缘向量场与实际 ODE 轨迹仍可能弯曲。有限网络误差与数值积分误差存在,不能由线性插值推出任意模型 Euler 一两步就准确。rectified flow/reflow、蒸馏、时间采样和求解器可以改善少步生成,需要实际质量评价。Rectified Flow

扩散的某些 ODE 路径可放入广义流框架,二者有共同数学工具和不同训练参数化。少步、高引导与高分辨率的收益和缺陷需要联合测量。

自回归图像与组合架构

图像可经码本变成离散序列,再逐 token 预测,或用并行掩码预测等方式生成。离散压缩、生成骨干和图像解码器分别承担不同工作。自回归结构可以复用语言建模方式,也会遇到长序列延迟、顺序误差和全局一致性问题。

某项闭源产品写字更好,不能据此确定它采用哪种隐藏架构。比较生成系统应分别看指令对应、文字与数字、布局、身份、编辑保持、可控性和输出成本;视觉逼真无法单独证明条件全部满足。

最后更新于

本页目录