1. DDPM扩散模型基础概念解析
扩散模型(Diffusion Model)是近年来生成式AI领域最具突破性的技术之一,而DDPM(Denoising Diffusion Probabilistic Models)作为其经典实现,通过独特的"加噪-去噪"机制实现了高质量的图像生成。要真正掌握DDPM,我们需要从最基础的物理概念入手。
想象一杯清水滴入墨水的过程:起初墨滴清晰可见(对应原始图像X₀),随着时间推移,墨水分子逐渐扩散(加噪过程X₀→X_T),最终整杯水呈现均匀的淡灰色(纯噪声X_T~N(0,1))。DDPM的核心思想就是学习这个扩散过程的逆过程——就像让时间倒流,墨水分子重新聚集成最初的墨滴。
从数学视角看,DDPM包含两个关键过程:
- 前向过程(Forward Process):固定过程,通过T步逐渐将数据分布转化为高斯分布
- 反向过程(Reverse Process):学习过程,训练神经网络逐步去噪重建原始数据
关键理解:扩散模型与传统GAN的区别在于,它不直接生成数据,而是学习如何"修正"噪声数据。就像雕塑家不是直接从大理石中"变出"雕像,而是通过不断去除多余的石料来显现作品。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 前向扩散过程的数学建模
2.1 单步加噪的数学表达
前向过程的每一步都遵循马尔可夫性质,即当前状态仅依赖前一状态。用数学语言描述:
q(Xₜ|Xₜ₋₁) = N(Xₜ; √(αₜ)Xₜ₋₁, (1-αₜ)I)
其中:
- αₜ ∈ (0,1)称为噪声调度系数(schedule)
- βₜ = 1-αₜ表示噪声比例
- ϵₜ ~ N(0,I)是标准高斯噪声
这个公式的直观解释是:每一步保留√αₜ比例的当前信号,同时加入√(1-αₜ)比例的新噪声。通过精心设计αₜ的衰减策略(通常为线性或余弦),可以控制信息丢失的速度。
2.2 重参数化技巧的妙用
直接迭代计算T步加噪效率低下,DDPM采用重参数化(reparameterization)技巧实现一步到位计算任意时刻t的状态:
Xₜ = √(ᾱₜ)X₀ + √(1-ᾱₜ)ϵ
其中ᾱₜ = ∏ᵢ₌₁ᵗ αᵢ
这个推导过程利用了高斯分布的可加性:多个独立高斯变量的和仍是高斯分布,新分布的均值方差是各变量的和。具体推导路径:
- 展开Xₜ = √αₜX
