1. 项目概述:重新定义生成模型的推理方式
在计算机视觉领域,生成模型的发展一直遵循着"迭代优化"的基本范式——无论是早期的VAE、GAN,还是如今大火的扩散模型,都需要通过多步计算逐步优化输出结果。这种模式虽然有效,但计算成本居高不下,严重制约了实际应用效率。何恺明团队的最新研究提出了一种名为"漂移"(Drift)的全新范式,其核心突破在于:让生成模型在单次前向传播中完成高质量样本生成,彻底摆脱传统迭代推理的束缚。
这项工作的价值不仅在于理论创新,更在于其惊人的实用潜力。实测表明,基于漂移范式构建的模型在ImageNet 256×256生成任务上,仅用单次前向计算就能达到传统扩散模型50步迭代的视觉质量,而推理速度提升达20倍以上。这意味着我们可能正站在生成模型应用普及的临界点上——当高质量图像生成变得像图像分类一样"即点即得"时,内容创作、游戏开发、影视制作等行业的效率将迎来质的飞跃。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术原理深度解析
2.1 传统生成模型的效率瓶颈
当前主流生成模型的工作机制可以概括为"从噪声到数据的渐进式修正"。以扩散模型为例,其推理过程需要:
- 从纯高斯噪声开始
- 通过UNet网络反复预测噪声并去噪
- 通常需要50-100步迭代才能获得理想结果
这种设计的根本原因在于概率密度估计的固有难度——直接建模复杂数据分布需要极其庞大的模型容量。而分步迭代的策略,实际上是将一个困难任务分解为多个简单子任务,通过"小步快跑"的方式降低单步建模难度。
2.2 漂移范式的核心创新
何恺明团队的关键洞察在于:生成过程的本质是让样本在特征空间中从简单分布"移动"到复杂分布。传统方法选择用很多小步完成这个移动,而他们证明,通过精心设计的动力学系统,完全可以一步到位。
具体实现包含三大核心技术:
- 特征空间重构:将像素空间映射到经过特殊设计的隐空间,在这个空间中,数据分布的拓扑结构更易于建模
- 漂移场学习:训练神经网络直接预测从噪声分布到数据分布的最优转移路径(即漂移向量场)
- 稳定性控制:引入正则化项确保单步大跨度转移不会导致样本崩溃或失真
数学上,该方法建立在对随机微分方程(SDE)的重新参数化上。传统扩散模型对应的是如下SDE:
$$dx = f(x,t)dt + g(t)dw$$
而漂移
