1. GASS:几何感知球面采样技术解析
在当前的文本到图像(T2I)生成领域,我们面临着一个看似矛盾的现象:模型生成的图像质量越来越高,语义对齐度越来越好,但多样性却越来越受限。作为一名长期关注生成式AI的研究者,我发现这个问题在实际应用中造成了诸多困扰——从创意工作流的选择受限到潜在的社会偏见放大。
GASS(Geometry-Aware Spherical Sampling)技术的出现,为这个问题提供了一个全新的解决视角。与传统的基于熵最大化的方法不同,GASS从几何角度对多样性进行了系统性的解耦和控制。这种方法的核心在于认识到T2I生成中的多样性实际上来源于两个正交的维度:与提示词直接相关的语义变化,以及与提示词无关的视觉属性变化。
1.1 技术背景与核心问题
现代T2I模型如Stable Diffusion系列和DALL·E等,通常采用CLIP(Contrastive Language-Image Pretraining)作为文本和图像的联合嵌入空间。在这个空间中,文本提示和生成的图像都被映射为高维向量(通常是512或768维),且这些向量被归一化到单位超球面上。
传统方法在增强多样性时,往往简单地最大化生成样本在CLIP空间中的分散程度,这种做法存在两个主要问题:
- 无法区分"有意义"的多样性和"随机"的多样性
- 可能导致与提示词语义不一致的变化,损害生成质量
GASS的创新之处在于,它首次明确地将多样性分解为两个可控的组成部分,并提供了针对每个部分的独立调控机制。
1.2 GASS的核心思想
GASS的核心思想可以用一个简单的几何类比来理解:想象CLIP空间是一个三维球体,文本提示的嵌入向量确定了球面上的一个固定点(北极)。任何图像样本都可以表示为球面上的另一个点,这个点与北极的连接线可以分解为两个正交分量:
- 沿着经线方向的分量(提示词相关变化)
- 沿着纬线方向的分量(提示词无关变化)
通过独立控制这两个方向的变化程度,GASS能够实现更加精细和符合预期的多样性增强。具体来说:
- 提示词相关变化:影响物体姿态、布局、视角等与提示词语义直接相关的属性
- 提示词无关变化:影响背景、纹理、光照等与提示词语义无关的视觉属性
这种解耦不仅提高了多样性的可控性,还能避免传统方法中
