1. 视觉生成技术的现状与挑战
当前AI视觉生成领域存在一个根本性的矛盾:理解图像时使用高维度特征,生成图像时却被迫降维。这就像让一个拥有完美视力的画家在创作时必须戴上模糊的眼镜。传统方法中,图像理解任务(如分类、检测)通常使用768-1024维的密集特征表示,而生成任务却只能处理8-32维的压缩特征。
这种"双轨制"带来的问题显而易见。首先,信息损失严重。高维到低维的压缩过程会丢失大量细节,就像把高清照片转换成像素画。其次,系统复杂度增加。需要维护两套不同的特征处理流程,增加了开发和部署成本。最重要的是,这限制了生成图像的质量上限——用简化的"视觉词汇"难以创作出丰富的作品。
问题的技术根源在于高维度离散生成的三大难点:
- 计算复杂度呈指数增长(768维特征的组合空间巨大)
- 传统向量量化方法在高维空间失效("维度灾难")
- 序列生成方法步数过多(16×16图像需要20万步预测)
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. CubiD的核心技术创新
2.1 维度级离散化:破解高维难题
香港大学团队提出的第一个突破性方案是维度级离散化。传统方法尝试将整个768维向量作为一个整体进行量化,就像试图一次性翻译整本书。而CubiD将每个维度独立处理,相当于逐词翻译。具体实现上:
- 对每个维度单独建立码本(codebook),码本大小通常为8-32
- 使用Gumbel-Softmax实现可微分量化
- 加入小量噪声防止量化塌缩
这种方法的神奇之处在于,虽然每个维度只使用少量离散值,但768个维度的组合却能表示极其丰富的语义信息。实验显示,这种离散化特征在CLIP评分上仅比原始连续特征低0.3%,几乎可以忽略不计。
2.2 立方扩散:三维建模思维
CubiD的第二个创新是将特征张量视为三维立方体(高度×宽度×深度),并设计了专门的立方扩散策略。与传统的平面扩散相比:
| 维度 | 传统方法 | CubiD |
|---|---|---|
| 空间 | 逐像素 | 任意位置 |
| 通道 | 全通道 | 单通道 |
| 顺序 | 固定 | 随机 |
训练时采用独特的遮蔽策略:
- 按元素(而非按块)随机遮蔽
- 遮蔽率遵循截断高斯分布(μ=1.0,σ=0.1)
- 使用可学习的遮蔽标记(而非固定值)
这种设计
