1. 长尾表示学习的几何视角:重新平衡偏态分布中的特征
在现实世界的机器学习应用中,数据分布往往呈现显著的长尾特性——少数类别拥有大量样本,而多数类别仅有少量样本。ICLR 2025这篇论文从几何视角切入,揭示了长尾表示学习中的特征空间动态变化规律,并提出通过特征重平衡来解决分布偏斜问题。不同于传统方法简单调整分类器权重,这项工作深入挖掘了特征表示层面的优化潜力。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 长尾问题的本质与挑战
2.1 数据偏斜的几何表现
在特征空间中,头部类别的样本会形成密集的聚类簇,而尾部类别的样本则呈现分散的分布状态。这种几何结构的不对称性导致:
- 分类边界向头部类别偏移
- 尾部类别的决策区域被压缩
- 模型对尾部样本的区分度下降
实测表明,在CIFAR-100-LT数据集上,头部类别(样本量前20%)的平均类内距离比尾部类别小47%,而类间距离大32%。
2.2 传统方法的局限性
常见的重采样和代价敏感学习方法存在明显缺陷:
python复制# 典型的重采样实现(存在问题)
from torch.utils.data import WeightedRandomSampler
sampler = WeightedRandomSampler(weights, num_samples)
- 过采样导致尾部样本过拟合
- 欠采样损失头部类别信息
- 分类器调整无法改善底层表示质量
3. 特征重平衡的核心方法
3.1 解耦表示与分类器学习
论文提出两阶段训练框架:
- 表示学习阶段:保持原始数据分布,使用标准交叉熵损失
- 分类器调整阶段:冻结特征提取器,优化分类器权重
关键发现:解耦训练可使尾部类别特征范数提升2-3倍
3.2 几何正则化策略
在特征空间引入三种约束:
- 类内紧凑性损失:$L_{intra} = \frac{1}{N}\sum||f(x)-\mu_y||^2$
- 类间分离性损失:$L_{inter} = \max(0, m - ||\mu_i-\mu_j||)^2$
- 特征范数平衡项:$L_{norm} = \sum_{c=1}^C (||\mu_c|| - \tau)^2$
其中$\mu_y$表示类别y的原型特征,$\tau$为范数目标值。
