1. 长尾表示学习的几何视角解析
长尾分布问题在现实世界的数据集中普遍存在——少数类别占据大量样本,而多数类别仅有少量样本。传统分类器在这种数据分布下往往表现失衡:对头部类别过拟合,对尾部类别欠拟合。ICLR 2025这篇论文的创新点在于从表示空间的几何结构出发,系统分析了特征向量的分布规律与分类边界的关系。
通过可视化CIFAR-100-LT(长尾版)的t-SNE降维图可以发现,头部类别的特征向量在表示空间中形成密集的聚类簇,而尾部类别的特征则呈现发散状态。这种几何结构差异直接导致线性分类器难以同时适应所有类别。论文通过理论推导证明,特征向量的模长(norm)与类别的样本量呈正相关关系,这正是影响分类决策边界公平性的关键因素。
关键发现:在标准交叉熵损失下,特征向量的L2范数近似服从√n的增长率(n为类别样本量)。这使得头部类别的特征会自然占据更大的决策空间。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 特征重平衡的核心机制
2.1 解耦表示与分类器训练
论文提出两阶段训练框架:
- 表示学习阶段:使用标准交叉熵损失训练特征提取器,保留原始数据的几何结构
- 分类器校准阶段:冻结特征提取器,通过以下方法调整决策边界:
- 对尾部类别的分类权重施加放大系数 γ=1/√n
- 引入可学习的温度系数τ调整logit尺度
- 特征归一化(L2 normalization)消除模长偏差
python复制# 分类器校准的PyTorch实现示例
class BalancedClassifier(nn.Module):
def __init__(self, feat_dim, num_classes, class_counts):
super().__init__()
self.weight = nn.Parameter(torch.Tensor(num_classes, feat_dim))
# 初始化类别权重补偿系数
self.gamma = 1 / torch.sqrt(torch.tensor(class_counts))
self.tau = nn.Parameter(torch.ones(1))
def forwa
