1. 项目背景与核心价值
在数据标注和众包任务中,标注者之间的观点分歧一直是个棘手问题。传统方法要么简单采用多数投票,要么直接剔除分歧样本,这两种做法都会造成信息损耗。DiADEM项目提出了一种创新思路——将标注者的分歧视为有价值的信息源,通过建模人口统计特征与观点分歧的关系,实现更精细化的数据标注质量评估。
这个项目的核心突破点在于:它不再把分歧当作需要消除的噪声,而是将其转化为可量化的价值信号。举个例子,当10个标注者对同一张图片的情感倾向打分时,传统方法可能只保留7个"正面"和3个"负面"中的多数结果。而DiADEM会分析这3个"负面"标注者是否具有特定的人口统计特征模式(比如都来自同一地区/年龄段),从而发现潜在的数据偏差或细分市场信号。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构解析
2.1 分歧量化模型
DiADEM首先构建了一个分歧量化框架,包含三个核心指标:
-
群体分歧指数(GDI):计算标注群体对单个样本的标准差
python复制def calculate_gdi(annotations): return np.std([a['score'] for a in annotations]) -
配对分歧矩阵(PDM):生成n×n的标注者两两分歧矩阵
python复制def build_pdm(annotators): return [[1 - cosine_similarity(a1, a2) for a2 in annotators] for a1 in annotators] -
特征相关分歧(FRD):量化特定人口特征组内的分歧强度
python复制def compute_frd(feature_group): intra_group = calculate_gdi(feature_group) inter_group = calculate_gdi(all_annotators) return intra_group / inter_group
