1. 项目背景与核心价值
在数据标注领域,标注者之间的观点分歧一直是个棘手问题。传统方法往往将分歧视为噪声或错误,试图通过多数投票或专家仲裁来消除。但DiADEM项目提出了一个颠覆性视角——分歧本身可能蕴含着宝贵信息,关键在于如何系统化地建模和利用这些差异。
我参与过多个标注项目,最头疼的就是遇到标注不一致的情况。有一次在医疗影像标注中,三位资深放射科医生对同一个结节的性质判断完全不同,传统做法只能请主任医师仲裁。但后来我们发现,这些"分歧"恰恰反映了临床诊断中真实存在的灰色地带。DiADEM的创新之处在于,它不再把分歧当作需要消除的噪声,而是将其转化为可量化的价值信号。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构解析
2.1 人口统计特征编码体系
DiADEM的核心突破在于建立了一套完整的标注者特征编码体系。这个体系包含四个维度:
-
专业背景维度:
- 教育程度(分类变量:高中/本科/硕士/博士)
- 专业领域(多热编码:计算机/医学/语言学等)
- 从业年限(连续变量+分段处理)
-
认知特征维度:
- 风险偏好(Likert 5级量表)
- 注意力集中度(通过标注时长标准差计算)
- 决策一致性(历史标注的熵值)
-
文化背景维度:
- 地理区域(GDP分级+文化圈分类)
- 语言背景(母语与标注语言相似度)
- 宗教影响指数(基于公开数据库)
-
任务特定维度:
- 领域熟悉度(前置测试得分)
- 工具熟练度(鼠标轨迹分析)
- 任务理解度(测试题正确率)
我们为每个标注者构建了128维的特征向量,其中连续变量都经过Box-Cox变换和Robust Scaling处理。这个特征空间后来被证明比简单的demographic分类效果提升显著。
2.2 分歧量化模型
分歧的量化采用改进的Bregman散度框架:
code复制D_φ(p||q) = Σ[p_i*φ(q_i/p_i)] + (1-Σp_i)*φ(0)
其中φ函数根据任务类型选择:
- 分类任务:φ(x)=xlnx (KL散度)
- 连续标注:φ(x)=x²/2 (欧式距离)
- 排序任务:φ(x)=xlnx-x+1 (Itakura-Saito)
我们创新
