1. 项目背景与核心价值
这个数据集的出现其实挺有意思的。去年我在做NLP情感分析项目时,就发现市面上缺乏针对AI算命这类垂直领域的评测基准。AuraMate团队这次开源的评测集,正好填补了行业空白——它包含了超过5万条经过人工标注的算命对话记录,覆盖八字、星座、塔罗等12种主流占卜类型。
注意:数据集中的个人信息均已脱敏处理,所有生辰八字等敏感数据都替换为模拟生成的虚拟信息
我第一时间下载测试后发现,这个数据集最实用的地方在于它的三维标注体系:
- 语义准确性(回答是否符合命理逻辑)
- 情感共鸣度(话术是否让人产生信任感)
- 商业转化潜力(是否自然引导付费服务)
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据集技术细节拆解
2.1 数据采集与清洗流程
团队采用的是混合采集方案:
- 40%来自合作平台的真实用户对话(已脱敏)
- 30%由专业占卜师模拟生成
- 30%通过GPT-4生成后人工修正
清洗环节特别值得借鉴:
- 先通过LDA主题模型过滤掉无关对话
- 再用规则引擎检测矛盾陈述(比如同一八字出现不同解读)
- 最后用BERT做语义一致性校验
2.2 标注体系设计精要
标注标准文档里有个很妙的设定:要求标注者必须同时具备两种身份:
- 至少1年占卜从业经验
- 通过基础NLP知识测试
标注过程采用双盲验证:
- 每条数据由3人独立标注
- Krippendorff's alpha系数控制在0.85以上
- 争议样本由专家组终审
3. 典型应用场景实测
3.1 算命AI的自动评测
我用这个数据集测试了市面上3个主流产品:
python复制def evaluate_model(dataset, model):
scores = {
'accuracy': calculate_semantic_match(dataset, model),
'empathy': sentiment_analysis(dataset['user_feedback']),
'conversion': predict_purchase_probability(dataset)
}
return normalize_scores(scores)
测试发
