1. 数据集背景与核心价值
风电机组作为清洁能源的重要载体,其运行稳定性直接影响发电效率与设备寿命。传统故障诊断方法主要依赖阈值报警和定期巡检,存在响应滞后、误报率高的问题。我们团队基于爱尔兰某3MW风电场真实SCADA数据构建的时空特征融合数据集,首次实现了对6类典型故障的时空关联建模。
这个数据集的核心价值在于:
- 完整保留了故障发生前后24小时的关键运行参数
- 通过DBSCAN聚类与双重模型验证实现高精度异常值剔除
- 创新性地采用双向标注策略捕捉故障传播特征
- 提供92维原生特征字段与标准化处理流程
提示:该数据集特别适合研究电气突变故障(如IGBT模块击穿)和机械缓变故障(如轴承磨损)的早期识别,实测故障定位准确率提升37%以上。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据采集与预处理全流程
2.1 原始数据特征解析
数据来自2014年5月至2015年4月的SCADA系统记录,包含:
- 时间维度:10分钟间隔的49027条样本
- 故障记录:553条标注样本覆盖6种状态
- 监测参数:63个变量分为7大类(振动、温度、转速等)
典型故障类型包括:
- 发电机绕组过热(标签1)
- 齿轮箱轴承磨损(标签2)
- 变桨系统卡滞(标签3)
- 电网电压骤升(标签4)
- IGBT模块过热(标签5)
- 偏航系统异常(标签6)
2.2 数据清洗关键技术
采用两阶段清洗方案确保数据质量:
第一阶段:物理规则过滤
python复制# 无效数据剔除规则
def basic_clean(df):
df = df[df['风速'] > 0] # 剔除零风速记录
df = df[df['有功功率'] > 0] # 剔除零功率记录
df = df[df['转速'] > 0.1] # 转速低于阈值视为异常
return df
第二阶段:DBSCAN动态聚类
构建参数优化矩阵:
| 邻域半径ε | 最小邻域点数np | 组合编号 |
|---|---|---|
| 0.02 | 6 | 1 |
| 0.03 |
