1. 数据集概述与核心价值
卡达巴香蕉成熟度识别分割数据集是一个专为农业AI应用设计的标注数据集,包含702张800×800分辨率的香蕉图像,每张图像都使用labelme工具进行了精细的多边形标注。这个数据集最显著的特点是针对香蕉成熟度这一特定农业场景,将成熟状态细分为三个关键类别:ripe(成熟)、overripe(过度成熟)和underripe(未成熟)。
在实际农业应用中,香蕉成熟度的判断直接影响采摘时机、物流安排和销售策略。传统人工判断方式存在主观性强、效率低下等问题。这个数据集的价值在于:
- 提供了标准化的视觉判断依据(6591个成熟样本、2521个过度成熟样本和8329个未成熟样本)
- 标注采用多边形框(polygon)而非矩形框,能更精确地捕捉香蕉表面颜色和纹理特征
- 统一的分辨率(800×800)确保模型输入的一致性
提示:虽然数据集标注了三种成熟状态,但在实际农业应用中,overripe和underripe的判断标准可能需要根据具体品种和市场需求进行调整。建议使用者先进行小样本验证。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据集技术细节解析
2.1 数据结构与格式说明
数据集采用labelme的标准格式组织,每个样本包含:
- 原始图像(.jpg):采用RGB色彩空间存储,无压缩质量损失
- 标注文件(.json):包含多边形顶点坐标和类别标签的JSON文件
典型的标注文件结构如下:
json复制{
"version": "5.5.0",
"flags": {},
"shapes": [
{
"label": "ripe",
"points": [[x1,y1], [x2,y2], ...],
"group_id": null,
"shape_type": "polygon"
}
],
"imagePath": "image_001.jpg",
"imageData": null
}
2.2 标注质量与分布特点
通过分析标注统计可以发现:
- 类别分布不均衡:未成熟样本最多(8329),过度成熟最少(2521)
- 单图平均标注对象约24.8个(总框数17441/702张)
- 多边形标注平均包含15-20个顶点,能精确贴合香蕉边
