1. 项目背景与核心价值
这个毕设项目瞄准了计算机视觉领域一个既经典又前沿的课题——图像美学与情感评价。传统的美学评分系统往往只关注构图、色彩等客观指标,而忽略了图像带给观者的情感共鸣。我们团队尝试用GNN+Transformer的混合架构,让AI学会像人类一样"感受"图片的美。
在实际应用中,这套算法能帮摄影平台自动筛选优质内容,为设计师提供作品优化建议,甚至辅助心理治疗师通过患者拍摄的照片分析情绪状态。技术上最有趣的是,我们让GNN处理图像中的物体关系(比如判断画面中的主体是否突出),用Transformer捕捉全局美学特征(如黄金分割比例),最后通过多任务学习同时输出美学评分和情感标签。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构解析
2.1 双流特征提取设计
主干网络采用ResNet-50+ViT的混合结构:
- 底层CNN提取局部视觉特征(卷积核尺寸设置为7×7以适应大尺度美学特征)
- Transformer层处理patch分块后的全局关系(16×16分块效果最佳)
- 特别设计了跨模态注意力机制,让两种特征在通道维度交互
python复制class CrossAttention(nn.Module):
def __init__(self, dim):
super().__init__()
self.query = nn.Linear(dim, dim)
self.key = nn.Linear(dim, dim)
self.value = nn.Linear(dim, dim)
def forward(self, x1, x2):
q = self.query(x1)
k = self.key(x2)
v = self.value(x2)
attn = torch.softmax(q @ k.transpose(-2,-1) / math.sqrt(k.size(-1)), dim=-1)
return attn @ v
2.2 图神经网络的应用创新
构建图像场景图的三个关键步骤:
- 使用Faster R-CNN检测图像中的物体(COCO预训练模
