1. 超分辨率重建的技术演进背景
在计算机视觉领域,图像超分辨率重建技术已经发展了数十年。这项技术的核心目标是从低分辨率图像中重建出高分辨率版本,在安防监控、医疗影像、卫星遥感等领域有着广泛的应用需求。早期的插值算法如双三次插值虽然计算简单,但重建效果模糊,缺乏高频细节。
2014年,Dong等人首次将卷积神经网络(CNN)引入超分辨率任务,提出了SRCNN模型。这个只有三层卷积的"浅网络"在PSNR指标上超越了传统方法,开启了深度学习时代。随后几年里,VDSR、DRCN、LapSRN等模型不断刷新性能记录,但普遍存在重建图像过于平滑、缺乏真实纹理的问题。
2017年,Ledig等人发表的SRGAN首次将生成对抗网络(GAN)引入超分辨率领域。通过对抗训练策略,模型能够生成具有丰富纹理细节的图像,尽管在PSNR指标上有所下降,但视觉效果显著提升。然而SRGAN生成的图像常出现伪影和失真,距离真正的照片级真实感仍有差距。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. ESRGAN的核心创新解析
2.1 网络架构改进
ESRGAN在SRGAN基础上进行了三项关键改进:
-
去除BN层:实验证明批量归一化会引入伪影并降低泛化能力。移除BN层后,网络能够保留更多真实纹理,同时减少约40%的计算量。
-
引入RRDB模块:采用残差中的残差结构(Residual-in-Residual Dense Block),包含:
- 密集连接的多层卷积(Dense Block)
- 层级间的残差连接
- 最终的缩放残差连接(×0.2)
-
改进判别器架构:使用Relativistic Discriminator,不仅判断图像真实性,还比较真实样本与生成样本的相对真实性,使训练更稳定。
2.2 感知损失函数的优化
ESRGAN对损失函数进行了精心设计:
python复制L_total = L_perceptual + λ1*L_GAN + λ2*L_pixel
- 感知损失(L_perceptual):基于VGG19高层特征图计算,重点关注语义内容而非像素差异
- 对抗损失(L_GAN):采用Relativistic平均判别器损失,公式为:
code复制E_xr[log(1 - D(xr, xf)
