[论文解读] Semantic-aware Image Deblurring
本文提出 S3E-Deblur,一种新颖的端到端框架,利用图像字幕生成衍生的语义引导来提升严重模糊图像的去模糊效果。通过引入结构化-空间语义树(S3-tree)来建模并嵌入结构化语义特征(实体与关系)至基于生成对抗网络(GAN)的去模糊生成器中,该方法在 MSCOCO 和 GoPro 数据集的严重模糊图像上,于去模糊与图像字幕生成任务中均实现了最先进性能。
Image deblurring has achieved exciting progress in recent years. However, traditional methods fail to deblur severely blurred images, where semantic contents appears ambiguously. In this paper, we conduct image deblurring guided by the semantic contents inferred from image captioning. Specially, we propose a novel Structured-Spatial Semantic Embedding model for image deblurring (termed S3E-Deblur), which introduces a novel Structured-Spatial Semantic tree model (S3-tree) to bridge two basic tasks in computer vision: image deblurring (ImD) and image captioning (ImC). In particular, S3-tree captures and represents the semantic contents in structured spatial features in ImC, and then embeds the spatial features of the tree nodes into GAN based ImD. Co-training on S3-tree, ImC, and ImD is conducted to optimize the overall model in a multi-task end-to-end manner. Extensive experiments on severely blurred MSCOCO and GoPro datasets demonstrate the significant superiority of S3E-Deblur compared to the state-of-the-arts on both ImD and ImC tasks.
研究动机与目标
- 解决严重模糊图像去模糊的挑战,此类图像的语义内容模糊,传统方法失效。
- 通过共享语义表示联合优化去模糊(ImD)与图像字幕(ImC)任务,实现两者的桥梁连接。
- 开发一种结构化、空间感知的语义嵌入模型,以捕捉并表示模糊图像中的实体与关系。
- 通过在端到端训练中引入基于语言的语义先验,提升去模糊图像的鲁棒性与质量。
- 发布首个公开可用的严重模糊图像数据集,以支持该领域未来的研究。
提出的方法
- 提出结构化-空间语义树(S3-tree),用于从模糊图像的深层特征中解析并表示语义内容(实体与关系)。
- 应用卷积解耦机制,分离实体特征图,并通过卷积聚合机制在 S3-tree 结构内整合关系特征。
- 将 S3-tree 节点的空间特征图嵌入基于 GAN 的图像去模糊网络的生成器中,以增强重建效果。
- 将预测的语义概率分布(实体/关系)注意力机制引入图像字幕分支的 RNN 解码器中,以提升字幕质量。
- 通过联合优化重建损失、对抗损失与分类损失,实现 S3-tree、图像字幕与图像去模糊分支的端到端联合训练。
- 使用共享的 CNN 主干网络提取去模糊与字幕分支的深层特征,实现跨任务特征共享。
实验结果
研究问题
- RQ1来自图像字幕的语义引导是否能显著提升严重模糊图像的去模糊质量?
- RQ2结构化语义树模型(S3-tree)在高度模糊图像中是否能有效捕捉并表示模糊的语义内容?
- RQ3图像去模糊与图像字幕之间的联合多任务学习是否相比单任务基线模型能更有效提升两个任务的性能?
- RQ4所提出的 S3-tree 模型是否能泛化至具有复杂运动模糊的真实世界模糊图像,如 GoPro 数据集中的图像?
- RQ5与语义嵌入联合训练的端到端协同训练是否能有效减少去模糊输出中的伪影并提升结构保真度?
主要发现
- S3E-Deblur 在图像去模糊与图像字幕任务中均达到最先进性能,在 MSCOCO 数据集的 Sev-BlurData 子集上优于 DeblurGAN 与 U-Deconv。
- 在严重模糊的 GoPro 数据集上,S3E-Deblur 实现 PSNR 29.12 与 SSIM 0.878,显著优于 DeblurGAN(PSNR: 27.89, SSIM: 0.842)与 U-Deconv(PSNR: 28.15, SSIM: 0.851)。
- 与图像字幕分支联合训练的 S3E-Deblur 版本,其去模糊效果优于使用预训练 S3-tree 的版本,证明了联合优化的优势。
- 定性结果表明,S3E-Deblur 有效减少了小物体与远距离物体(如图像中的翅膀)上的伪影,表明其结构保持能力更强。
- S3-tree 模型能以高置信度准确预测前 3 名语义类别,其空间特征图与显著图像区域高度对齐,证实了有效的语义定位能力。
- 在图像字幕任务中,S3E-Deblur(ImC)在大多数指标上表现最佳,尤其在严重模糊图像上,表明其具备更优越的语义理解能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。