[论文解读] Deep Rectangling for Image Stitching: A Learning Baseline
该论文提出了一种用于图像拼接中图像校正的首个单阶段深度学习方法,采用全卷积网络结合残差渐进回归,从拼接图像中预测初始网格,同时通过综合损失函数强制实现边界矩形化、网格形状保持和感知内容保真度。该方法在保留线性和非线性结构方面优于传统两阶段方法,在新构建的数据集DIR-D上实现了更优的定性和定量结果。
Stitched images provide a wide field-of-view (FoV) but suffer from unpleasant irregular boundaries. To deal with this problem, existing image rectangling methods devote to searching an initial mesh and optimizing a target mesh to form the mesh deformation in two stages. Then rectangular images can be generated by warping stitched images. However, these solutions only work for images with rich linear structures, leading to noticeable distortions for portraits and landscapes with non-linear objects. In this paper, we address these issues by proposing the first deep learning solution to image rectangling. Concretely, we predefine a rigid target mesh and only estimate an initial mesh to form the mesh deformation, contributing to a compact one-stage solution. The initial mesh is predicted using a fully convolutional network with a residual progressive regression strategy. To obtain results with high content fidelity, a comprehensive objective function is proposed to simultaneously encourage the boundary rectangular, mesh shape-preserving, and content perceptually natural. Besides, we build the first image stitching rectangling dataset with a large diversity in irregular boundaries and scenes. Experiments demonstrate our superiority over traditional methods both quantitatively and qualitatively.
研究动机与目标
- 解决现有两阶段图像校正方法在处理人物肖像等非线性结构时表现不佳且易产生失真的局限性。
- 开发一种单阶段深度学习解决方案,避免迭代网格优化的需要,实现高效的并行计算。
- 通过综合损失函数平衡边界矩形化、网格形状保持和感知自然性,提升校正后图像的内容保真度。
- 构建首个大规模、多样化的配对拼接图像与矩形图像数据集(DIR-D),用于训练和评估深度校正模型。
提出的方法
- 提出一种单阶段深度学习框架,预定义刚性目标网格,仅通过带有残差渐进回归的全卷积网络预测初始网格。
- 设计一个多分量损失函数,结合边界项(强制输出为矩形)、网格项(保持网格形状)和内容项(确保感知自然性)。
- 使用新构建的DIR-D数据集端到端训练网络,该数据集通过将真实矩形图像应用逆校正变换生成。
- 对数万个合成样本进行人工筛选,确保高质量与多样性,最终获得6,358个干净的训练样本。
- 采用渐进式优化策略,其中残差回归器迭代改进初始网格预测,提升泛化能力并减少不均匀边界。
- 在内容损失中引入语义理解,以保持人脸和自然景观等复杂非线性结构。
实验结果
研究问题
- RQ1单阶段深度学习方法是否能在保留线性和非线性结构的同时,优于传统两阶段网格变形方法进行图像校正?
- RQ2残差渐进回归策略在提升网格预测质量与跨多样化图像内容的泛化能力方面效果如何?
- RQ3综合损失函数(平衡边界、网格和内容项)在提升校正图像的感知保真度方面有多显著?
- RQ4新构建的数据集(DIR-D)中包含的多样化拼接-矩形图像对,是否能有效支持深度校正模型的训练与评估?
- RQ5所提出方法在存在伪影和失真等低质量或失败案例的拼接图像上,泛化能力如何?
主要发现
- 所提出的单阶段深度学习方法在定性结果上显著优于传统两阶段方法,尤其在保留人物肖像等非线性结构方面表现更优,现有方法在该类图像上存在明显失真。
- 用户研究表明,70%的参与者更偏好本方法的结果而非He等人方法的结果,表明本方法在内容保真度方面具有更强的感知优势。
- 在跨数据集评估中,本方法在SPW、LCP和UDIS数据集的拼接图像上,即使在低质量输入(含伪影)下,产生的失真也少于基线方法。
- 消融实验证实,损失函数中的内容项与网格项均显著提升性能,且残差渐进回归策略有效减少了复杂情况下的不均匀边界。
- 最优网格分辨率确定为$8\times6$,在性能与计算成本之间取得平衡,而$16\times12$仅带来微小增益但成本更高。
- 该方法对真实世界拼接失败情况具有良好的泛化能力,在输入拼接图像包含投影失真和噪声时,仍能保持高质量的校正效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。