[论文解读] PS-Transformer: Learning Sparse Photometric Stereo Network using Self-Attention Mechanism
本文提出PS-Transformer,一种基于自注意力机制的深度学习模型,用于稀疏光度立体重建,通过结合像素级与图像级特征的双分支架构,捕捉高阶图像间相互作用。通过在不进行下采样的情况下使用多头自注意力机制,并在表面法线预测中引入中间监督,该模型即使在仅使用8张输入图像的情况下,也能实现最先进(SOTA)的精度,优于使用10倍以上图像的密集型方法基线。
Existing deep calibrated photometric stereo networks basically aggregate observations under different lights based on the pre-defined operations such as linear projection and max pooling. While they are effective with the dense capture, simple first-order operations often fail to capture the high-order interactions among observations under small number of different lights. To tackle this issue, this paper presents a deep sparse calibrated photometric stereo network named {\it PS-Transformer} which leverages the learnable self-attention mechanism to properly capture the complex inter-image interactions. PS-Transformer builds upon the dual-branch design to explore both pixel-wise and image-wise features and individual feature is trained with the intermediate surface normal supervision to maximize geometric feasibility. A new synthetic dataset named CyclesPS+ is also presented with the comprehensive analysis to successfully train the photometric stereo networks. Extensive results on the publicly available benchmark datasets demonstrate that the surface normal prediction accuracy of the proposed method significantly outperforms other state-of-the-art algorithms with the same number of input images and is even comparable to that of dense algorithms which input 10$ imes$ larger number of images.
研究动机与目标
- 解决现有深度光度立体网络在稀疏设置下因图像数量过少而难以学习特征的局限性。
- 克服一阶聚合方法(如最大池化、线性投影)无法捕捉稀疏光照观测之间复杂高阶相互作用的失败。
- 设计一种在排列不变性下有效融合多光照信息的同时保留精细表面细节的模型。
- 引入一个新的合成数据集CyclesPS+,以支持稀疏光度立体网络的训练与评估。
- 证明自注意力机制在低数据场景下可优于传统的卷积神经网络(CNN)方法和集合池化方法。
提出的方法
- 提出双分支网络:一个分支通过多头自注意力机制处理每个像素在不同光照下的观测,另一个分支通过卷积层编码图像级特征。
- 使用可学习的自注意力机制,建模不同光照方向下观测之间的复杂非线性关系,无需假设固定网格或输入尺寸。
- 在特征层面施加对预测表面法线的中间监督,以增强几何一致性并提高训练稳定性。
- 集成一个可学习的多头自注意力模块(PMA)用于解码,以数据驱动方式自适应融合跨图像的特征。
- 在新引入的合成数据集CyclesPS+上训练模型,该数据集提供多样化、逼真的光照与表面变化,以支持模型的鲁棒泛化能力。
- 在注意力处理过程中避免下采样,以在整个网络中保持空间分辨率和精细表面细节。
实验结果
研究问题
- RQ1自注意力机制是否能有效建模传统池化与线性操作失效的稀疏光度立体观测之间的高阶相互作用?
- RQ2分离像素级与图像级特征学习的双分支设计在低图像数量光度立体重建中如何提升性能?
- RQ3基于Transformer的架构在保持精细表面细节恢复的同时,能在多大程度上泛化至稀疏设置?
- RQ4对表面法线施加中间监督是否能提升稀疏光度立体重建中的几何可行性与最终预测精度?
- RQ5在输入图像数量有限的情况下,基于自注意力机制的模型与CNN基线及集合池化基线相比性能如何?
主要发现
- PS-Transformer在基准数据集上实现了最先进(SOTA)的表面法线预测精度,即使仅使用8张输入图像,也优于在10倍以上图像上训练的现有方法。
- 与SPS-Net(8×8)相比,该模型显著降低了预测误差,证明了双分支设计与基于注意力的特征融合的有效性。
- 在DiLiGenT-MV数据集上,PS-Transformer生成的表面法线图比所有基线更少噪声且更细节丰富,表现出一致的定性优势。
- 当在超过10张输入视图的图像上测试时,该模型保持了稳定性能,尽管未观察到显著提升,表明其在密集设置下的泛化能力有限。
- 消融研究证实,自注意力机制与中间监督是稀疏设置下性能提升的关键因素。
- SPS-Net(8×8)优于(32×32)的表现表明,局部阴影变化建模比全局特征聚合更有效,支持PS-Transformer的设计选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。