Skip to main content
QUICK REVIEW

[论文解读] EVP: Enhanced Visual Perception using Inverse Multi-Attentive Feature Refinement and Regularized Image-Text Alignment

Mykola Lavreniuk, Shariq Farooq Bhat|arXiv (Cornell University)|Dec 13, 2023
Advanced Vision and Imaging被引用 4
一句话总结

该论文提出EVP,一种新型视觉模型,通过逆多注意力特征优化(IMAFR)和正则化图文对齐(RITA)增强视觉感知,利用Stable Diffusion U-Net主干网络。EVP在单目深度估计任务中达到最先进性能(NYU Depth v2数据集RMSE降低11.8%,KITTI数据集达到新SOTA),在指代分割任务中实现2.53的IoU提升(RefCOCO数据集)。

ABSTRACT

This work presents the network architecture EVP (Enhanced Visual Perception). EVP builds on the previous work VPD which paved the way to use the Stable Diffusion network for computer vision tasks. We propose two major enhancements. First, we develop the Inverse Multi-Attentive Feature Refinement (IMAFR) module which enhances feature learning capabilities by aggregating spatial information from higher pyramid levels. Second, we propose a novel image-text alignment module for improved feature extraction of the Stable Diffusion backbone. The resulting architecture is suitable for a wide variety of tasks and we demonstrate its performance in the context of single-image depth estimation with a specialized decoder using classification-based bins and referring segmentation with an off-the-shelf decoder. Comprehensive experiments conducted on established datasets show that EVP achieves state-of-the-art results in single-image depth estimation for indoor (NYU Depth v2, 11.8% RMSE improvement over VPD) and outdoor (KITTI) environments, as well as referring segmentation (RefCOCO, 2.53 IoU improvement over ReLA). The code and pre-trained models are publicly available at https://github.com/Lavreniuk/EVP.

研究动机与目标

  • 通过超越先前方法的特征学习与图文对齐,提升单目图像的度量深度估计性能。
  • 通过引入新型架构组件,解决VPD在特征对齐与边界清晰度方面的局限性。
  • 利用自由形式、视觉-语言生成的图像描述,而非刚性类别模板,实现视觉任务中鲁棒的零样本与少样本泛化。
  • 在多种视觉任务(包括深度估计与指代分割)中验证所提架构的有效性。
  • 提供一个公开可用的高性能模型,利用预训练扩散特征并仅需极少微调。

提出的方法

  • 提出逆多注意力特征优化(IMAFR)模块,通过多头注意力机制在多个特征金字塔层级间聚合特征,以增强空间与语义表征能力。
  • 引入正则化图文对齐(RITA)模块,利用BLIP-2生成的自由形式描述生成统一且丰富的文本嵌入,提升与图像特征的交叉注意力对齐效果。
  • 采用基于分类的解码器,结合度量分桶机制(受ZoeDepth启发),通过学习离散深度分布实现更精确的深度预测。
  • 利用预训练的Stable Diffusion U-Net作为视觉编码器,借助其在大规模图文预训练中获得的丰富多模态特征。
  • 在U-Net的跳跃连接路径上应用多尺度特征优化策略,提升各尺度下的特征优化能力。
  • 在训练过程中微调CLIP文本编码器权重,以增强图像与文本表征之间的对齐,尤其在使用自由形式描述时表现更优。

实验结果

研究问题

  • RQ1与分层或固定聚合方式相比,逆多注意力特征聚合是否能显著提升单目深度估计中的特征表征能力?
  • RQ2相较于基于模板的类别描述,使用自由形式、视觉-语言生成的描述是否能带来更好的图文对齐效果与下游性能?
  • RQ3当与预训练扩散主干网络结合时,基于分类的深度解码器是否能通过度量分桶机制显著提升深度估计精度?
  • RQ4所提架构在包括深度估计与指代分割在内的多样化视觉任务中,泛化能力如何?
  • RQ5与基线VPD架构相比,IMAFR与RITA模块的集成对模型性能有何影响?

主要发现

  • 在NYU Depth v2基准测试中,EVP实现RMSE相对降低11.8%(从0.254降至0.224),创下室内单目深度估计新SOTA纪录。
  • 在KITTI数据集上,EVP在全部7项评估指标中均优于先前SOTA方法GEDepth,确立了室外深度估计的新SOTA性能。
  • 在RefCOCO指代分割任务中,EVP实现76.35的IoU,较先前SOTA方法ReLA提升2.53个百分点。
  • 消融实验表明,IMAFR、度量分桶与独立CLIP嵌入(每图一个)的组合表现最佳,其中独立CLIP向量策略(第12行)为最优方案。
  • 训练期间使用冻结的CLIP权重会导致性能欠佳,而微调CLIP能显著提升对齐效果与整体结果,尤其在使用自由形式描述时更为明显。
  • 模型性能对图文对齐策略最为敏感,BLIP-2生成的自由形式描述在无显式类别标签情况下,仍优于基于模板的描述。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。