Skip to main content
QUICK REVIEW

[논문 리뷰] Unifying Global-Local Representations in Salient Object Detection with Transformer

Sucheng Ren, Qiang Wen|arXiv (Cornell University)|2021. 08. 05.
Visual Attention and Saliency Detection참고 문헌 52인용 수 13
한 줄 요약

이 논문은 시각 트랜스포머 기반 프레임워크인 GLSTR를 제안하며, 얕은 레이어에서 자기주의 기반의 자기주의 메커니즘을 활용하여 공간적 세부 정보를 유지하면서도 장거리 의존성을 포착함으로써 전역 및 국소 표현을 통합한다. 이 방법은 밀도 있는 스위프트 연결과 점진적 업샘플링을 갖춘 깊이 있는 디코더를 사용하여 다섯 가지 벤치마크에서 최신 기술 대비 평균 12.17% 향상된 평균 절대 오차(MAE)를 달성한다.

ABSTRACT

The fully convolutional network (FCN) has dominated salient object detection for a long period. However, the locality of CNN requires the model deep enough to have a global receptive field and such a deep model always leads to the loss of local details. In this paper, we introduce a new attention-based encoder, vision transformer, into salient object detection to ensure the globalization of the representations from shallow to deep layers. With the global view in very shallow layers, the transformer encoder preserves more local representations to recover the spatial details in final saliency maps. Besides, as each layer can capture a global view of its previous layer, adjacent layers can implicitly maximize the representation differences and minimize the redundant features, making that every output feature of transformer layers contributes uniquely for final prediction. To decode features from the transformer, we propose a simple yet effective deeply-transformed decoder. The decoder densely decodes and upsamples the transformer features, generating the final saliency map with less noise injection. Experimental results demonstrate that our method significantly outperforms other FCN-based and transformer-based methods in five benchmarks by a large margin, with an average of 12.17% improvement in terms of Mean Absolute Error (MAE). Code will be available at https://github.com/OliverRensu/GLSTR.

연구 동기 및 목표

  • 전체 컨volution 네트워크(FCNs)에서 전역적 맥락과 국소 세부 정보 보존 간의 상충 관계를 해결하기 위해.
  • 자기주의 기반 메커니즘을 사용하여 깊은 네트워크의 각 레이어 내에서 전역 및 국소 표현을 통합하기 위해.
  • 깊은 스택이 필요로 하는 CNN 기반 모델의 한계를 극복하고, 종종 세밀한 공간적 세부 정보를 잃는 대가를 치르지 않도록 하기 위해.
  • 각 트랜스포머 레이어에서 유일하고 중복되지 않는 표현을 최대한 활용하여 보다 향상된 시각적 강조 예측을 위한 새로운 디코더를 설계하기 위해.

제안 방법

  • 이미지 패치를 선형 투영을 통해 처리하고 첫 번째 레이어에서 다중 헤드 자기주의를 적용하여 전역 표현을 학습하는 순수한 시각 트랜스포머 인코더를 도입한다.
  • 전체 이전 레이어의 특징 맵을 참조할 수 있도록 허용하는 전역 자기주의 메커니즘을 사용하여, 조용한 레이어에서도 장거리 의존성 모델링이 가능하도록 한다.
  • 모든 트랜스포머 레이어의 특징을 조밀하게 연결하는 깊이 있는 변환 디코더를 제안하여 다양한 스케일에서 풍부한 전역-국소 표현을 유지한다.
  • 다른 스테이지에서의 특징에 대해 점진적 업샘플링 전략(8×, 4×, 2×)을 적용하여 디코딩 중 노이즈 주입을 최소화한다.
  • 디코더 스테이지 전반에 걸쳐 조밀한 스위프트 연결을 적용하여, 모든 트랜스포머 레이어가 최종 예측에 유일하게 기여하도록 보장한다.
  • 디코더의 연결 수를 제어하기 위해 학습 가능한 밀도 설정을 사용하여 특징 융합 효율성을 최적화한다.

실험 결과

연구 질문

  • RQ1시각 트랜스포머가 각 레이어에서 전역 및 국소 표현을 효과적으로 통합하여, 컨volution 레이어의 깊은 스택이 필요로 하는 것을 줄일 수 있는가?
  • RQ2얕은 트랜스포머 레이어에서 자기주의 메커니즘이 전역 맥락을 포착하면서도 국소 세부 정보를 어떻게 유지하는가?
  • RQ3표준 스위프트 연결 대비 다중 스케일 트랜스포머 특징의 조밀한 디코딩이 시각적 강조 지도 정확도를 얼마나 향상시키는가?
  • RQ4디코딩 중 점진적 업샘플링 전략이 노이즈 주입을 줄이고 경계 국소화 정확도를 향상시키는가?
  • RQ5순수한 트랜스포머 기반 인코더가 시각적 강조 탐지 벤치마크에서 CNN 기반 인코더를 능가할 수 있는가?

주요 결과

  • GLSTR는 다섯 가지 벤치마크 데이터셋에서 최신 기술 대비 평균 12.17% 향상된 평균 절대 오차(MAE)를 달성한다.
  • GateNet 및 BASNet과 같은 최신 기술 모델보다 뛰어나며, DUT-OMRON에서 MAE 0.029, DUTS-TE에서 MAE 0.033를 기록하여 이전 방법보다 유의미하게 낮다.
  • 제안된 점진적 업샘플링 전략은 단순한 16× 업샘플링 및 4×+4× 전략보다 우수하며, 특히 고밀도 디코딩 설정에서 두각을 나타낸다.
  • 네 가지 연결 밀도를 가진 조밀한 디코더는 일관된 성능 향상을 보이며, 가장 높은 밀도(4)에서 최고의 성능를 기록한다.
  • GLSTR의 추론 속도(15 FPS, RTX 2080Ti 기준)는 다른 최신 기술 방법들과 유사하여, 트랜스포머의 계산 비용에도 불구하고 실용적 타당성을 입증한다.
  • 시각적 주의 맵은 첫 번째 트랜스포머 레이어가 전역 맥락(예: 전체 객체 구조)을 포착하는 것으로 확인되었으며, 더 깊은 레이어들은 국소 세부 정보를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.