Skip to main content
QUICK REVIEW

[논문 리뷰] DALG: Deep Attentive Local and Global Modeling for Image Retrieval

Yuxin Song, Ruolin Zhu|arXiv (Cornell University)|2022. 07. 01.
Advanced Image and Video Retrieval Techniques인용 수 7
한 줄 요약

이 논문은 전면 어텐션 기반의 단일 단계 이미지 검색 프레임워크인 DALG를 제안한다. 이는 전역 특징 추출에 Swin-Transformer를 활용하고 국소 특징 추출에 창문 기반 다중 헤드 어텐션과 공간 어텐션을 적용함으로써 다중 해상도 테스트를 단일 해상도 추론으로 대체한다. 계층적 융합을 위해 학습 가능한 크로스 어텐션 모듈을 도입하여 다중 해상도 테스트가 필요 없어지면서도 상태 최고 수준의 정확도를 달성하고 추론 효율성이 크게 향상되었다.

ABSTRACT

Deeply learned representations have achieved superior image retrieval performance in a retrieve-then-rerank manner. Recent state-of-the-art single stage model, which heuristically fuses local and global features, achieves promising trade-off between efficiency and effectiveness. However, we notice that efficiency of existing solutions is still restricted because of their multi-scale inference paradigm. In this paper, we follow the single stage art and obtain further complexity-effectiveness balance by successfully getting rid of multi-scale testing. To achieve this goal, we abandon the widely-used convolution network giving its limitation in exploring diverse visual patterns, and resort to fully attention based framework for robust representation learning motivated by the success of Transformer. Besides applying Transformer for global feature extraction, we devise a local branch composed of window-based multi-head attention and spatial attention to fully exploit local image patterns. Furthermore, we propose to combine the hierarchical local and global features via a cross-attention module, instead of using heuristically fusion as previous art does. With our Deep Attentive Local and Global modeling framework (DALG), extensive experimental results show that efficiency can be significantly improved while maintaining competitive results with the state of the arts.

연구 동기 및 목표

  • 기존의 이미지 검색 방법이 강건한 성능을 확보하기 위해 다중 해상도 테스트에 의존함으로써 발생하는 비효율성을 해결하기 위해.
  • 합성곱 신경망을 전면 어텐션 기반 아키텍처로 대체함으로써 단일 단계 이미지 검색에서 효과성과 효율성의 상호 간 균형을 향상시키기 위해.
  • 창문 기반 및 공간 어텐션 메커니즘을 활용해 다양한 시각적 패턴을 포착할 수 있는 새로운 국소 특징 추출 브랜치를 설계하기 위해.
  • 수동적인 특징 융합 전략을 학습 가능한 크로스 어텐션 메커니즘으로 대체하여 국소 및 전역 특징의 통합을 향상시키기 위해.
  • 다중 해상도 입력 없이도 높은 성능을 내는 이미지 검색을 가능하게 하여 계산 복잡도를 감소시키기 위해.

제안 방법

  • 전역 특징 추출을 위해 계층적이고 국소적인 자기 어텐션 설계를 활용한 Swin-Transformer를 백본으로 사용한다.
  • 겹치는 영역에서 국소 시각적 패턴을 모델링하기 위해 창문 기반 다중 헤드 자기 어텐션과 공간 어텐션을 갖춘 국소 브랜치를 도입한다.
  • 중요한 경계 정보를 유지하고 국소 특징 표현을 향상시키기 위해 겹치는 창문 분할 전략을 적용한다.
  • 수동적인 직교 융합을 대체하기 위해 계층적으로 국소 및 전역 특징을 융합하기 위해 학습 가능한 크로스 어텐션 모듈을 활용한다.
  • 특정 특징 단계에서 역전파를 정지시켜 전역 및 국소 브랜치 최적화를 분리하는 그래디언트 정지 학습 전략을 구현한다.
  • 전역 특징에는 ArcFace 손실을, 국소 특징에는 보조 교차 엔트로피 손실을 적용하며, 중간 레이어에서 그래디언트를 정지시켜 독립적인 학습을 장려한다.

실험 결과

연구 질문

  • RQ1전면 어텐션 기반 모델이 다중 해상도 테스트가 필요 없이도 높은 정확도를 유지하면서 단일 단계 이미지 검색에서 이를 제거할 수 있는가?
  • RQ2창문 기반 다중 헤드 어텐션은 전 특징 매핑 어텐션 대비 이미지 검색에서 국소 특징 추출에 있어 어떻게 비교되는가?
  • RQ3학습 가능한 크로스 어텐션 융합이 국소 및 전역 특징 융합에 있어 수동적인 직교 융합보다 우수한가?
  • RQ4합동 학습 환경에서 그래디언트 정지 전략이 국소 및 전역 특징 학습 성능에 미치는 영향은 무엇인가?
  • RQ5자기 어텐션 기반 국소 브랜치는 표준 합성곱 연산 대비 다양한 시각적 패턴을 효과적으로 모델링할 수 있는가?

주요 결과

  • 제안된 O-Win-MSA(겹침이 있는 창문 기반 다중 헤드 자기 어텐션)는 겹침이 없는 경우와 전체 특징 매핑 어텐션보다 우수한 성능을 보이며, Roxf-M에서 78.01 mAP, Rpar-M에서 88.97 mAP를 달성했다.
  • 학습 가능한 크로스 어텐션 융합 방법은 직교 융합 대비 Roxf-M에서 1.13점, Rpar-M에서 0.12점 향상된 mAP를 기록했다.
  • Swin-Transformer의 두 번째 단계와 국소 특징 헤드에서 역전파를 정지시키는 것이 최고의 mAP 성능을 보였으며, 각각 Roxf-M에서 78.01, Rpar-M에서 88.97을 기록했다.
  • 제거 실험을 통해 그래디언트 정지 전략이 특징 학습의 독립성을 향상시켜 전체 역전파 대비 1.5~2.0 mAP 포인트 향상된 성능을 확보함을 확인했다.
  • 다중 해상도 테스트를 제거함으로써 높은 mAP 점수를 확보하면서도 추론 복잡도가 크게 감소했다.
  • 단일 해상도 추론을 통해 Google Landmark v2, Rparis, Roxford 데이터셋에서 최신 기술 수준의 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.