Skip to main content
QUICK REVIEW

[논문 리뷰] Self Attention Grid for Person Re-Identification

Jean-Paul Ainam, Ke Qin|arXiv (Cornell University)|2018. 09. 23.
Video Surveillance and Tracking Methods참고 문헌 28인용 수 3
한 줄 요약

이 논문은 고해상도 특징 맵에서 다수의 구분 가능한 영역에 초점을 맞춤으로써 특징 학습을 향상시키는 새로운 자기주의 메커니즘인 Self Attention Grid(SAG)을 제안한다. 두 개의 병렬 브랜치를 사용하며, 하나는 고해상도 특징을 처리하고 다른 하나는 최대 풀링과 소프트맥스를 통해 필터링 주의 격자를 학습한다. SAG는 세 가지 벤치마크 데이터셋에서 정확도를 향상시키며, 잔차 재정렬(RR) 전략을 사용한 DukeMTMC-ReID에서 81.05% mAP를 기록하여 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we present an attention mechanism scheme to improve person re-identification task. Inspired by biology, we propose Self Attention Grid (SAG) to discover the most informative parts from a high-resolution image using its internal representation. In particular, given an input image, the proposed model is fed with two copies of the same image and consists of two branches. The upper branch processes the high-resolution image and learns high dimensional feature representation while the lower branch processes the low-resolution image and learn a filtering attention grid. We apply a max filter operation to non-overlapping sub-regions on the high feature representation before element-wise multiplied with the output of the second branch. The feature maps of the second branch are subsequently weighted to reflect the importance of each patch of the grid using a softmax operation. Our attention module helps the network learn the most discriminative visual features of multiple image regions and is specifically optimized to attend feature representation at different levels. Extensive experiments on three large-scale datasets show that our self-attention mechanism significantly improves the baseline model and outperforms various state-of-art models by a large margin.

연구 동기 및 목표

  • 변동하는 조명, 자세, 저해상도 조건에서 낮은 정확도 문제를 해결하기 위해.
  • 단일 영역이 아닌 다수의 정보성 있는 이미지 영역에 동시에 초점을 맞춤으로써 특징의 구분 능력을 향상시키기 위해.
  • 어떤 CNN 아키텍처와도 호환되는 플러그 앤 플레이, 완전히 미분 가능한 주의 모듈을 설계하기 위해.
  • 이중 브랜치 주의 기반으로 고수준의 구분 가능한 특징과 저수준의 공간적 세부 정보를 모두 유지하기 위해.
  • 아키텍처의 대대적인 수정 없이 대규모 사람 재식별 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 모델은 두 개의 병렬 브랜치를 사용한다: 하나는 고해상도 특징 맵을 처리하고, 다른 하나는 동일한 입력의 저해상도 버전으로부터 주의 격자를 학습한다.
  • 주의 격자는 비중첩 공간 영역에 대한 최대 풀링을 거친 후 소프트맥스 연산을 통해 주의 가중치를 생성한다.
  • 그런 다음 고해상도 특징은 주의 격자와 요소별 곱셈을 수행하여 중요한 영역을 강조하고 배경 노이즈를 억제한다.
  • 주의 기반은 다수의 깊이 수준(D1에서 D4까지)에 적용되어 다중 수준 특징 정련을 가능하게 한다.
  • 전체 모듈은 백프로파게이션을 사용한 표준 최적화 기반으로 엔드 투 엔드로 훈련되며, 완전히 미분 가능하다.
  • 학습 안정성 향상과 특징 품질 향상을 위해 상부 잔차 블록에만 L2 정규화를 선택적으로 적용한다.

실험 결과

연구 질문

  • RQ1다중 겹치지 않는 이미지 영역에 초점을 맞추는 자기주의 메커니즘이 사람 재식별 정확도를 향상시킬 수 있는가?
  • RQ2고해상도 특징과 학습된 주의 격자를 조합한 이중 브랜치 아키텍처가 아키텍처의 복잡성 없이 특징의 구분 능력을 향상시킬 수 있는가?
  • RQ3기존의 주의 메커니즘과 비교할 때 제안된 SAG 모듈은 성능 및 다양한 데이터셋에 대한 일반화 능력에서 어떤가?
  • RQ4SAG 모듈을 최대 성능 향상을 위해 CNN 내에서 최적의 위치와 구성으로 배치할 수 있는가?
  • RQ5잔차 재정렬과 같은 후처리 기법과 SAG 모듈을 효과적으로 조합하여 정확도를 추가로 향상시킬 수 있는가?

주요 결과

  • DukeMTMC-ReID에서 SAG는 79.94% R1 및 60.88% mAP를 기록했으며, DCC를 제외하고는 대부분의 최신 기술 수준 메서드를 능가했다. DCC는 R1에서 0.36% 높은 성능을 보였다.
  • 잔차 재정렬(SAG+RR)을 적용한 결과, R1는 85.28%, mAP는 81.05%에 도달하여 기준 모델 및 대부분의 이전 방법을 크게 능가했다.
  • 제거 실험을 통해 SAG가 깊은 레이어에서 잘 일반화됨을 확인했으며, 성능 향상은 고수준 특징에서 가장 두드러졌다.
  • 주의 격자 시각화 결과 SAG가 얼굴, 배낭, 의복과 같은 구분 가능한 부분을 효과적으로 강조하고 배경 영역은 억제하는 것으로 나타났다.
  • 첫 번째부터 세 번째 잔차 블록에만 L2 정규화를 적용하면 정확도가 향상되었지만, 네 번째 블록에 적용하면 성능이 악화되어 레이어별 민감도가 있음을 시사했다.
  • SAG 모듈은 모듈식이며 기존 CNN 아키텍처에 아키텍처 변경 없이 쉽게 통합 가능하여 높은 실용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.