Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Granularity Reference-Aided Attentive Feature Aggregation for Video-based Person Re-identification

Zhizheng Zhang, Cuiling Lan|arXiv (Cornell University)|2020. 03. 27.
Video Surveillance and Tracking Methods참고 문헌 42인용 수 13
한 줄 요약

이 논문은 영상 기반 인물 재식별을 위한 다중 군집도 기반 참조 보조 주의적 특징 집합 모듈인 MG-RAFA를 제안한다. 이는 각 시공간 특징 노드와 소수의 대표적 참조 노드(S-RFNs) 간의 관계를 모델링하여 전역 주의를 학습하면서, 다양한 군집도에서 계층적 의미를 포착한다. 이 방법은 세 가지 벤치마크 데이터셋에서 최신 기술 성능을 달성하였으며, 기존 방법 대비 Mars에서 mAP가 5.1% 향상되고 iLIDS-VID에서 2.3% 향상되었다.

ABSTRACT

Video-based person re-identification (reID) aims at matching the same person across video clips. It is a challenging task due to the existence of redundancy among frames, newly revealed appearance, occlusion, and motion blurs. In this paper, we propose an attentive feature aggregation module, namely Multi-Granularity Reference-aided Attentive Feature Aggregation (MG-RAFA), to delicately aggregate spatio-temporal features into a discriminative video-level feature representation. In order to determine the contribution/importance of a spatial-temporal feature node, we propose to learn the attention from a global view with convolutional operations. Specifically, we stack its relations, i.e., pairwise correlations with respect to a representative set of reference feature nodes (S-RFNs) that represents global video information, together with the feature itself to infer the attention. Moreover, to exploit the semantics of different levels, we propose to learn multi-granularity attentions based on the relations captured at different granularities. Extensive ablation studies demonstrate the effectiveness of our attentive feature aggregation module MG-RAFA. Our framework achieves the state-of-the-art performance on three benchmark datasets.

연구 동기 및 목표

  • 영상 기반 인물 재식별에서 반복적, 가림, 운동 흐림 현상이 발생하는 프레임을 줄이기 위해 더 구분력 있는 영상 수준 표현을 학습하는 것.
  • 국소적 또는 순차적 주의 메커니즘의 한계를 극복하기 위해 통합적 시각에서 전역 시공간 관계를 모델링함으로써 특징 집합을 향상시키는 것.
  • 거시적에서 미세적까지 다양한 군집도에서 계층적 의미를 포착하여 더 강력하고 적응적인 특징 학습을 가능하게 하는 것.
  • 모든 특징 대신 소수의 대표적 참조 특징 노드(S-RFNs)를 사용하여 계산 복잡도와 최적화 난이도를 감소시키는 것.
  • 효율적이고 확장 가능한 주의 기반 특징 집합을 통해 표준 영상 재식별 벤치마크에서 최신 기술 성능을 달성하는 것.

제안 방법

  • 각 특징 노드와 대표적 참조 특징 노드 집합(S-RFNs) 간의 관계를 기반으로 주의 가중치를 계산하는 다중 군집도 기반 참조 보조 주의적 특징 집합(MG-RAFA) 모듈을 제안한다.
  • 각 특징 노드와 S-RFNs 간의 쌍별 상관관계와 노드 자체의 특징을 스택하여 컨볼루션 연산을 통해 주의 가중치를 추론함으로써 전역 시각을 확보한다.
  • 다양한 공간 해상도(예: 16×8, 8×4, 4×2, 2×1)에서 관계를 학습하여 거시적에서 미세적 영역까지 의미를 포착하는 다중 군집도 주의를 도입한다.
  • 내용 중복을 압축하고 전역 관계 모델링을 단순화하기 위해 소수이지만 대표적인 S-RFN 집합을 구성함으로써 계산 비용을 감소시키면서도 구조적 정보를 유지한다.
  • 학습 가능한 주의 메커니즘을 활용하여 불필요한 특징(예: 가려진 영역 또는 중복 영역)을 적극적으로 억제하고 구분력 있는 특징을 강화한다.
  • MG-RAFA 모듈을 영상 재식별 파이프라인에 적용한 후 시공간 평균 풀링을 수행하여 단일 영상 수준 임bedding을 생성한다.

실험 결과

연구 질문

  • RQ1어떻게 효과적으로 영상 재식별에서 전역 시공간 의존성을 모델링하여 중복을 줄이고 특징의 구분력을 향상시킬 수 있는가?
  • RQ2대표적 참조 특징 노드(S-RFNs) 집합이 계산 복잡도를 줄이면서도 전역 구조적 패턴을 효과적으로 포착할 수 있는가?
  • RQ3다양한 공간 해상도에서의 다중 군집도 주의 학습이 계층적 의미를 포착함으로써 성능 향상에 기여하는가?
  • RQ4MG-RAFA는 장거리 맥락을 모델링할 때 비국소 블록과 기타 주의 메커니즘에 비해 어떻게 비교되는가?
  • RQ5제안된 다중 군집도 설계는 MG-RAFA 외의 다른 주의 메커니즘으로도 일반화 가능한가?

주요 결과

  • MG-RAFA는 Mars, iLIDS-VID, PRID2011의 세 가지 주요 영상 재식별 벤치마크에서 최신 기술 성능을 달성한다.
  • Mars 데이터셋에서 MG-RAFA는 이전 최신 기술 성능을 기록한 STA 대비 mAP를 5.1% 향상시켜 88.6% mAP를 달성한다.
  • iLIDS-VID에서 MG-RAFA는 98.0% Rank-1 정확도를 기록하여 두 번째로 좋은 방법보다 2.3% 높다.
  • PRID2011에서 MG-RAFA는 99.7% mAP와 95.9% Rank-1을 기록하여 두 번째로 좋은 방법보다 Rank-1에서 0.4% 높다.
  • RGA-SC, SE, CBAM에 이 다중 군집도 설계를 적용했을 때 mAP가 각각 1.5%, 1.4%, 1.7% 향상되었다.
  • 제거 실험 결과, S-RFNs와 다중 군집도 설계 모두 성능 향상에 기여함을 확인하였으며, MG-RAFA는 비국소 블록보다 mAP에서 2.4% 높은 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.