Skip to main content
QUICK REVIEW

[논문 리뷰] Appearance-Preserving 3D Convolution for Video-based Person Re-identification

Xinqian Gu, Hong Chang|arXiv (Cornell University)|2020. 07. 16.
Video Surveillance and Tracking Methods참고 문헌 36인용 수 12
한 줄 요약

이 논문은 3D 컨볼루션을 적용하기 이전에 프레임 간 특징 맵을 교차 픽셀 의미 유사도를 사용하여 정렬하는 Appearance-Preserving Module (APM)를 통합한 Appearance-Preserving 3D Convolution (AP3D)을 제안한다. 이를 통해 영상 기반 인물 재식별에서 외관 표현을 유지한다. AP3D는 추가적인 감독 없이도 RGB 모odal리티만을 사용하여 세 가지 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Due to the imperfect person detection results and posture changes, temporal appearance misalignment is unavoidable in video-based person re-identification (ReID). In this case, 3D convolution may destroy the appearance representation of person video clips, thus it is harmful to ReID. To address this problem, we propose AppearancePreserving 3D Convolution (AP3D), which is composed of two components: an Appearance-Preserving Module (APM) and a 3D convolution kernel. With APM aligning the adjacent feature maps in pixel level, the following 3D convolution can model temporal information on the premise of maintaining the appearance representation quality. It is easy to combine AP3D with existing 3D ConvNets by simply replacing the original 3D convolution kernels with AP3Ds. Extensive experiments demonstrate the effectiveness of AP3D for video-based ReID and the results on three widely used datasets surpass the state-of-the-arts. Code is available at: https://github.com/guxinqian/AP3D.

연구 동기 및 목표

  • 감지 오차 및 자세 변화로 인한 시간적 외관 비일치로 인해 영상 기반 인물 재식별에서 외관 표현이 열화되는 문제를 해결하기 위해.
  • 스пат리오토폴로지컬 의존성을 효과적으로 모델링하면서도 외관 품질을 유지하는 3D 컨볼루션 방법을 개발하기 위해.
  • 지표 대응(annotation) 정보가 필요 없이 픽셀 수준의 특징 맵 정렬을 가능하게 하는 모듈을 설계하기 위해.
  • 기존의 3D ConvNets(예: I3D, P3D)와 호환되는 플러그 앤 플레이 컴ponent를 만들기 위해.

제안 방법

  • AP3D는 Appearance-Preserving Module (APM)와 표준 3D 컨볼루션 커널으로 구성되며, 컨볼루션 이전에 APM이 적용된다.
  • APM은 인접한 특징 맵을 교차 픽셀 의미 유사도 기반으로 재구성하여 중심 특징 맵과 정렬함으로써 프레임 간 공간적 대응을 보장한다.
  • 비대칭 외관 상황(예: 부족한 신체 부위)에서 일치하지 않는 영역을 식별하기 위해 대조적 주의(Contrastive Attention)를 사용하며, 오류 전파를 억제하기 위해 학습된 주의 마스크를 적용한다.
  • APM은 무 supervision 방식으로 작동하며, 훈련 중에 정체성 감독 외에 추가적인 대응 annotation이 필요하지 않다.
  • 기존의 3D ConvNets에 표준 3D 컨볼루션 커널을 AP3D 블록으로 교체함으로써 쉽게 통합할 수 있다.
  • 유사도 가중 함수의 척도 인자 $ s $ 는 높은 유사도 픽셀의 영향을 균형 있게 조절하기 위해 튜닝되며, $ s=4 $ 가 최적의 성능을 낸다.

실험 결과

연구 질문

  • RQ1영상 ReID에서 3D 컨볼루션은 감지 오류 또는 자세 변화로 인한 시간적 비일치로 인해 외관 표현이 열화될 수 있는가?
  • RQ2학습된 유사도를 통한 픽셀 수준의 특징 맵 정렬은 지표 대응 정보가 없이도 3D 컨볼루션 성능 향상에 기여할 수 있는가?
  • RQ3제안된 AP3D 모듈은 I3D 및 P3D와 같은 다양한 백본 아키텍처에 일반화되는가?
  • RQ4AP3D는 광학 플로우나 복잡한 특징 매칭 전략 없이 RGB 입력만으로도 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ5대조적 주의의 통합은 비일치하는 특징 맵에서 비대칭 외관에 대한 강건성에 어떤 영향을 미치는가?

주요 결과

  • AP3D는 MARS 데이터셋에서 RGB 입력만으로 90.1% mAP를 달성하여 이전 모든 방법을 초월한다.
  • DukeMTMC-VideoReID에서 AP3D는 96.3% top-1 정확도와 95.6% mAP를 기록하여 새로운 SOTA를 수립한다.
  • Non-local 연결을 통합한 NL-AP3D는 MARS에서 90.7% mAP, DukeMTMC-VideoReID에서 96.1% mAP로 추가로 향상된다.
  • AP3D-ResNet-18는 거의 절반의 파라미터와 낮은 계산 비용을 가짐에도 불구하고 더 깊은 ResNet-34를 능가하는 성능을 보인다.
  • 제거 실험 결과, APM과 대조적 주의 모두 필수적임을 확인하였으며, 후자는 MARS에서 mAP를 1.5–2.0% 향상시킨다.
  • 유사도 가중 함수의 최적 척도 인자 $ s=4 $ 는 실험 전반에서 일관되게 최고의 성능을 낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.