Skip to main content
QUICK REVIEW

[논문 리뷰] IAN: The Individual Aggregation Network for Person Search

Jimin Xiao, Yanchun Xie|arXiv (Cornell University)|2017. 05. 16.
Video Surveillance and Tracking Methods참고 문헌 10인용 수 9
한 줄 요약

이 논문은 개인 집합 네트워크(Individual Aggregation Network, IAN)를 제안하며, Faster R-CNN과 새로운 중심 손실을 사용하여 보행자 검출과 재식별을 공동 최적화하는 새로운 엔드 투 엔드 딥 러닝 프레임워크이다. 클래스 중심을 고려한 특징 학습을 통해 내부 개인 특징 변동을 최소화함으로써 IAN은 최신 기술 수준의 성능을 달성하여 CUHK-SYSU에서 77.23% mAP 및 80.45% 상위 1 정확도를 기록하며 이전 방법들보다 각각 1.7%와 1.85% 향상시켰다.

ABSTRACT

Person search in real-world scenarios is a new challenging computer version task with many meaningful applications. The challenge of this task mainly comes from: (1) unavailable bounding boxes for pedestrians and the model needs to search for the person over the whole gallery images; (2) huge variance of visual appearance of a particular person owing to varying poses, lighting conditions, and occlusions. To address these two critical issues in modern person search applications, we propose a novel Individual Aggregation Network (IAN) that can accurately localize persons by learning to minimize intra-person feature variations. IAN is built upon the state-of-the-art object detection framework, i.e., faster R-CNN, so that high-quality region proposals for pedestrians can be produced in an online manner. In addition, to relieve the negative effect caused by varying visual appearances of the same individual, IAN introduces a novel center loss that can increase the intra-class compactness of feature representations. The engaged center loss encourages persons with the same identity to have similar feature characteristics. Extensive experimental results on two benchmarks, i.e., CUHK-SYSU and PRW, well demonstrate the superiority of the proposed model. In particular, IAN achieves 77.23% mAP and 80.45% top-1 accuracy on CUHK-SYSU, which outperform the state-of-the-art by 1.7% and 1.85%, respectively.

연구 동기 및 목표

  • 자세, 조명 및 가림 등으로 인해 시각적 외형이 크게 변하는 실생활 감시 환경에서 보행자 바운딩 박스가 제공되지 않는 상황에서의 개인 검색 과제를 해결하기 위해.
  • 검출과 재식별을 공동 최적화하는 엔드 투 엔드 프레임워크를 개발하여 별도 최적화보다 강건성과 정확도를 향상시키기 위해.
  • 외형 변화로 인한 동일 정체성의 특징 변동을 줄여 특징의 밀도를 향상시키기 위해.
  • 딥 뉴럴 네트워크에서 드롭아웃과 중심 손실의 호환성을 조사하기 위해.

제안 방법

  • IAN은 전체 이미지 내에서 보행자를 위한 고품질의 온라인 영역 제안을 생성하기 위해 Faster R-CNN 객체 검출 프레임워크를 기반으로 한다.
  • 동일 정체성의 특징를 그 클래스 중심으로 끌어당김으로써 내부 클래스 특징 변동을 최소화하기 위해 새로운 중심 손실을 도입한다.
  • 중심 손실은 엔드 투 엔드 학습 파이프라인에 통합되어 검출 및 재식별의 공동 최적화를 가능하게 하며, 개선된 특징 밀도를 제공한다.
  • 분류를 위한 소프트맥스 손실과 내부 클래스 밀도를 위한 중심 손실의 조합을 사용하여 모델을 학습함으로써 특징의 분류 능력을 향상시킨다.
  • 호환성 연구 결과, 기울기 갈등으로 인해 드롭아웃은 중심 손실과 호환되지 않아 최종 모델에서 드롭아웃 레이어를 제거하였다.
  • VGGNet과 ResNet-101을 사용하여 CUHK-SYSU 및 PRW 벤치마크에서 평가하여 다양한 갤러리 크기와 과도한 조건에서도 강건함을 입증하였다.

실험 결과

연구 질문

  • RQ1분리된 검출 및 재식별 파ipeline에 비해 공동 엔드 투 엔드 학습 프레임워크가 개인 검색 정확도를 향상시킬 수 있는가?
  • RQ2중심 손실이 감시 영상에서 외형 변화로 인한 내부 개인 특징 변동을 얼마나 효과적으로 줄이는가?
  • RQ3Faster R-CNN에 중심 손실을 통합하면 실생활 개인 검색 시나리오에서 검출 및 재식별 성능이 향상되는가?
  • RQ4왜 이 맥락에서 드롭아웃은 중심 손실과 호환되지 않으며, 이는 모델 설계에 어떤 영향을 미치는가?
  • RQ5오염, 저해상도 및 큰 갤러리 크기와 같은 과도한 조건에서 제안된 IAN 모델은 어떻게 성능을 발휘하는가?

주요 결과

  • IAN은 CUHK-SYSU 데이터셋에서 77.23% mAP 및 80.45% 상위 1 정확도를 기록하여 이전 최신 기술 수준의 성능보다 각각 1.7%와 1.85% 향상시켰다.
  • PRW 데이터셋에서 IAN은 23.00% mAP 및 61.85% 상위 1 정확도를 기록하여 DPM-Alex+IDE det에 비해 상위 1 정확도에서 14퍼센트 포인트 이상 향상되었다.
  • 큰 갤러리 크기(4,000)에서 IAN은 ResNet-101을 사용하여 E2E-PS [16]보다 10퍼센트 포인트 이상의 mAP 향상을 기록하여 뛰어난 확장성과 성능을 입증하였다.
  • 저해상도 및 가림 서브셋에서 IAN은 각각 52.60% mAP 및 53.02% mAP를 기록하여 E2E-PS [16]보다 뚜렷한 성능 우위를 보였다.
  • 제거된 드롭아웃 레이어가 성능 향상에 기여함을 확인한 추론 분석을 통해 IAN 프레임워크에서 드롭아웃과 중심 손실 간의 호환성 부재를 검증하였다.
  • 다양한 벤치마크와 과도한 조건에서 일관된 슈퍼리어리티를 보이며 중심 손실이 내부 클래스 밀도 향상에 효과적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.