Skip to main content
QUICK REVIEW

[논문 리뷰] 2rd Place Solutions in the HC-STVG track of Person in Context Challenge 2021

Yi-Yu, XinyingWang|arXiv (Cornell University)|2021. 06. 14.
Human Pose and Action Recognition참고 문헌 7인용 수 6
한 줄 요약

이 논문은 2021 Person in Context Challenge의 HC-STVG 트랙에서 2위를 차지한 솔루션으로, vIoU가 0.30025에 도달했다. 방법은 YOLOv5와 FastReID를 활용한 인식 및 재식별, 자연어 처리(NLP)를 통한 외관 특성(성별, 옷 색상, 유형) 추출, 다중 작업 학습을 통한 교차 모달 트랜스포머를 활용한 시공간 기반 지정을 포함한다. 이는 성별 분류 브랜치와 보조 튜브 자르기 손실을 포함한다.

ABSTRACT

In this technical report, we present our solution to localize a spatio-temporal person in an untrimmed video based on a sentence. We achieve the second vIOU(0.30025) in the HC-STVG track of the 3rd Person in Context(PIC) Challenge. Our solution contains three parts: 1) human attributes information is extracted from the sentence, it is helpful to filter out tube proposals in the testing phase and supervise our classifier to learn appearance information in the training phase. 2) we detect humans with YoloV5 and track humans based on the DeepSort framework but replace the original ReID network with FastReID. 3) a visual transformer is used to extract cross-modal representations for localizing a spatio-temporal tube of the target person.

연구 동기 및 목표

  • 자연어 기술 기반의 세부적인 인간 외관 특성 정보를 활용하여 트림되지 않은 영상에서 시공간 기반 지정 성능을 향상시키기 위해.
  • 튜브-문장 매칭에서의 클래스 불균형과 과적합 문제를 해결하기 위해 포칼 손실과 언어 인코더 고정을 적용하기 위해.
  • 외관 특징에 기반한 표현 학습을 향상시키기 위해 외관 특징에 감독되는 성별 분류 브랜치를 도입하기 위해.
  • 분류, 회귀, 자르기 작업을 동시에 수행하는 다중 작업 교차 모달 트랜스포머를 사용하여 고정밀도의 위치 지정을 달성하기 위해.

제안 방법

  • 정규 표현 매칭, 키워드 추출, 문법 분석을 포함한 자연어 처리 기법을 사용하여 텍스트 기술에서 인간 외관 특성(성별, 옷 색상, 유형)을 추출한다.
  • PySceneDetect를 사용하여 영상의 장면 경계에서 클립으로 분할하고, YOLOv5 검출 및 DeepSort 추적을 통해 튜브 제안을 생성하며, 기존 ReID 네트워크 대신 FastReID를 사용한다.
  • 시각과 언어에 대해 별도의 모odal 인코더를 갖춘 교차 모달 트랜스포머를 적용하고, 튜브 제안과 문장 쿼리 간의 정렬을 위해 교차 어텐션 메커니즘을 사용한다.
  • 시각 인코더 출력에 성별 분류 브랜치를 도입하여 외관 기반 표현 학습을 감독한다.
  • 전역 매칭을 위한 포칼 손실, 성별 및 프레임 분류를 위한 교차 엔트로피, 프레임 회귀를 위한 IoU 손실을 조합한 다중 작업 손실을 사용하며, 튜브 자르기 작업을 보조 과제로 설정한다.
  • 시험 중에 튜브 트랙에 가우시안 스무딩을 적용하고, 저품질 또는 겹치는 제안을 걸러낸다.

실험 결과

연구 질문

  • RQ1자연어 기반으로 추출한 인간 외관 특성은 트림되지 않은 영상에서 시공간 기반 지정 성능을 어떻게 향상시킬 수 있는가?
  • RQ2FastReID로 ReID 백본을 교체할 경우 HC-STVG 환경에서 튜브 추적 성능은 얼마나 향상되는가?
  • RQ3성별 및 프레임 수준 분류를 포함한 다중 작업 학습 프레임워크는 단순 분류 전용 모델 대비 위치 지정 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4포칼 손실과 언어 인코더 고정은 튜브-문장 매칭에서의 클래스 불균형과 과적합 문제를 어떻게 완화하는가?
  • RQ5추론 과정에 참여하지 않는 보조 튜브 자르기 브랜치가 최종 vIoU에 미치는 영향은 무엇인가?

주요 결과

  • 제거 실험 결과, 포칼 손실, 언어 인코더 고정, 성별 분류 손실을 조합함으로써 vIoU가 베이스라인 0.2775에서 0.30025로 상승하여 2위를 기록했다.
  • 성별 분류 브랜치의 추가로 모델 성능이 뚜렷이 향상되었으며, 이는 기존 모델에서 외관 특징가 충분히 활용되지 않았음을 시사한다.
  • 포칼 손실은 양성 및 음성 튜브-문장 쌍 간의 심각한 클래스 불균형 문제를 효과적으로 완화한다.
  • 학습 중 언어 인코더를 고정함으로써 과적합이 감소하고 일반화 성능이 향상되었으며, 성능 저하 없이도 효과를 보였다.
  • 추론 과정에 참여하지 않지만, 보조 과제로 학습된 튜브 자르기 브랜치는 전역 분류 정확도 향상에 기여한다.
  • 최종 모델은 vIoU 0.30025를 달성하여 HC-STVG 벤치마크에서 뛰어난 성능을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.