Skip to main content
QUICK REVIEW

[논문 리뷰] Three Branches: Detecting Actions With Richer Features

Xia Jin, Jiajun Tang|arXiv (Cornell University)|2019. 08. 13.
Human Pose and Action Recognition참고 문헌 18인용 수 6
한 줄 요약

이 논문은 전역 영상 클립 특징, 단기 인간 영역 특징, 장기 시간적 특징을 SlowFast 백본과 장기 특징 은행(LFB)을 사용해 융합하는 세 가지 분지 프레임워크를 제안한다. 이는 행동 검출 성능을 햖थ한다. 이 방법은 Kinetics-700에서 21.59%의 오차율과 AVA에서 32.49%의 mAP를 기록하여, 2018년 AVA 제출물 전부를 10% 이상 초월하는 성능을 달성한다.

ABSTRACT

We present our three branch solutions for International Challenge on Activity Recognition at CVPR2019. This model seeks to fuse richer information of global video clip, short human attention and long-term human activity into a unified model. We have participated in two tasks: Task A, the Kinetics challenge and Task B, spatio-temporal action localization challenge. For Kinetics, we achieve 21.59% error rate. For the AVA challenge, our final model obtains 32.49% mAP on the test sets, which outperforms all submissions to the AVA challenge at CVPR 2018 for more than 10% mAP. As the future work, we will introduce human activity knowledge, which is a new dataset including key information of human activity.

연구 동기 및 목표

  • 다양한 수준의 영상 이해에서 더 풍부한 시공간 특징을 통합하여 행동 검출 성능을 향상시키기.
  • 장기 특징 은행(LFB)을 통해 장기 시간적 의존성을 통합하여 단기 모델링의 한계를 보완하기.
  • 전역 클립 수준 특징, 국소적 인간 외형 특징, 장기 운동 패턴을 융합하여 특징 표현을 향상시키기.
  • Kinetics-700 행동 인식 및 AVA 시공간 행동 정위치 기준에서 최신 기술 성능 달성하기.
  • 희귀 행동 인식을 향상시키기 위해 훈련 중에 포칼 손실을 사용하여 행동 데이터셋의 클래스 불균형 문제 해결하기.

제안 방법

  • 64프레임 클립에서 시공간 특징을 추출하기 위해 SlowFast 3D CNN 백본을 사용하며, 스로우 경로에는 8프레임, 패스트 경로에는 32프레임을 입력한다.
  • 핵심 프레임(각 초의 중간)에서만 인간 바운딩 박스를 검출하기 위해 Faster R-CNN과 ResNeXt-101-FPN 백본을 적용하며, 이는 단기 개인 특징을 추출하기 위해 사용된다.
  • 검출된 바운딩 박스를 사용해 클립 수준 특징에서 국소적 인간 특징을 추출하기 위해 3D 영역 관심(ROI) 풀링을 적용한다.
  • 시간 단위로 특징을 저장하고 검색함으로써 장기 시간적 의존성을 포착하기 위해 장기 특징 은행(LFB)을 활용한다.
  • 최종 분류기로의 행동 예측을 위해 전역 클립 특징, 단기 개인 특징, 장기 LFB 특징을 연결한다.
  • 희귀 행동(수영, 등반 등)에 특히 유리한 일반화를 위해 행동 인식의 클래스 불균형 문제를 해결하기 위해 포칼 손실을 사용한다.

실험 결과

연구 질문

  • RQ1전역, 국소적 인간, 장기 시간적 특징을 융합하면 복잡한 영상 데이터셋에서 행동 검출 성능을 향상시킬 수 있는가?
  • RQ2장기 특징 은행(LFB)을 통한 장기 시간 모델링을 통합할 경우 시공간 행동 정위치의 정확도에 어떤 영향을 미치는가?
  • RQ3Kinetics-700과 같은 대규모 데이터셋에서 사전 훈련하면 이후 행동 검출 성능 향상에 얼마나 기여하는가?
  • RQ4표준 교차 엔트로피 손실에 비해 세 분지 아키텍처는 클래스 불균형 행동 인식에 얼마나 효과적인가?
  • RQ5통합된 모델이 단기 외형, 운동, 장기 맥락을 효과적으로 통합하여 행동 검출 성능을 향상시킬 수 있는가?

주요 결과

  • 제안된 세 분지 모델은 Kinetics-700 테스트 세트에서 평균 21.59%의 상위 1위 및 상위 5위 오차율을 기록하여 대규모 행동 인식에서 뛰어난 성능을 입증한다.
  • AVA 데이터셋에서 모델은 32.49%의 mAP를 기록하여 2018년 AVA 챌린지의 모든 제출물보다 10% 이상 높은 성능을 달성한다.
  • Kinetics-700에서 사전 훈련된 SlowFast 네트워크를 테스트에 맞게 미세조정하면 성능 향상이著명하여 더 큰 규모의 사전 훈련의 이점이 있음을 시사한다.
  • 포칼 손실의 사용은 희귀 행동 클래스에서의 일반화 성능을 향상시켜 장꼬리 행동 인식에서의 강건성을 높인다.
  • 다양한 영상 입력에 걸쳐 예측을 안정화시키기 위해 다중 척도 테스트 증강과 수평 뒤집기 기법이 mAP 향상에 기여한다.
  • LFB 특징의 통합은 다수의 클립을 넘어서는 장기 시간 행동의 인식을 크게 향상시키며, 특히 복잡한 시나리오에서 유의미한 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.