Skip to main content
QUICK REVIEW

[논문 리뷰] FBK-HUPBA Submission to the EPIC-Kitchens 2019 Action Recognition Challenge

Swathikiran Sudhakaran, Sérgio Escalera|arXiv (Cornell University)|2019. 06. 21.
Human Pose and Action Recognition참고 문헌 4인용 수 6
한 줄 요약

이 논문은 EPIC-Kitchens 2019 데이터셋에서 동작 인식을 위해 CNN-LSTA 및 HF-TSN 변종의 앙상블을 제안하며, 후기 및 초기 시계열 특징 집합, 다중 모odal 융합, 구조적 예측을 통해 동사-명사 간 의존성을 모델링한다. 앙상블은 S1에서 35.54%의 상위-1 정확도, S2에서 20.25%를 기록하여 상호 보완적인 모델링 접근법과 모델 앙상블의 효과를 입증한다.

ABSTRACT

In this report we describe the technical details of our submission to the EPIC-Kitchens 2019 action recognition challenge. To participate in the challenge we have developed a number of CNN-LSTA [3] and HF-TSN [2] variants, and submitted predictions from an ensemble compiled out of these two model families. Our submission, visible on the public leaderboard with team name FBK-HUPBA, achieved a top-1 action recognition accuracy of 35.54% on S1 setting, and 20.25% on S2 setting.

연구 동기 및 목표

  • 소형 물체 조작이 수반되는 에고세트릭 비디오에서의 세분화된 동작 인식 문제를 해결하기 위해.
  • 후기(LSTA) 및 초기(HF-TSN) 융합 전략을 통한 상호 보완적인 시계열 특징 집합 전략을 조합하여 정확도를 향상시키기 위해.
  • 동사 및 명사 클래스 간 상호의존성을 동작 수준의 편향 항목을 활용한 구조적 예측을 통해 모델링하기 위해.
  • 외관 및 운동 스트림을 융합하여 성능을 향상시키기 위해.
  • 다양한 아키텍처 및 학습 전략을 기반으로 한 모델 앙상블을 통해 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • ImageNet 및 Kinetics에서 미세조정된 ResNet-34, ResNet-50, InceptionV3 백본을 사용한 CNN-LSTA의 제안된 변종.
  • 출력 상태의 GRU 기반 집합 및 광학 흐름을 활용한 이중 스트림 아키텍처를 통한 다중 모달 융합을 통한 LSTA 개선.
  • 경량화된 시계열 게이팅을 통한 계층적 특징 집합을 구현한 HF-TSN 변종으로, ResNet-50 및 BNInception 백본을 사용.
  • 두 개의 선형 레이어를 통해 동작 점수를 개별 동작 수준의 편향 항목으로 적용하여 동사 및 명사 분류기의 구조적 예측 구현.
  • 다양한 모델의 예측 점수를 평균화하여 일반화 및 성능 향상을 도모하는 앙상블 평균화 구현.
  • 모든 모델 유형에서 시간적 풀링 및 후기 융합을 적용하여 프레임 수준의 특징을 동작 수준의 예측으로 집계.

실험 결과

연구 질문

  • RQ1후기 및 초기 시계열 특징 집합 전략이 에고세트릭 동작 인식에서 상호 보완적인 역할을 할 수 있는가?
  • RQ2외관 및 운동 스트림의 다중 모달 융합이 EPIC-Kitchens 데이터셋에서 정확도 향상에 기여하는가?
  • RQ3동작 수준의 편향 항목을 활용한 구조적 예측은 비현실적인 동사-명사 조합 예측을 줄일 수 있는가?
  • RQ4다양한 아키텍처 및 학습 전략을 기반으로 한 모델 앙상블이 성능 향상에 얼마나 기여하는가?
  • RQ5다양한 백본 네트워크(ResNet, Inception)가 세분화된 에고세트릭 동작 인식 성능에 미치는 영향은 어떠한가?

주요 결과

  • 모든 모델의 앙상블은 S1 설정에서 35.54%의 상위-1 정확도를 기록하여 개별 모델을 초월했다.
  • ResNet-34를 사용한 LSTA-GRU 변종은 32.14%의 상위-1 정확도를 기록했으며, 다중 모달 융합을 적용한 후 32.60%로 향상되었다.
  • HF-TSN-ResNet50 모델은 S2에서 17.38%의 상위-1 정확도를 기록했으며, 전체 앙상블을 적용한 후 20.25%로 향상되었다.
  • 다중 모달 융합은 LSTA 모델에 약 2%의 정확도 향상을 제공했으며, LSTA-2S 및 HF-TSN-BNInception를 앙상블한 결과 1%의 성능 향상이 이루어졌다.
  • 구조적 예측 접근법은 동작 수준의 편향 항목을 통한 의존성 모델링을 통해 비현실적인 동사-명사 조합의 예측을 감소시켰다.
  • 아키텍처 및 학습 전략의 다양성을 기반으로 한 모델 앙상블은 매우 효과적이었으며, 최종 앙상블은 S2에서 20.25%의 상위-1 정확도를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.