Skip to main content
QUICK REVIEW

[논문 리뷰] An Evaluation of Action Recognition Models on EPIC-Kitchens

Will Price, Dima Damen|arXiv (Cornell University)|2019. 08. 02.
Human Pose and Action Recognition참고 문헌 13인용 수 15
한 줄 요약

이 논문은 에고세트릭 EPIC-Kitchens 데이터셋에서 세 가지 행동 인식 모델—TSN, TRN, TSM—을 평가하며, 시간적 모델링 기능을 갖춘 모델(TSM 및 M-TRN)이 시간적 추론 기능이 없는 TSN보다 유의하게 뛰어난 성능을 보임을 입증한다. 주요 기여는 장기적 클래스 분포와 새로운 주방에서의 도메인 스플릿 문제와 같은 과제를 부각시키는 사전 학습된 모델 및 벤치마크 결과를 공개한 것이다.

ABSTRACT

We benchmark contemporary action recognition models (TSN, TRN, and TSM) on the recently introduced EPIC-Kitchens dataset and release pretrained models on GitHub (https://github.com/epic-kitchens/action-models) for others to build upon. In contrast to popular action recognition datasets like Kinetics, Something-Something, UCF101, and HMDB51, EPIC-Kitchens is shot from an egocentric perspective and captures daily actions in-situ. In this report, we aim to understand how well these models can tackle the challenges present in this dataset, such as its long tail class distribution, unseen environment test set, and multiple tasks (verb, noun and, action classification). We discuss the models' shortcomings and avenues for future research.

연구 동기 및 목표

  • 에고세트릭 EPIC-Kitchens 데이터셋에서 최신 행동 인식 모델—TSN, TRN, TSM—의 성능을 평가하기 위해.
  • 장기적 클래스 분포, 도메인 스플릿(보이는 주방 대비 보이지 않는 주방), 입력 모odal(_RGB_ 대비 플로우)이 모델 성능에 미치는 영향을 조사하기 위해.
  • 시간적 모델링, 백본 선택, 시간적 지원(세그먼트 수)이 인식 정확도에 미치는 영향을 평가하기 위해.
  • 행동 사전 지식(동사-명사 동시 발생)이 보이지 않는 환경에서 행동 분류 성능 향상에 기여하는지 평가하기 위해.
  • 재현 가능성 및 EPIC-Kitchens 랭킹리스트를 통한 벤치마킹을 위해 사전 학습된 모델 및 테스트 예측 결과를 공개하기 위해.

제안 방법

  • 각 비디오 클립이 8개의 동일한 부분으로 나뉘고, 각 세그먼트에서 스크립트가 추출되는 8세그먼트 샘플링 방식을 사용하여 통일된 환경에서 모델을 학습하고 평가한다.
  • TSN은 2D CNN 백본을 사용하여 세그먼트 수준 점수를 평균 또는 최대 풀링하여 처리하며, 세그먼트 간 시간적 모델링 기능이 없다.
  • TRN은 순서 민감한 관계 모듈을 통해 세그먼트 수준 특징를 처리하며, 상호 세그먼트 관계를 캡처하기 위해 단일 스케일 및 다중 스케일 변형(M-TRN)을 제공한다.
  • TSM은 2D CNN 백본을 수정하여 필터 응답을 시간 차원으로 이동시켜 네트워크 내부에서 시간적 모델링을 가능하게 한다.
  • 정확도 평가에는 세 가지 작업—동사, 명사, 행동(동사-명사 쌍) 분류—에 대해 상위 1위 및 상위 5위 정확도를 사용한다.
  • 행동 사전 지식은 라플라스 스무딩된 동시 발생 통계를 통해 예측을 재가중하여, 보이지 않는 주방에서의 제로샷 일반화 성능 향상에 기여한다.

실험 결과

연구 질문

  • RQ1TSN, TRN, TSM의 성능은 EPIC-Kitchens 데이터셋에서 동사, 명사, 행동 분류 작업의 상위 1위 및 상위 5위 정확도 측면에서 어떻게 나타나는가?
  • RQ2TRN 및 TSM를 통한 시간적 모델링은 TSN와 비교해 성능 향상에 얼마나 기여하는가? (시간적 모델링 기능이 없는 TSN 대비)
  • RQ3보이는 주방 테스트 세트 대비 보이지 않는 주방 테스트 세트에서 성능 저하가 발생하는 정도는 어떠한가? 이에 기여하는 요인은 무엇인가?
  • RQ4입력 모달(_RGB_ 대비 옵티컬 플로우)과 시간적 지원(세그먼트 수)이 인식 정확도에 어떤 영향을 미치는가?
  • RQ5행동 사전 지식(동사-명사 동시 발생)을 통합할 경우 성능 향상이 이루어지는가? 특히 보이지 않는 주방 분할에서의 성능 향상 여부는?

주요 결과

  • TSM 및 M-TRN는 모든 작업에서 TSN를 능가하며, M-TRN는 보이는 주방에서 행동 작업의 상위 1위 정확도가 4.75%이며, 보이지 않는 주방에서는 2.39%를 기록한다.
  • TSN는 세그먼트 간 점수를 평균화하는 방식으로 인해 미세한 행동을 구분하지 못하며, '놓다'(put)와 '들다'(take)와 같은 시간적 순서가 중요한 행동을 구분하지 못한다.
  • 플로우 모델은 시간적 지원 증가(최대 16세그먼트)에서 더 큰 이점을 얻는 반면, RGB 모델은 8세그먼트에서 포화 상태에 도달하며, TSM의 RGB 모델은 16세그먼트에서 성능 저하가 발생한다.
  • 행동 사전 지식은 M-TRN의 RGB 모달리티에서 보이지 않는 주방 테스트 세트에서 상위 1위 정확도를 최대 2.80%p 향상시켜 제로샷 일반화 성능 향상이 확인된다.
  • 모든 모델이 보이지 않는 주방 테스트 세트에서 상당한 성능 저하를 보이며, 에고세트릭 행동 인식에서 도메인 스플릿 문제의 과제를 부각시킨다.
  • RGB 모달리티를 사용한 TSM 모델은 보이는 주방에서 행동 작업의 상위 1위 정확도가 4.70%이며, 보이지 않는 주방에서는 2.39%를 기록한다. 보이지 않는 세트에서 행동 사전 지식 적용으로 0.82%p 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.