Skip to main content
QUICK REVIEW

[논문 리뷰] TransAction: ICL-SJTU Submission to EPIC-Kitchens Action Anticipation Challenge 2021

Xiao Jing Gu, Jianing Qiu|arXiv (Cornell University)|2021. 07. 28.
Topic Modeling참고 문헌 7인용 수 7
한 줄 요약

이 논문은 다중모달 특징(RGB, 플로우, 객체)을 시계열 자기주의, 교차 모odal 주의, 동반 주의를 통해 융합하는 계층적 Transformer 기반 모델인 TransAction을 제안한다. 이 모델은 EPIC-Kitchens 테스트 세트에서 13.39%의 평균 Top-5 리콜을 기록했으며, 모든 서브셋에서 동사 예측 부문 1위를 차지했고, 균형 손실을 통해 희귀 동작 클래스의 성능 향상을 달성했다.

ABSTRACT

In this report, the technical details of our submission to the EPIC-Kitchens Action Anticipation Challenge 2021 are given. We developed a hierarchical attention model for action anticipation, which leverages Transformer-based attention mechanism to aggregate features across temporal dimension, modalities, symbiotic branches respectively. In terms of Mean Top-5 Recall of action, our submission with team name ICL-SJTU achieved 13.39% for overall testing set, 10.05% for unseen subsets and 11.88% for tailed subsets. Additionally, it is noteworthy that our submission ranked 1st in terms of verb class in all three (sub)sets.

연구 동기 및 목표

  • 미래 행동 예측이 매우 불확실하고 다중모달적이며 과거 관찰의 이질적인 원인 효과를 가지는 에고세트릭 행동 예측 과제를 해결하기 위해.
  • 희귀 동작이 드물게 발생하는 에고세트릭 비디오 데이터셋에서 장기적인 동작 분포에 대한 일반화 성능 향상을 위해.
  • 통합 주의 프레임워크를 통해 동사와 명사 예측 간 상호 의존성을 모델링하기 위해.
  • RNN을 초월한 시간적 모델링을 위해 프레임 간 장거리 의존성을 캡처하는 Transformer의 능력을 활용하기 위해.
  • 강력하고 모듈화되며 확장 가능한 아키텍처를 사용해 2021년 EPIC-Kitchens 행동 예측 챌린지에서 최고 성능을 달성하기 위해.

제안 방법

  • 모델은 시계열 자기주의(TSA), 교차 모달 주의(CMA), 동반 주의(SA)를 포함한 세 가지 핵심 모듈을 갖춘 계층적 Transformer 아키텍처를 사용한다.
  • TSA는 프레임 간 장거리 시간적 의존성을 모델링하기 위해 사용된다.
  • CMA는 RGB, 옵티컬 플로우, 객체 검출 모달의 특징을 공유 주의 메커니즘을 통해 융합한다.
  • SA는 동사 및 명사 예측 헤드 간 이중 방향 특징 상호작용을 가능하게 하여 그들의 맥락적 의존성을 활용한다.
  • 프레임워크는 두 개의 블록으로 구성된 캐스케이드로, 각 블록이 순차적으로 TSA, CMA, SA를 적용하여 점진적으로 특징 표현을 정밀화한다.
  • 클래스 불균형을 완화하기 위해 빈도가 높은 클래스의 기울기 업데이트를 줄이기 위해 균형 손실이 적용된다.
  • 세 개의 TransAction 모델과 RULSTM-Fusion 베이스라인의 앙상블을 사용하여 테스트 세트에서의 일반화 및 성능 향상을 도모했다.

실험 결과

연구 질문

  • RQ1계층적 Transformer 기반 아키텍처가 에고세트릭 행동 예측에서 장거리 시간적 의존성을 효과적으로 모델링할 수 있는가?
  • RQ2교차 모달 주의는 RGB, 플로우, 객체 모달 간의 특징 융합을 어떻게 향상시켜 행동 예측 성능을 높이는가?
  • RQ3동사 및 명사 브랜치 간의 동반 주의는 특히 희귀 동작에 대해 예측 정확도를 얼마나 향상시키는가?
  • RQ4균형 손실이 에고세트릭 비디오 데이터셋에서 장기적인 불균형 동작 분포에 대한 모델 일반화 성능을 크게 향상시킬 수 있는가?
  • RQ5강력한 베이스라인(RULSTM-Fusion)과 TransAction을 앙상블하면 EPIC-Kitchens 테스트 세트에서 일관된 성능 향상이 이루어지는가?

주요 결과

  • 제안된 TransAction 모델은 2021년 EPIC-Kitchens 행동 예측 챌린지 전체 테스트 세트에서 13.39%의 평균 Top-5 리콜을 기록했다.
  • 미리보지 않은 서브셋에서는 10.05%의 평균 Top-5 리콜을 기록하여, 이전에 본 적 없는 동작에 대한 강력한 일반화 능력을 보였다.
  • 꼬리 서브셋에서는 11.88%의 평균 Top-5 리콜을 기록하여 희귀 및 장기적인 불균형 동작 클래스에서의 성능 향상을 확인했다.
  • 모든 세 테스트 서브셋에서 동사 예측 부문 1위를 차지했으며, 전체 테스트 세트에서 36.15%의 평균 Top-5 리콜을 기록했다.
  • 제거 실험 결과, 동반 주의 모듈을 제거할 경우 성능 저하가 가장 크게 발생하여, 이 모듈이 동사-명사 동시 예측에서 핵심적인 역할을 한다는 것을 입증했다.
  • TransAction와 RULSTM-Fusion 모델의 앙상블은 전체적으로 가장 뛰어난 성능을 보였으며, 특히 꼬리 동작 서브셋에서의 성능 향상이 두드러졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.