Skip to main content
QUICK REVIEW

[논문 리뷰] Technical Report: Temporal Aggregate Representations

Fadime Şener, Dibyadip Chatterjee|arXiv (Cornell University)|2021. 06. 06.
Human Pose and Action Recognition참고 문헌 12인용 수 4
한 줄 요약

이 논문은 장기적인 비디오 이해를 위한 다중 군집 시간 집약 프레임워크를 제안하며, 확장 가능한 스퍼블릿 특징과 비국소 주의 메커니즘을 통해 최근 및 장기적인 비디오 맥락을 모델링한다. 행동 예측 및 인식 작업에서 최신 기술 성능을 달성하며, Breakfast 데이터셋에서 이전 방법들보다 최대 11.4% 높은 성능을 기록하고, RGB, 플로우, 객체, ROI 특징의 후기 융합을 통해 EPIC-KITCHENS-100에서 66.93%의 상위 5위 정확도를 달성한다.

ABSTRACT

This technical report extends our work presented in [9] with more experiments. In [9], we tackle long-term video understanding, which requires reasoning from current and past or future observations and raises several fundamental questions. How should temporal or sequential relationships be modelled? What temporal extent of information and context needs to be processed? At what temporal scale should they be derived? [9] addresses these questions with a flexible multi-granular temporal aggregation framework. In this report, we conduct further experiments with this framework on different tasks and a new dataset, EPIC-KITCHENS-100.

연구 동기 및 목표

  • 장기적인 비디오 이해의 과제를 다루기 위해, 정확한 행동 예측 및 인식을 위해 장기간의 시간 맥락을 고려한 추론이 필요하다.
  • 최근 대비 장기간 맥락을 고려한 다양한 시간 군집과 범위가 비디오 이해 작업에서 효과적으로 모델링될 수 있는지 탐구한다.
  • EPIC-KITCHENS-100 및 Breakfast과 같은 다양한 장기적인 비디오 벤치마크에서 민감한 다중 척도 시간 집약 프레임워크의 효과성을 평가한다.
  • 복잡한 장기 지속 활동을 모델링하는 데 있어 기존 방법들인 Timeception 및 PIC보다 제안된 프레임워크의 우수성을 입증한다.

제안 방법

  • 이 방법은 두 종류의 스퍼블릿 특징을 사용한다: 현재 프레임 이전 몇 초를 커버하는 '최근' 스퍼블릿과 최대 10분까지의 장기 맥락을 포괄하는 '스패닝' 스퍼블릿.
  • 다양한 시간 군집(예: 최근에 대해 K={2,3,5}, 스파닝에 대해 {7,5,3})에서 스퍼블릿 내 프레임 특징에 대해 최대 풀링을 통해 다중 척도 표현을 계산한다.
  • 시간 집약 블록(TAB)은 비국소 블록을 통해 각 최근 스퍼블릿을 모든 스파닝 스퍼블릿과 결합하여 장기 의존성과 다중 모odal 주의를 모델링한다.
  • 결합 블록(CB)은 최근 및 스파닝 특징 간의 관계를 학습하기 위해 비국소 연산을 적용하며, 여러 TAB의 출력을 연결하여 최종 예측을 수행한다.
  • EPIC-KITCHENS-100에서 예측의 정밀도를 향상시키기 위해 RGB, 옵티컬 플로우, 객체 검출 및 ROI 특징 등의 다중 모달리티 예측을 후기 융합한다.
  • 프레임워크는 Adam 옵timizer, 드롭아웃(0.3), 학습률 감소를 사용하며, 모든 분류가 아닌 헤드에 대해 512차원 선형 레이어를 사용한다.

실험 결과

연구 질문

  • RQ1장기적인 비디오 이해에서 다중 척도 간 시간 관계는 어떻게 효과적으로 모델링될 수 있는가?
  • RQ2장기적인 비디오에서 정확한 행동 예측 및 인식을 위해 필요한 최적의 시간 범위와 군집은 무엇인가?
  • RQ3Timeception 및 PIC와 같은 기존 방법과 비교해 다중 군집 시간 집약은 장기 지속 활동을 어떻게 더 잘 모델링하는가?
  • RQ4RGB, 플로우, 객체, ROI와 같은 다중 모달리티 특징은 egocentric 비디오 벤치마크인 EPIC-KITCHENS-100에서 성능을 얼마나 향상시키는가?
  • RQ5제안된 프레임워크는 태스크에 특화된 재학습 없이도 다양한 비디오 작업, 예를 들어 예측 및 인식 작업에 일반화될 수 있는가?

주요 결과

  • Breakfast 데이터셋에서 제안된 방법은 미세조정 없이 80.8%의 정확도를 달성하여 Timeception [5]보다 11.4% 높고, I3D 베이스라인보다 16.5% 높다.
  • I3D 특징을 미세조정한 후에는 89.8%의 정확도를 기록하여 PIC [6]를 3.1% 뛰어넘으며, 복잡한 장기 지속 활동에서 강력한 성능을 보였다.
  • EPIC-KITCHENS-100에서 모든 모달리티(RGB, 플로우, 객체, ROI)의 후기 융합은 검증 세트에서 66.93%의 상위 5위 정확도를 달성하여 개별 모달리티 결과보다 뚜렷하게 향상되었다.
  • RGB 전용 모델은 동사 및 명사 인식에서 가장 우수한 성능를 보였고, 융합은 尾부 클래스 및 미리보지 않은 참가자에 대해 성능 향상을 보이며 도메인 이동에 대한 강건성을 보였다.
  • 인식 작업에서 테스트 세트에서 상위 1위 정확도는 62.68%, 상위 5위 정확도는 64.05%를 기록하였고, 미리보지 않은 참가자에 대해 24.99%의 상위 5위 재현율을 기록하여 강력한 일반화 능력을 보였다.
  • 예측 작업에서 융합 모델은 테스트 세트에서 상위 5위 재현율 30.57%를 기록하였고, 미리보지 않은 참가자에 대해서는 25.26%를 기록하여 향후 행동 예측을 효과적으로 모델링하는 데 성공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.