Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-shot Temporal Event Localization: a Benchmark

Xiaolong Liu, Yao Hu|arXiv (Cornell University)|2020. 12. 17.
Human Pose and Action Recognition참고 문헌 87인용 수 5
한 줄 요약

이 논문은 전문 편집된 드라마 영상에서 빈번한 샷 컷이 존재하는 716시간 분량의 영상에 31,477개의 이벤트 인스턴스를 포함한 MUSES 데이터셋을 제안하며, 새로운 벤치마크 과제인 멀티샷 타임스탬프 이벤트 로컬라이제이션(MOTEL)을 도입한다. 현재 최고 성능을 기록하는 행동 로컬라이제이션 방법은 IoU=0.5일 때 뿐다. 이는 인스턴스 내 변동성으로 인한 과제의 어려움을 시사하며, 단순한 베이스라인 방법이 18.9% mAP까지 향상시켜 멀티샷 이벤트에 특화된 방법의 필요성을 입증한다.

ABSTRACT

Current developments in temporal event or action localization usually target actions captured by a single camera. However, extensive events or actions in the wild may be captured as a sequence of shots by multiple cameras at different positions. In this paper, we propose a new and challenging task called multi-shot temporal event localization, and accordingly, collect a large scale dataset called MUlti-Shot EventS (MUSES). MUSES has 31,477 event instances for a total of 716 video hours. The core nature of MUSES is the frequent shot cuts, for an average of 19 shots per instance and 176 shots per video, which induces large intrainstance variations. Our comprehensive evaluations show that the state-of-the-art method in temporal action localization only achieves an mAP of 13.1% at IoU=0.5. As a minor contribution, we present a simple baseline approach for handling the intra-instance variations, which reports an mAP of 18.9% on MUSES and 56.9% on THUMOS14 at IoU=0.5. To facilitate research in this direction, we release the dataset and the project code at https://songbai.site/muses/ .

연구 동기 및 목표

  • 전문 편집된 TV 시리즈나 영화에서 액션이 빈번한 편집으로 인해 여러 샷에 걸쳐 퍼져 있는 이벤트를 로컬라이징하는 실제 세계의 과제를 해결하기 위해.
  • 단일 샷 또는 사용자 생성 영상 환경과는 다름없이, 멀티샷 타임스탬프 이벤트 로컬라이제이션이라는 새로운 벤치마크 과제를 도입하기 위해.
  • 이 도메인에서의 연구를 가능하게 하기 위해 광범위한 샷 컷과 멀티샷 이벤트 인스턴스를 포함한 대규모 고품질 데이터셋(MUSES)을 수집하고 공개하기 위해.
  • 이 새로운 벤치마크에서 현재 최고 성능의 방법들을 평가하여, 샷 컷으로 인한 인스턴스 내 변동성으로 인한 성능 저하를 드러내기 위해.
  • 멀티샷 이벤트 로컬라이제이션의 과제를 효과적으로 다룰 수 있도록 전용으로 설계된 방법의 잠재력을 입증하기 위해 단순한 베이스라인 방법을 제공하기 위해.

제안 방법

  • MUSES 데이터셋은 전문 편집된 드라마 영상에서 유래하였으며, 평균적으로 각 인스턴스당 19개의 샷을 포함하는 다중 샷 이벤트 인스턴스로 구성된다.
  • 이벤트 인스턴스는 여러 샷에 걸쳐 펼쳐지는 유기적인 행동이나 사건으로 정의되며, 샷 경계는 명시적으로 표기된다.
  • 다양한 길이(10~190초)의 슬라이딩 윈도우 프로포절을 사용하고, 1D CNN 기반 이진 분류기를 통해 점수를 매기며, 0.8 임계값을 사용한 NMS를 적용하는 베이스라인 방법을 제안한다.
  • 프로포절의 경계를 50% 확장한 후 RoI 풀링을 통해 특징을 추출하여 맥락 정보를 포괄한다.
  • 네 개의 브랜치(커널 크기 {1×3, 3×3, 3×3, 3×3}, 유닛 크기 {3, 3, 6, 9})를 가진 다중 척도 시간 집약 모듈을 사용하여 장거리 의존성을 모델링한다.
  • 교차 엔트로피(분류), 허프 링크 손실(완전성), Smooth L1 손실(경계 회귀)을 조합한 가중치 손실 함수를 사용하며, 각각의 가중치는 1, 0.5, 0.5이다.
Figure 2: Examples of multi-shot events. In each row, we show three consecutive shots in an instance and select two frames per shot for illustration. The scissor icons indicate the shot boundaries.
Figure 2: Examples of multi-shot events. In each row, we show three consecutive shots in an instance and select two frames per shot for illustration. The scissor icons indicate the shot boundaries.

실험 결과

연구 질문

  • RQ1현재 최고 성능의 타임스탬프 행동 로컬라이제이션 방법들이 빈번한 샷 컷이 존재하는 멀티샷 이벤트에 얼마나 잘 일반화되는가?
  • RQ2시점 변화, 초점 깊이 변화, 가림 현상 등으로 인한 인스턴스 내 변동성이 이벤트 로컬라이제이션 성능에 어떤 영향을 미치는가?
  • RQ3단순한 베이스라인 방법이 멀티샷 이벤트 로컬라이제이션의 과제, 특히 샷 간 장거리 시간 의존성을 포괄하는 데 효과적으로 대응할 수 있는가?
  • RQ4MUSES 벤치마크는 실제 전문 편집 영상 콘텐츠에서 기존 모델의 한계를 어느 정도 드러내는가?
  • RQ5사용자 생성 영상 벤치마크(예: THUMOS14)에서 학습한 모델의 성능이 MUSES의 더 복잡한 멀티샷 환경으로 이식될 수 있는가?

주요 결과

  • 최고 성능 방법인 P-GCN은 MUSES 데이터셋에서 IoU=0.5일 때 뿐다. 이는 빈번한 샷 컷으로 인한 인스턴스 내 변동성으로 인한 성능 저하를 시사한다.
  • 제안된 베이스라인 방법은 IoU=0.5일 때 MUSES에서 mAP를 18.9%까지 향상시켜 멀티샷 아키텍처에 특화된 모델링이 성능 향상에 기여함을 입증한다.
  • THUMOS14 벤치마크에서는 동일한 베이스라인 방법이 IoU=0.5일 때 56.9% mAP를 기록하여 기존 벤치마크로의 우수한 일반화 능력을 보여준다.
  • MUSES 데이터셋은 총 716시간의 영상에 걸쳐 31,477개의 이벤트 인스턴스를 포함하며, 평균적으로 각 인스턴스당 19개의 샷, 영상당 176개의 샷을 포함하여 높은 샷 컷 빈도를 반영한다.
  • 현재의 방법들은 샷 간 경계 검출에 어려움을 겪고 있으며, 이는 프로포절 생성 시 낮은 재현율로 나타나, 새로운 접근 방식이 필요함을 시사한다.
  • https://songbai.site/muses/에서 MUSES 데이터셋과 코드를 공개하여 향후 멀티샷 타임스탬프 이벤트 로컬라이제이션 분야의 연구 기반을 마련한다.
Figure 3: Number of instances per category for MUSES. Note that the Y-axis is in logarithm scale.
Figure 3: Number of instances per category for MUSES. Note that the Y-axis is in logarithm scale.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.