Skip to main content
QUICK REVIEW

[논문 리뷰] HMS: Hierarchical Modality Selection for Efficient Video Recognition.

Zejia Weng, Zuxuan Wu|arXiv (Cornell University)|2021. 04. 20.
Human Pose and Action Recognition참고 문헌 51인용 수 6
한 줄 요약

HMS는 효율적인 비디오 인식을 위한 계층적 모odal 선택 프레임워크를 제안하며, 저비용 음성 특징을 기본으로 하여 필요할 때에만 고비용 시각적 또는 운동적 모달을 동적으로 활성화한다. 게이팅 메커니즘을 갖춘 세 개의 LSTMs를 사용함으로써 HMS는 FCVID와 ActivityNet에서 정확도를 향상시키면서도 계산량을 줄였다. 입력에 따라 적응적인 모달 융합을 통해 비디오 인식의 효율성을 높인다.

ABSTRACT

Videos are multimodal in nature. Conventional video recognition pipelines typically fuse multimodal features for improved performance. However, this is not only computationally expensive but also neglects the fact that different videos rely on different modalities for predictions. This paper introduces Hierarchical Modality Selection (HMS), a simple yet efficient multimodal learning framework for efficient video recognition. HMS operates on a low-cost modality, i.e., audio clues, by default, and dynamically decides on-the-fly whether to use computationally-expensive modalities, including appearance and motion clues, on a per-input basis. This is achieved by the collaboration of three LSTMs that are organized in a hierarchical manner. In particular, LSTMs that operate on high-cost modalities contain a gating module, which takes as inputs lower-level features and historical information to adaptively determine whether to activate its corresponding modality; otherwise it simply reuses historical information. We conduct extensive experiments on two large-scale video benchmarks, FCVID and ActivityNet, and the results demonstrate the proposed approach can effectively explore multimodal information for improved classification performance while requiring much less computation.

연구 동기 및 목표

  • 모든 모달을 조건 없이 융합하는 전통적인 다중모달 비디오 인식 파이프라인의 높은 계산 비용을 해결하기 위해.
  • 다른 비디오가 정확한 예측을 위해 서로 다른 모달에 의존한다는 점을 인지하여, 균일한 모달 융합을 전제로 하는 기존의 가정에 도전하기 위해.
  • 비용이 많이 드는 시각적 및 운동적 특징을 유익할 때에만 선택적으로 활성화하는 동적이고 효율적인 메커니즘을 설계하기 위해.
  • 다중모달 비디오 인식에서 계산 오버헤드를 크게 줄이면서도 높은 분류 성능를 유지하기 위해.
  • 입력에 따라 필요한 모달 결정을 실시간으로 내릴 수 있는 게이팅 기반의 계층적 LSTM 기반 아키텍처를 제안하기 위해.

제안 방법

  • HMS는 세 개의 LSTMs를 사용하는 계층적 LSTM 아키텍처를 사용한다: 저비용 음성 모달용 하나, 고비용 외관 및 운동 모달용 각각 하나.
  • 고비용 모달 LSTMs는 하위 수준의 특징과 이전 상태의 맥락을 받아들이는 게이팅 모듈을 포함하여, 해당 모달을 활성화할지 또는 이전의 은닉 상태를 재사용할지 결정한다.
  • 게이팅 메커니즘은 입력에 따라 동적으로 모달을 선택함으로써, 모든 입력에 대해 불필요한 계산을 방지한다.
  • 프레임 단위로 순차적이고 순환적으로 처리되는 프레임워크로, 각 타임스텝에서 모달 결정이 이루어진다.
  • 기본적으로 음성 모달이 사용되며, 게이팅 메커니즘이 더 나은 예측에 기여할 경우에만 시각적 또는 운동적 특징이 활성화된다.
  • 계층적 설계 덕분에 장기적인 의존성을 유지하면서도, 필요할 때에만 고비용 모달을 선택적으로 통합할 수 있다.

실험 결과

연구 질문

  • RQ1동적 모달 선택 메커니즘이 비디오 이해에서 정확도를 희생시키지 않고 계산 비용을 줄일 수 있는가?
  • RQ2다양한 비디오 콘텐츠에 걸쳐 음성 전용 특징이 비디오 인식의 강력한 베이스라인으로 기능할 수 있는가?
  • RQ3게이팅 기반의 계층적 LSTM이 입력에 따라 필요한 외관 및 운동 특징을 얼마나 효과적으로 적응적으로 선택하는가?
  • RQ4제안된 방법이 대규모 벤치마크에서 정확도와 효율성 측면에서 고정된 다중모달 융합 기반 모델을 능가하는가?
  • RQ5입력에 따라 가장 정보가 많은 모달을 학습함으로써 모델이 다양한 비디오 카테고리로 일반화할 수 있는가?

주요 결과

  • HMS는 표준 다중모달 융합 방법보다 훨씬 적은 계산량을 사용하면서도 FCVID와 ActivityNet에서 최신 기준(SOTA) 정확도를 달성한다.
  • 입력 콘텐츠에 따라 고비용 시각적 및 운동적 특징을 필요할 때에만 선택적으로 활성화함으로써 계산 비용을 줄였다.
  • FCVID에서 HMS는 전체 다중모달 기반 모델 대비 40% 감소한 FLOPs를 기록하며 경쟁적인 성능를 확보했다.
  • ActivityNet에서 HMS는 동적 모달 선택 덕분에 추론 시간과 모델 복잡도를 줄였지만 높은 mAP 성능를 유지했다.
  • 제거 실험 결과, 게이팅 메커니즘이 고비용 모달을 사용할지 또는 건너뛸지 효과적으로 식별함으로써 성능 저하 없이 효율성을 향상시켰다.
  • 음성 전용 기반 모델의 성능이 높게 나타나, 계층적 프레임워크에서 음성을 기본 모달로 선택한 것이 타당함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.