Skip to main content
QUICK REVIEW

[논문 리뷰] A Hierarchical Multi-Modal Encoder for Moment Localization in Video Corpus

Bowen Zhang, Hexiang Hu|arXiv (Cornell University)|2020. 11. 18.
Multimodal Machine Learning Applications참고 문헌 39인용 수 19
한 줄 요약

이 논문은 활동넷 캡션 및 TVR 데이터셋에서 순간 위치 지정 성능을 향상시키기 위해 교차 모odal 주의를 사용하여 프레임 수준 및 클립 수준 표현을 공동으로 모델링하는 계층적 다중모odal 인코더인 HAMMER를 제안한다. 다중 작업 프레임워크를 통해 영상 검색, 시간적 위치 지정, 마스킹된 언어 모델링을 통합함으로써 HAMMER는 비정형 영상 코퍼스에서 순간 위치 지정 작업에서 최신 기술 수준의 성능을 달성하였으며, 긴 영상 길이에 대해 강건하고 평탄한 기반 모델 대비 정확도가 향상됨을 보여주었다.

ABSTRACT

Identifying a short segment in a long video that semantically matches a text query is a challenging task that has important application potentials in language-based video search, browsing, and navigation. Typical retrieval systems respond to a query with either a whole video or a pre-defined video segment, but it is challenging to localize undefined segments in untrimmed and unsegmented videos where exhaustively searching over all possible segments is intractable. The outstanding challenge is that the representation of a video must account for different levels of granularity in the temporal domain. To tackle this problem, we propose the HierArchical Multi-Modal EncodeR (HAMMER) that encodes a video at both the coarse-grained clip level and the fine-grained frame level to extract information at different scales based on multiple subtasks, namely, video retrieval, segment temporal localization, and masked language modeling. We conduct extensive experiments to evaluate our model on moment localization in video corpus on ActivityNet Captions and TVR datasets. Our approach outperforms the previous methods as well as strong baselines, establishing new state-of-the-art for this task.

연구 동기 및 목표

  • 자연어 쿼리를 사용하여 긴 비정형 영상에서 짧고 의미적으로 관련된 영상 세그먼트를 국소화하는 도전 과제를 해결하기 위해.
  • 정밀한 국소화를 위한 프레임 수준과 효율적 검색을 위한 클립 수준을 포함한 다중 시간 해상도에서 영상 이해를 향상시키기 위해.
  • 영상 검색, 순간 위치 지정, 마스킹된 언어 모델링을 공동 최적화하는 통합 모델을 개발하기 위해.
  • 다양한 모odal 간 계층적 표현 학습을 통해 영상 코퍼스 검색의 계산 복잡도를 줄이기 위해.
  • 불필요한 콘텐츠가 증가하는 긴 영상에 대해 강건성을 입증하기 위해, 여기서 평탄한 모델은 성능이 크게 떨어짐.

제안 방법

  • HAMMER는 두 수준의 계층적 인코더를 사용한다: 프레임 수준의 트랜스포머 인코더와 프레임 수준 특징 위에 구축된 클립 수준 인코더.
  • 텍스트 쿼리와 시각적/ASR 특징 간에 3단계의 교차 모달 주의를 적용한다—프레임, 클립, 전체 영상 수준에서 모달 간 정렬을 수행한다.
  • 시각적 특징은 3fps에서 I3D 및 ResNet-152 모델을 사용해 추출되며, 3072차원 벡터로 결합된다; ASR 임베딩은 RoBERTa에서 유도되며 매 1.5초마다 풀링된다.
  • 영상 검색, 시간적 국소화, 마스킹된 언어 모델링을 결합한 다중 작업 학습 목표를 사용하여 공동 표현 학습을 향상시킨다.
  • 다중 모달 융합을 위해 쿼리 표현은 시각적 특징과 ASR 특징 양쪽 모두에 주의를 기울이며, 이는 이후 연결되고 정규화되어 후속 작업에 사용된다.
  • 입력 시퀀스가 ActivityNet에서는 128프레임, TVR에서는 96프레임으로 제한된 채로, Adam 옵timizer를 사용해 엔드 투 엔드로 훈련되며, 선형 웜업과 코스인 감소 학습률 스케줄링을 적용한다.

실험 결과

연구 질문

  • RQ1평탄한 단일 해상도 모델 대비 계층적 다중모달 인코더가 비정형 영상 코퍼스에서 순간 위치 지정 성능을 향상시킬 수 있는가?
  • RQ2클립 수준 표현의 포함이 긴 영상에서 검색 및 국소화 성능을 어떻게 향상시키는가?
  • RQ3마스킹된 언어 모델링을 포함한 다중 작업 학습이 영상-텍스트 표현의 품질을 어느 정도 향상시키는가?
  • RQ4불필요한 콘텐츠가 많은 긴 영상에서 평탄한 모델이 성능이 저하되는 상황에서 모델의 성능은 어떠한가?
  • RQ5시각적 특징과 ASR 특징이 최종 국소화 정확도에 기여하는 상대적 기여도는 얼마인가?

주요 결과

  • HAMMER는 영상 검색, 단일 영상 내 순간 국소화, 영상 코퍼스 내 순간 국소화 작업에서 활동넷 캡션 및 TVR 데이터셋에서 최신 기술 수준의 성능을 달성하였다.
  • 특히 긴 영상에서 평탄한 기반 모델의 성능이 불필요한 콘텐츠로 인해 크게 떨어지는 상황에서 HAMMER는 강력한 기반 모델을 능가하는 성능을 보였다.
  • 계층적 설계 덕분에 다양한 영상 길이에서 강건한 성능을 보이며, 영상 길이가 증가함에 따라 정확도 저하가 최소한으로 발생하였다.
  • 제거 실험 결과, 클립 수준 표현이 정확한 국소화에 핵심적임을 확인하였으며, 클립 인코더가 종종 프레임 인코더가 범한 오류를 수정하는 데 기여하였다.
  • ASR 특징의 추가로 TVR에서 성능 향상이 있었으며, 특히 시각적 콘텐츠가 모호한 경우에 보완적인 언어적 맥락을 제공하여 성능 향상에 기여하였다.
  • 마스킹된 언어 모델링을 포함한 다중 작업 목표는 문맥 기반 표현의 품질을 향상시켜, 다양한 작업 간 일반화 능력을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.