Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-Supervised Video Moment Retrieval via Semantic Completion Network

Zhijie Lin, Zhou Zhao|arXiv (Cornell University)|2019. 11. 19.
Multimodal Machine Learning Applications참고 문헌 32인용 수 17
한 줄 요약

이 논문은 시간적 경계 레이블 대신 영상 수준의 애너테이션만 필요로 하는 약한 지도 학습 기반 비디오 모먼트 검색 프레임워크를 제안한다. 문맥 인식형 제안 생성 모듈을 갖춘 의미 완성 네트워크(semantic completion network, SCN)를 도입하며, 상위-K 제안 선택을 위한 이용-탐색 전략과, 핵심 쿼리 단어를 마스킹하여 재구성 손실과 보상 피드백을 통해 제안 점수를 개선하는 의미 완성 모듈을 포함한다. 이로 인해 전체 감독 없이도 ActivityCaptions와 Charades-STA에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Video moment retrieval is to search the moment that is most relevant to the given natural language query. Existing methods are mostly trained in a fully-supervised setting, which requires the full annotations of temporal boundary for each query. However, manually labeling the annotations is actually time-consuming and expensive. In this paper, we propose a novel weakly-supervised moment retrieval framework requiring only coarse video-level annotations for training. Specifically, we devise a proposal generation module that aggregates the context information to generate and score all candidate proposals in one single pass. We then devise an algorithm that considers both exploitation and exploration to select top-K proposals. Next, we build a semantic completion module to measure the semantic similarity between the selected proposals and query, compute reward and provide feedbacks to the proposal generation module for scoring refinement. Experiments on the ActivityCaptions and Charades-STA demonstrate the effectiveness of our proposed method.

연구 동기 및 목표

  • 비디오 모먼트 검색을 위한 정확한 시간적 경계를 애너테이션하는 데 드는 높은 비용과 어려움을 해결하기 위해.
  • 캡션과 같은 조잡한 영상 수준의 애너테이션만으로도 효과적으로 학습 가능한 약한 지도 학습 방법을 개발하기 위해.
  • 교차 모odal 컨텍스트와 의미 유사도 추정을 활용하여 제안 생성 및 점수 평가를 향상시키기 위해.
  • 의미 완성과 보상 기반 학습을 통한 피드백 루프를 통해 제안 신뢰도 점수를 정밀하게 개선하기 위해.

제안 방법

  • 비디오와 쿼리의 교차 모달 융합 표현을 사용하여 단일 패assing 내에서 모든 후보 제안을 점수 매기는 제안 생성 모듈.
  • 이용-탐색 알고리즘을 통해 상위-K 제안을 선택: 높은 신뢰도를 가진 제안은 NMS를 통해 선택하고, 나머지는 감소하는 확률로 무작위 선택하여 탐색을 장려.
  • 쿼리에서 중요한 단어(예: 명사, 동사)를 마스킹하고 각 제안의 시각적 컨텍스트를 사용해 재구성하는 의미 완성 모듈을 설계하며, 재구성 손실을 통해 의미 유사도를 측정.
  • 재구성 손실은 각 제안에 대한 보상을 계산하고, 이 보상은 상위 제안과의 순서를 유지하도록 유도하는 랭크 손실을 통해 제안 생성 모듈을 학습하는 데 사용된다.
  • 제안 생성 모듈과 의미 완성 모듈 간에 파라미터 공유를 적용하여 지식 전이를 향상시키고 모델 크기를 줄인다.
  • 랭크 손실과 재구성 손실을 결합한 다중 과제 학습 목표를 통해 제안 점수 평가와 의미 정렬을 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1약한 지도 학습 프레임워크가 시간적 경계 애너테이션 없이 영상 수준의 애너테이션만으로도 경쟁 가능한 비디오 모먼트 검색 성능을 달성할 수 있는가?
  • RQ2탐색 전략을 포함한 이용-탐색 선택 전략이 탐욕적 선택에 비해 모델 수렴과 성능 향상에 기여하는가?
  • RQ3시각적 컨텍스트를 활용한 마스킹된 쿼리의 의미 완성을 통해 의미 유사도를 효과적으로 추정하고 제안 점수를 안내할 수 있는가?
  • RQ4재구성 손실과 보상 피드백을 통한 의미 완성의 피드백이 제안의 신뢰도 점수 정확도를 향상시키는가?

주요 결과

  • 제안된 SCN 방법은 ActivityCaptions와 Charades-STA 모두에서 최신 기술 수준(SOTA) 성능을 달성하며, 기존의 약한 지도 학습 및 일부 완전 지도 학습 방법을 초월한다.
  • 무작위 선택을 제거한 SCN(w/o. rand)은 수렴 속도가 느리고 성능이 떨어지며, 초기 학습 단계에서의 탐색이 유용함을 확인한다.
  • 보상 피드백이 포함된 SCN(full)은 SCN(w/o. reward)보다 더 빠르게 수렴하고 더 우수한 성능을 내어, 보상 기반 정밀 조정 루프의 효과성을 입증한다.
  • 마스킹을 제거한 SCN(w/o. mask)는 전체 모델보다 성능이 열 劣하며, 정확한 의미 유사도 추정을 위해 마스킹된 쿼리 재구성 기법이 필수적임을 증명한다.
  • 파라미터 공유를 제거한 SCN(w/o. share)는 다소 열 劣한 성능과 더 높은 파라미터 수를 보이며, 파라미터 공유가 지식 전이와 효율성을 향상시킨다는 점을 확인한다.
  • 정성적 결과 분석을 통해 높은 신뢰도 점수를 가진 상위 제안이 정답과 잘 일치하며, 낮은 재구성 손실과 높은 IoU 간의 상관관계가 관찰되어 의미 정렬 메커니즘이 타당함을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.