Skip to main content
QUICK REVIEW

[논문 리뷰] VLANet: Video-Language Alignment Network for Weakly-Supervised Video Moment Retrieval

Minuk Ma, Sunjae Yoon|arXiv (Cornell University)|2020. 08. 24.
Multimodal Machine Learning Applications참고 문헌 26인용 수 12
한 줄 요약

VLANet는 노이즈가 많은 제안을 줄이고 다중 방향성 교차모달 주의를 가능하게 하여 국소화 정확도를 향상시키는 약한 감독형 비디오 순간 검색 프레임워크를 제안한다. 이는 대체 제안 선택과 세분화된 쿼리 표현을 활용한 계단식 교차모달 주의를 사용하며, 종단 간 대비 학습을 통해 Charades-STA 및 DiDeMo에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Video Moment Retrieval (VMR) is a task to localize the temporal moment in untrimmed video specified by natural language query. For VMR, several methods that require full supervision for training have been proposed. Unfortunately, acquiring a large number of training videos with labeled temporal boundaries for each query is a labor-intensive process. This paper explores methods for performing VMR in a weakly-supervised manner (wVMR): training is performed without temporal moment labels but only with the text query that describes a segment of the video. Existing methods on wVMR generate multi-scale proposals and apply query-guided attention mechanisms to highlight the most relevant proposal. To leverage the weak supervision, contrastive learning is used which predicts higher scores for the correct video-query pairs than for the incorrect pairs. It has been observed that a large number of candidate proposals, coarse query representation, and one-way attention mechanism lead to blurry attention maps which limit the localization performance. To handle this issue, Video-Language Alignment Network (VLANet) is proposed that learns sharper attention by pruning out spurious candidate proposals and applying a multi-directional attention mechanism with fine-grained query representation. The Surrogate Proposal Selection module selects a proposal based on the proximity to the query in the joint embedding space, and thus substantially reduces candidate proposals which leads to lower computation load and sharper attention. Next, the Cascaded Cross-modal Attention module considers dense feature interactions and multi-directional attention flow to learn the multi-modal alignment. VLANet is trained end-to-end using contrastive loss which enforces semantically similar videos and queries to gather. The experiments show that the method achieves state-of-the-art performance on Charades-STA and DiDeMo datasets.

연구 동기 및 목표

  • 과도한 후보 제안과 굴곡진 쿼리 표현으로 인해 약한 감독형 비디오 순간 검색(wVMR)에서 주의가 흐릿해지는 문제를 해결하기 위해.
  • 시간 경계 애너테이션 없이 비디오 세그먼트와 자연어 쿼리 간의 다중모달 정렬을 향상시키기 위해.
  • 파ip라인의 초기 단계에서 높은 확률의 제안을 선별하여 계산 비용을 줄이고 국소화 정밀도를 향상시키기 위해.
  • 비디오와 텍스트 모달 간의 이중 방향성, 고밀도 상호작용을 다중 방향 주의 기반 메커니즘으로 모델링하기 위해.
  • 종단 간 대비 학습을 통해 기준 데이터셋에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 대체 제안 선택 모듈은 공동 임bedding 공간에서 쿼리와의 유사도를 기반으로 다중 스케일 세그먼트 그룹당 하나의 대표 제안을 선택하여 후보 제안 수를 줄이고 주의의 날카기성을 향상시킨다.
  • 세분화된 쿼리 표현은 모든 중간 GRU 히든 상태를 스택하여 최종 히든 상태만을 사용하는 것보다 더 풍부한 비디오 특징과의 상호작용을 가능하게 한다.
  • 계단식 교차모달 주의(CCA) 모듈은 각 모달 내에서(self-attention, V2V 및 Q2Q) 및 다중 방향 교차주의(Q2V, V2Q 및 주의 부여된 Q2V)를 적용하여 고밀도, 이중 방향 특징 상호작용을 모델링한다.
  • CCA 모듈은 수정된 self-attention 메커니즘과 교차주의 레이어의 계단식 조합을 사용하여 반복적 정렬을 통해 특징 표현을 정교화한다.
  • 대비 손실은 공동 임베딩 공간에서 의미적으로 긍정적인 비디오-쿼리 쌍을 군집화하고 부정적인 쌍을 분리하도록 유도하기 위해 종단 간 적용된다.
  • 모델은 종단 간 대비 학습을 통해 훈련되며, 시간 경계 애너테이션 없이도 텍스트 쿼리에서 유래한 약한 감독만을 활용한다.

실험 결과

연구 질문

  • RQ1대체 제안 선택을 통해 후보 제안 수를 줄이면 약한 감독형 비디오 순간 검색에서 주의의 날카기성과 국소화 정확도가 향상되는가?
  • RQ2다중 방향 교차모달 주의(상호 및 내부 모달 흐름 포함)는 단방향 주의보다 비디오와 텍스트 간의 정렬을 더 잘 향상시키는가?
  • RQ3중간 GRU 히든 상태를 포함한 세분화된 쿼리 표현은 관련 비디오 세그먼트를 국소화하는 데 모델의 능력을 향상시키는가?
  • RQ4약한 감독(텍스트 쿼리)만 존재할 때 대비 학습이 비디오 및 텍스트 임베딩을 얼마나 효과적으로 정렬하는가?
  • RQ5대체 제안 선택과 계단식 교차주의가 표준 벤치마크에서 성능 향상에 얼마나 기여하는가?

주요 결과

  • VLANet는 Charades-STA 및 DiDeMo 데이터셋 모두에서 최신 기술 수준의 성능을 달성하여 이전의 약한 감독형 방법들을 능가한다.
  • 제거 실험 결과, 대체 제안 선택 모듈을 제거할 경우 성능 저하가 가장 크게 발생하여 노이즈 감소 및 주의 품질 향상에서의 핵심적 역할을 확인한다.
  • 계단식 교차모달 주의 모듈은 자가 주의보다 더 큰 영향을 미쳐 성능 향상을 크게 향상시키며, 다중 방향 정렬의 중요성을 입증한다.
  • 학습 중 긍정 쌍의 유사도 점수가 약 0.9로 상승하고 부정 쌍은 낮게 유지되어 약 0.15로 효과적인 대비 학습을 확인한다.
  • 주의 맵의 시각화 결과, 쿼리의 핵심 단어에 해당하는 관련 비디오 순간에 높은 주의 가중치가 집중되어 다중모달 정렬이 성공적으로 이루어졌음을 시사한다.
  • 추론 시각화 결과, VLANet는 실제 비디오 세그먼트에서 관련 순간을 정확히 국소화함을 확인하였으며, 여러 예시에서 상위 예측이 정답과 겹침을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.