Skip to main content
QUICK REVIEW

[논문 리뷰] Regularized Two-Branch Proposal Networks for Weakly-Supervised Moment Retrieval in Videos

Zhu Zhang, Zhijie Lin|arXiv (Cornell University)|2020. 08. 19.
Multimodal Machine Learning Applications참고 문헌 44인용 수 8
한 줄 요약

이 논문은 언어 인식 필터를 활용하여 내부 샘플 대비 학습을 위한 향상되고 억제된 비디오 스트림을 생성함으로써 약한 감독 비디오 순간 검색을 위한 정규화된 이중 브랜치 제안 네트워크(RTBPN)를 제안한다. 두 브랜치 간의 파라미터 공유를 통해 양성 및 타당한 음성 제안을 생성하고, 제안 정규화를 적용함으로써 RTBPN은 ActivityCaption 및 Charades-STA 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Video moment retrieval aims to localize the target moment in an video according to the given sentence. The weak-supervised setting only provides the video-level sentence annotations during training. Most existing weak-supervised methods apply a MIL-based framework to develop inter-sample confrontment, but ignore the intra-sample confrontment between moments with semantically similar contents. Thus, these methods fail to distinguish the target moment from plausible negative moments. In this paper, we propose a novel Regularized Two-Branch Proposal Network to simultaneously consider the inter-sample and intra-sample confrontments. Concretely, we first devise a language-aware filter to generate an enhanced video stream and a suppressed video stream. We then design the sharable two-branch proposal module to generate positive proposals from the enhanced stream and plausible negative proposals from the suppressed one for sufficient confrontment. Further, we apply the proposal regularization to stabilize the training process and improve model performance. The extensive experiments show the effectiveness of our method. Our code is released at here.

연구 동기 및 목표

  • 기존의 약한 감독 방법이 상호 샘플 대비 학습에만 집중하고 내부 샘플 간 의미적으로 유사한 순간들 사이의 대비 학습을 간과한다는 한계를 해결한다.
  • 동일한 비디오 내에서 목표 순간과 타당한 음성 순간 간의 차이를 명시적으로 모델링하여 정렬 정확도를 향상시킨다.
  • 공유된 이중 브랜치 아키텍처를 통해 동시에 상호 샘플 및 내부 샘플 대비 학습을 활용하는 프레임워크를 개발한다.
  • 저품질의 음성 제안을 방지하기 위해 제안 정규화를 적용하여 학습을 안정화하고 성능을 향상시킨다.
  • 비용이 많이 드는 시간 경계 주석 대신 비디오 수준 문장 주석만을 사용하여 효과적인 약한 감독 학습을 가능하게 한다.

제안 방법

  • 텍스트 특징을 학습된 클러스터 중심으로 매핑하기 위해 NetVALD를 활용한 언어 인식 필터를 설계하여 의미적 중간 공간을 생성한다.
  • 입력 문장과 관련된 프레임을 강조하는 강화된 비디오 스트림과 이를 억제하는 억제된 스트림을 생성한다.
  • 공유된 이중 브랜치 제안 모듈을 구현: 한 브랜치는 강화된 스트림에서 양성 제안을 생성하고, 다른 브랜치는 억제된 스트림에서 타당한 음성 제안을 생성한다.
  • 점수 분포 기반의 중심 기반 제안 전략을 사용하여 다양하고 관련성이 높은 제안을 샘플링함으로써 다양한 제안을 보장한다.
  • 일관되지 않은 제안 점수를 방지하기 위해 제안 정규화를 적용하여 학습을 안정화하고 일반화 능력을 향상시킨다.
  • 가장 관련성이 높은 순간과 주어진 문장 간의 정렬을 장려하는 MIL 기반 목적 함수를 사용하여 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1의미적으로 유사한 순간들 사이의 내부 샘플 대비 학습이 약한 감독 비디오 순간 검색에 개선을 가져올 수 있는가?
  • RQ2모델의 분류 능력을 향상시키기 위해 타당한 음성 제안을 효과적으로 생성할 수 있는가?
  • RQ3두 브랜치 간의 파라미터 공유가 제안 품질과 학습 안정성에 미치는 영향은 무엇인가?
  • RQ4시각적 점수 기반 대비에 비해 언어 인식 필터링 메커니즘이 교차 모odal 정렬을 어떻게 향상시키는가?
  • RQ5약한 감독 학습에서 커버리지와 노이즈의 균형을 고려할 때, 비디오당 최적의 제안 수는 얼마인가?

주요 결과

  • 전체 RTBPN 모델은 ActivityCaption 및 Charades-STA 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 각각 R@1, IoU=0.5에서 48.7%와 42.1%를 기록하였다.
  • 언어 인식 필터를 제거한 경우(w/o. filter) 또는 파라미터 공유를 제거한 경우(w/o. parameter sharing) 성능 저하가 심각하게 발생하여, 이들이 내부 샘플 대비 학습에서 핵심적인 역할을 한다는 것을 확인하였다.
  • 시각적 점수 기반 모델(w/o. NetVALD)은 전체 모델 대비 성능이 열등하여 언어적 맥락을 통한 교차 모달 추정이 점수 분포 품질을 향상시킨다는 것을 입증하였다.
  • 중심 기반 제안 방법은 모든 제안 및 상위-k 제안 베이스라인보다 우수한 성능을 보였으며, 다양한 관련 순간 후보를 효과적으로 포착한다는 것을 시사한다.
  • 비디오당 최적의 제안 수는 48개였으며, T를 48로 설정할 경우 양 대안 데이터셋에서 최고의 성능을 기록하였고, 이보다 낮거나 높은 값에서는 성능 저하가 관찰되었다.
  • 정성적 결과에서는 언어 인식 필터가 관련 프레임에 더 높은 점수를 할당하여 강화된 브랜치가 SCN 베이스라인 대비 목표 순간을 더 정확하게 정렬하는 데 기여함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.