Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-Supervised Spatio-Temporally Grounding Natural Sentence in Video

Zhenfang Chen, Lin Ma|arXiv (Cornell University)|2019. 06. 06.
Multimodal Machine Learning Applications참고 문헌 48인용 수 9
한 줄 요약

이 논문은 훈련 중에 시공간적 애너테이션 없이 자연어 문장에 해당하는 시공간 튜브를 비디오에서 국소화하는 새로운 약한 감독형 시공간 기반 작업(WSSTG)을 제안한다. 이 방법은 세분화된 문장-인스턴스 매칭을 모델링하기 위해 주의 메커니즘을 활용한 인터랙터를 사용하고, 신뢰할 수 있는 예측을 향상시키기 위해 다양성 손실을 도입하여 새로 제안된 VID-sentence 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we address a novel task, namely weakly-supervised spatio-temporally grounding natural sentence in video. Specifically, given a natural sentence and a video, we localize a spatio-temporal tube in the video that semantically corresponds to the given sentence, with no reliance on any spatio-temporal annotations during training. First, a set of spatio-temporal tubes, referred to as instances, are extracted from the video. We then encode these instances and the sentence using our proposed attentive interactor which can exploit their fine-grained relationships to characterize their matching behaviors. Besides a ranking loss, a novel diversity loss is introduced to train the proposed attentive interactor to strengthen the matching behaviors of reliable instance-sentence pairs and penalize the unreliable ones. Moreover, we also contribute a dataset, called VID-sentence, based on the ImageNet video object detection dataset, to serve as a benchmark for our task. Extensive experimental results demonstrate the superiority of our model over the baseline approaches.

연구 동기 및 목표

  • 시공간적 애너테이션이 없는 조건에서 자연어 문장을 비디오에 기반시킬 수 있는 도전 과제를 해결하기 위해.
  • 문장과 시공간 인스턴스 간의 세분화된 의미 관계를 모델링하여 기반 정확도를 향상시키기 위해.
  • 신뢰할 수 있는 예측을 강화하고 잘못된 예측을 억제하기 위해 다양성 손실을 통한 학습 목표를 개발하기 위해.
  • 약한 감독형 시공간 기반을 위한 새로운 벤치마크 데이터셋인 VID-sentence을 구축하기 위해.

제안 방법

  • 영화에서 영역 제안 네트워크를 사용하여 시공간 튜브 제안(인스턴스)의 집합을 추출한다.
  • 교차 모odal 주의 메커니즘을 세분화된 수준에서 모델링하는 새로운 주의 인터랙터를 사용하여 인스턴스 특징과 문장 임베딩을 인코딩한다.
  • 저 IoU 예측에 대해 높은 매칭 점수를 처벌하고 고 IoU 예측을 강화하는 다양성 손실을 도입한다.
  • 다중 인스턴스 학습 프레임워크 내에서 순서 손실과 다양성 손실의 조합을 사용해 모델을 훈련한다.
  • 추론 중에는 매칭 점수가 가장 높은 인스턴스를 최종 기반 결과로 사용한다.
  • 시각적 표현을 위해 사전 훈련된 I3D 네트워크의 특징을 활용하고, 문장 인코딩을 위해 LSTM을 사용한다.

실험 결과

연구 질문

  • RQ1약한 감독형 모델이 시공간적 애너테이션이 전혀 없는 조건에서 자연어 문장에 해당하는 시공간 튜브를 정확하게 국소화할 수 있는가?
  • RQ2문장과 비디오 인스턴스 간의 세분화된 교차 모달 상호작용을 어떻게 모델링할 수 있으며, 이는 기반 성능 향상에 어떻게 기여하는가?
  • RQ3다양성 손실이 약한 감독 기반에서 신뢰할 수 없는 예측을 효과적으로 억제하고 신뢰할 수 있는 예측을 향상시키는 데 기여하는가?
  • RQ4제안된 방법은 새로운 VID-sentence 데이터셋과 Person-sentence 데이터셋 모두에서 기존 베이스라인과 어떻게 비교되는가?

주요 결과

  • 제안된 모델은 Person-sentence 데이터셋에서 평균 62.5%의 정확도를 달성하여 DVSA 및 GroundeR 변종을 포함한 모든 베이스라인을 능가한다.
  • VID-sentence 데이터셋에서 전체 모델은 평균 37.2%의 정확도를 기록하여 베이스라인 모델(31.0%)과 다양성 손실 제거된 아블레이션 모델(47.1% on Person-sentence)보다 뚜렷하게 뛰어나다.
  • 아블레이션 연구 결과, 주의 인터랙터와 다양성 손실이 성능 향상에 크게 기여하는 것으로 확인되었으며, 주의 인터랙터는 평균 3.5% 향상, 다양성 손실은 평균 1.0% 향상 효과를 보였다.
  • 시각화 결과 주의 인터랙터가 관련 있는 단어들(예: 'puppy', 'hand')에 적응적으로 집중하여 세그먼트 전반에 걸쳐 시각적 콘텐츠와 매칭됨을 보여준다.
  • 다양성 손실은 도표 7의 분포 플롯을 통해 저 IoU 예측에 대해 매칭 점수를 효과적으로 낮추고 고 IoU 예측에 대해선 높여주는 것으로 확인되었다.
  • VID-sentence 데이터셋은 기존 벤치마크보다 더 도전적으로 평가되었으며, 이는 Person-sentence 데이터셋(77.9%) 대비 상한 성능(47.6% 평균)이 낮기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.