Skip to main content
QUICK REVIEW

[논문 리뷰] Dense Regression Network for Video Grounding

Runhao Zeng, Haoming Xu|arXiv (Cornell University)|2020. 04. 07.
Multimodal Machine Learning Applications참고 문헌 49인용 수 15
한 줄 요약

이 논문은 비디오 지문 작업을 위한 일단계형 밀도 회귀 네트워크(DRN)를 제안한다. 이 네트워크는 희박한 애너테이션에서 밀도 있는 지도를 활용하여 각 프레임이 실제 시작/종료 경계와 떨어진 거리를 회귀함으로써, 실제 지문 세그먼트 내 모든 프레임을 양성 샘플로 간주하고, 국소화 정확도를 향상시키기 위해 IoU 회귀 헤드를 도입한다. DRN은 Charades-STA, ActivityNet-Captions, TACoS에서 최신 기준(SOTA) 성능을 달성하며, 이는 이전 방법들에 비해 유의미한 성능 향상이다.

ABSTRACT

We address the problem of video grounding from natural language queries. The key challenge in this task is that one training video might only contain a few annotated starting/ending frames that can be used as positive examples for model training. Most conventional approaches directly train a binary classifier using such imbalance data, thus achieving inferior results. The key idea of this paper is to use the distances between the frame within the ground truth and the starting (ending) frame as dense supervisions to improve the video grounding accuracy. Specifically, we design a novel dense regression network (DRN) to regress the distances from each frame to the starting (ending) frame of the video segment described by the query. We also propose a simple but effective IoU regression head module to explicitly consider the localization quality of the grounding results (i.e., the IoU between the predicted location and the ground truth). Experimental results show that our approach significantly outperforms state-of-the-arts on three datasets (i.e., Charades-STA, ActivityNet-Captions, and TACoS).

연구 동기 및 목표

  • 비디오 지문 작업에서 각 비디오당 몇 개의 프레임만 실제 지문으로 레이블이 되어 있는 희박한 양성 애너테이션 문제를 해결하기 위해.
  • 밀도 있는 회귀 지도를 통해 실제 지문 세그먼트 내 모든 프레임을 양성 샘플로 활용하여 모델 학습을 향상시키기 위해.
  • 예측된 경계와 실제 경계 간의 IoU를 추정하여 국소화 정확도를 명시적으로 모델링하기 위해.
  • 2단계 방법에서의 계산 부담과 제안서 품질에 대한 의존성을 피하기 위해 일단계형, 앵커 기반 비디오 지문 프레임워크를 개발하기 위해.
  • 다중 수준 융합 및 위치 임베딩 전략을 통해 쿼리와 비디오 세그먼트 간의 의미적 및 시간적 정렬을 향상시키기 위해.

제안 방법

  • 모델은 비디오와 자연어 쿼리 간의 다중모달 특징을 인코딩하기 위해 비디오-쿼리 상호작용 모듈을 사용한다.
  • 밀도 있는 회귀 헤드는 각 프레임이 목표 세그먼트의 시작 및 종료 경계와 떨어진 거리를 예측하여, 희박한 애너테이션을 밀도 있는 지도로 전환한다.
  • 의미 일치 헤드는 각 예측된 시간 박스가 쿼리 의미와 얼마나 잘 일치하는지 점수를 매긴다.
  • IoU 회귀 헤드는 예측된 박스와 실제 박스 간의 교차율(Intersection-over-Union, IoU)을 직접 추정하여 국소화 정확도를 우선시한다.
  • 다중 수준 융합(Multi-level Fusion, MLF)은 다양한 수준에서 쿼리 표현을 추출하고 비디오 특징과 융합하여 다중모달 정렬을 향상시킨다.
  • 시간적 위치 임베딩은 비디오 특징에 연결되어 모델이 시간 순서를 학습하고 국소화 정밀도를 향상시키는 데 기여한다.

실험 결과

연구 질문

  • RQ1희박한 애너테이션만 존재할 때, 각 프레임에서 경계까지의 거리에 대한 밀도 있는 회귀가 비디오 지문 성능 향상에 기여하는가?
  • RQ2예측값과 실제값 간의 IoU를 명시적으로 회귀하면 의미 일치만으로는 달성할 수 없는 국소화 정확도 향상이 가능한가?
  • RQ3다중 수준 융합은 비디오 지문 작업에서 다중모달 표현 학습을 향상시키는 데 얼마나 효과적인가?
  • RQ4시간적 관계를 포함한 쿼리에 대해 시간적 위치 임베딩을 통합할 경우 국소화 정밀도 향상 정도는 어느 정도인가?
  • RQ5Charades-STA, ActivityNet-Captions, TACoS와 같은 다양한 벤치마크에서 제안된 DRN은 최신 기준 방법들과 비교해 어떻게 성능을 내는가?

주요 결과

  • 제안된 DRN은 IoU=0.5일 때 Charades-STA에서 45.40% R@1, ActivityNet-Captions에서 42.49% R@1을 기록하여 이전 최고 성능 방법을 초월한다.
  • IoU 회귀 헤드를 사용할 경우 'centerness' 또는 IoU 헤드 없이 사용하는 것보다 Charades-STA에서 1.27% 향상되고 ANet-Captions에서 2.05% 향상된다.
  • 다중 수준 융합(MLF)은 Charades-STA에서 0.75% 향상되고 ANet-Captions에서 0.83% 향상되어 표현 학습에서의 효과를 입증한다.
  • 시간 키워드가 포함된 ANet-Captions의 일부 데이터셋에서 학습 및 테스트를 수행했을 때 위치 임베딩은 성능을 1.7% 향상시켜 시간적 추론에 유용함을 확인한다.
  • 제거 실험 결과, IoU 헤드나 위치 임베딩을 제거할 경우 일관된 성능 저하가 발생하여 이들이 국소화 정확도 향상에 기여하는 것으로 입증된다.
  • 모델는 강력한 일반화 성능을 보이며, 세 가지 벤치마크에서 모두 최고 성능을 기록하여 밀도 있는 지도와 명시적 국소화 모델링의 효과를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.