Skip to main content
QUICK REVIEW

[논문 리뷰] Context-aware Biaffine Localizing Network for Temporal Sentence Grounding

Daizong Liu, Xiaoye Qu|arXiv (Cornell University)|2021. 03. 22.
Multimodal Machine Learning Applications참고 문헌 48인용 수 15
한 줄 요약

이 논문은 시간 문장 기반 작업을 위해 맥락 인식형 이중선형 로컬라이징 네트워크(CBLN)를 제안한다. 이는 다중 척도 국소 및 전반적 맥락 모델링을 강화한 이중선형 메커니즘을 사용하여 모든 가능한 시작-종료 프레임 쌍을 동시에 점수 매긴다. 이 방법은 ActivityNet Captions, TACoS, Charades-STA에서 최신 기준 성능을 달성하며, ActivityNet Captions에서 IoU=0.7일 때 R@1이 27.60%를 기록한다. 이는 국소 시각적 신호와 전반적 시간적 의존성의 공동 모델링을 통해 언어 쿼리와 영상 세그먼트 간의 우수한 정렬을 보여준다.

ABSTRACT

This paper addresses the problem of temporal sentence grounding (TSG), which aims to identify the temporal boundary of a specific segment from an untrimmed video by a sentence query. Previous works either compare pre-defined candidate segments with the query and select the best one by ranking, or directly regress the boundary timestamps of the target segment. In this paper, we propose a novel localization framework that scores all pairs of start and end indices within the video simultaneously with a biaffine mechanism. In particular, we present a Context-aware Biaffine Localizing Network (CBLN) which incorporates both local and global contexts into features of each start/end position for biaffine-based localization. The local contexts from the adjacent frames help distinguish the visually similar appearance, and the global contexts from the entire video contribute to reasoning the temporal relation. Besides, we also develop a multi-modal self-attention module to provide fine-grained query-guided video representation for this biaffine strategy. Extensive experiments show that our CBLN significantly outperforms state-of-the-arts on three public datasets (ActivityNet Captions, TACoS, and Charades-STA), demonstrating the effectiveness of the proposed localization framework.

연구 동기 및 목표

  • 기존 방법이 후보 제안 순위 매기기나 독립적 시작/종료 경계 회귀에 의존하여 시작점과 종료점 간의 공동 의존성을 모델링하지 못하는 한계를 해결하기 위해.
  • 시작점과 종료점 간의 공동 의존성을 모델링하기 위해 각 프레임에 대해 국소 시각적 맥락(접근 프레임)과 전반적 영상 맥락(전체 영상)을 명시적으로 모델링하여 경계 식별 성능을 향상시키기 위해.
  • 언어 쿼리와 영상 특징 간의 세밀한 다중 모odal 상호작용을 포괄하는 쿼리 가이드 영상 표현을 개발하여 정렬 성능을 향상시키기 위해.
  • 시간 문장 기반 작업을 이중선형 메커니즘을 사용해 모든 가능한 시작-종료 쌍에 대한 공동 점수 매기기 문제로 재정의하여 시간적 구조와 맥락을 유지하기 위해.

제안 방법

  • 다중 척도 국소 맥락(접근 프레임)과 다중 척도 전반적 맥락(전체 영상)을 스택된 비국소 블록을 통해 융합하는 다중 맥락 이중선형 로컬라이제이션(MCBL) 모듈을 제안한다. 이는 프레임 수준 표현을 풍부하게 한다.
  • 문장 쿼리와 영상 프레임 간의 다중 모달 상호작용을 모델링하여 쿼리 인식 영상 표현을 학습하는 다중 모달 자기주의(MMSA) 모듈을 도입한다.
  • 모든 가능한 시작-종료 프레임 쌍 간의 호환성 점수를 동시에 계산하기 위해 이중선형 메커니즘을 활용하여 시간 경계의 공동 예측을 가능하게 한다.
  • MCBL 모듈에서 특징 융합을 위해 최대 풀링과 연결을 사용하며, 비국소 블록을 통해 국소 및 전반적 맥락 표현 간의 적응형 상호작용을 가능하게 한다.
  • 다중 척도 윈도잉: 국소 맥락은 K^l ∈ {1,3,5}로, 전반적 맥락은 K^g ∈ {1,2,4}로 설정하여 다양한 시공간 패턴을 포착한다.
  • 모델 전체를 엔드 투 엔드로 훈련하여 MMSA 및 MCBL 모듈을 공동 최적화함으로써 언어 쿼리와 영상 세그먼트 간의 정렬 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1모든 시작-종료 프레임 쌍을 동시에 점수 매기는 이중선형 메커니즘이 독립적 경계 회귀나 순위 매기기 방법을 능가하는가?
  • RQ2국소(접근 프레임) 및 전반적(전체 영상) 맥락이 시간 문장 기반 작업에서 경계 로컬라이제이션에 어떻게 공동으로 기여하는가?
  • RQ3다양한 융합 전략(예: 평균 풀링 대비 최대 풀링)이 다중 모달 및 다중 맥락 특징 융합에 미치는 영향은 무엇인가?
  • RQ4다중 모달 자기주의 모듈이 기반 작업을 위한 쿼리 가이드 영상 표현을 얼마나 효과적으로 생성하는가?
  • RQ5다양한 맥락 집계 및 융합 전략을 사용할 경우, 모델 복잡도, 추론 속도, 성능 간의 상충 관계는 어떻게 되는가?

주요 결과

  • 전체 CBLN 모델은 ActivityNet Captions에서 IoU=0.7일 때 R@1이 27.60%를 기록하여 이전 최신 기준 방법들을 뛰어넘는다.
  • 국소-전반적 집계 모듈에서 모든 비국소 블록을 제거하면 R@1이 2.55% 감소하여 학습 가능한 맥락 상호작용의 중요성을 입증한다.
  • 비국소 블록을 단순 연결과 선형 레이어로 대체하면 성능이 1.73% 감소하여 스택된 비국소 메커니즘의 효과성을 확인한다.
  • MMSA 및 MCBL 모듈 양쪽에서 평균 풀링 융합 전략이 최대 풀링 및 연결 전략보다 우수하며, 모든 지표에서 최고 성능을 기록한다.
  • MMSA 및 MCBL 모듈을 모두 갖춘 모델은 R@1 IoU=0.7에서 27.60%를 기록하며, 추론 속도는 0.18초, GPU 메모리는 10,184M(Batch size 64)를 사용하여 2D-TAN 및 CMIN보다 정확도와 효율성 면에서 뛰어나다.
  • 제거 실험 결과, 다중 척도(K^l = {1,3,5}, K^g = {1,2,4}) 설정이 단일 척도 설정보다 성능 향상을 보이며, 더 많은 전반적 척도를 추가해도 성능 향상이 미미하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.