Skip to main content
QUICK REVIEW

[논문 리뷰] G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game Theory

Hongxiang Li, Meng Cao|arXiv (Cornell University)|2023. 07. 26.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

G2L는 비디오 순간 간의 시간적 및 의미적 상관관계를 모델링하기 위해 지오데식 거리와 게임 이론 기반 샤플리 상호작용을 활용하여 의미적으로 정렬되고 균일한 표현 학습을 향상시키는 새로운 비디오 지문 프레임워크를 제안한다. 이 방법은 세분화된 의미적 유사성과 유사한 순간 간의 모호함을 해결함으로써, 세 가지 벤치마크에서 순수 대비 학습 기반의 문제를 완화하면서 우수한 성능을 달성한다.

ABSTRACT

The recent video grounding works attempt to introduce vanilla contrastive learning into video grounding. However, we claim that this naive solution is suboptimal. Contrastive learning requires two key properties: (1) \emph{alignment} of features of similar samples, and (2) \emph{uniformity} of the induced distribution of the normalized features on the hypersphere. Due to two annoying issues in video grounding: (1) the co-existence of some visual entities in both ground truth and other moments, \ie semantic overlapping; (2) only a few moments in the video are annotated, \ie sparse annotation dilemma, vanilla contrastive learning is unable to model the correlations between temporally distant moments and learned inconsistent video representations. Both characteristics lead to vanilla contrastive learning being unsuitable for video grounding. In this paper, we introduce Geodesic and Game Localization (G2L), a semantically aligned and uniform video grounding framework via geodesic and game theory. We quantify the correlations among moments leveraging the geodesic distance that guides the model to learn the correct cross-modal representations. Furthermore, from the novel perspective of game theory, we propose semantic Shapley interaction based on geodesic distance sampling to learn fine-grained semantic alignment in similar moments. Experiments on three benchmarks demonstrate the effectiveness of our method.

연구 동기 및 목표

  • 시간 기반의 긍정/부정 샘플링이 비접속적이거나 겹치는 순간 간의 의미적 유사성을 포착하지 못하는 순수 대비 학습의 한계를 해결한다.
  • 시각적으로 유사한 실체가 참조 지문과 비참조 지문 양쪽에 존재하는 의미적 겹침 문제를 해결하여 일관되지 않은 특징 표현을 방지한다.
  • 감독 신호가 부족하여 비표기된 순간이 관련 쿼리로부터 잘못으로 분리되는 희소한 애너테이션 문제를 완화한다.
  • 비디오 순간 간의 교차 모odal 및 교차 순간 관계를 지오데식 거리 기반으로 모델링하여 표현의 균일성과 정렬을 향상시킨다.
  • 지오데식 샘플링 기반 게임 이론적 샤플리 상호작용 모듈을 도입하여 매우 유사한 순간 간의 세분화된 의미적 차이를 구분한다.

제안 방법

  • 비디오 클립에서 순간 그래프를 구축하여 비디오 표현의 매니폴드 구조를 모델링하고, 지오데식 거리 계산을 가능하게 하여 의미적 유사성의 대체 지표로 활용한다.
  • 기존의 엄격한 시간 기반 긍정/부정 샘플링을 지오데식 기반 샘플링으로 대체하여, 그래프상에서 가까운 순간이 더 의미적으로 정렬된 것으로 간주되도록 한다.
  • 비디오 순간과 쿼리를 협력 게임의 플레이어로 간주하고, 각 구성 요소의 마진널 기여도를 정량화하기 위해 의미적 샤플리 상호작용을 계산한다.
  • 지오데식 거리 기반으로 내비디오 순간을 샘플링하는 미분 가능한 의미적 샤플리 상호작용 모듈을 설계하여 의미적으로 유사한 클립 간의 미세한 차이에 집중한다.
  • 지오데식 유도 대비 학습(GCL) 및 의미적 샤플리 상호작용(SSI) 모듈을 통합된 학습 목표에 통합하여 정렬성과 균일성을 동시에 최적화한다.
  • t-SNE 시각화를 통해 G2L가 순수 대비 학습에서 발생하는 표현 군집화 오류(예: '아일랜드' 구조)를 감소시켜 더 균일하고 의미적으로 일관된 특징 공간을 생성함을 입증한다.

실험 결과

연구 질문

  • RQ1표준 시간적 또는 유클리드 거리보다 지오데식 거리가 시간적으로 떨어져 있거나 겹치는 비디오 순간 간의 의미적 상관관계를 더 잘 포착할 수 있는가?
  • RQ2엄격한 시간 기반 대비 학습을 지오데식 기반 샘플링으로 대체할 경우 비디오-텍스트 표현의 정렬성과 균일성에 어떤 영향을 미치는가?
  • RQ3게임 이론 기반 샤플리 상호작용은 의미적으로 유사한 비디오 순간 간의 구분 능력을 어느 정도 향상시킬 수 있는가?
  • RQ4제안된 G2L 프레임워크는 비디오 지문에서 의미적 겹침과 희소한 애너테이션의 부정적 영향을 효과적으로 완화하는가?
  • RQ5지오데식 거리와 샤플리 상호작용의 통합이 다수의 비디오 지문 벤치마크에서 일관된 성능 향상을 이끌어낼 수 있는가?

주요 결과

  • G2L는 ActivityNet-Captions, MSVD, MSVD-ASR 세 가지 비디오 지문 벤치마크에서 최신 기술 수준 성능을 달성하여 기준 대비 학습 방법보다 일관된 향상을 보였다.
  • 유클리드, 타임스탬프, 코사인 거리 대비 지오데식 거리 사용으로 mAP가 최대 5% (유클리드), 2% (타임스탬프), 3% (코사인) 향상되어 의미적 구조를 포착하는 데서의 우수성을 입증했다.
  • 의미적 샤플리 상호작용 모듈은 t-SNE 시각화를 통해 특징 공간에서 '아일랜드' 군집이 제거됨으로써 시각적으로 유사한 순간 간의 혼동을 감소시켰다.
  • G2L는 지오데식 경로를 통해 비표기된 순간과 쿼리 간의 관계를 모델링하여 희소한 애너테이션으로 인한 성능 저하를 감소시켰다.
  • 기본 모델 대비 추론 시간이 단지 3초 증가하여, K-NN 그래프 및 SSI 모듈로 인한 추가 학습 복잡성에도 불구하고 G2L 프레임워크는 효율적임을 시사한다.
  • 정성적 결과에서는 G2L가 비디오 후반부에 재등장하는 이벤트를 참조하는 쿼리(예: '다시 니트질하다', '두 번째 벨트')를 성공적으로 지문화하는 데 성공했으며, 이는 기존의 대비 학습 방법이 실패하는 영역이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.