Skip to main content
QUICK REVIEW

[논문 리뷰] Knowing Where to Focus: Event-aware Transformer for Video Grounding

Jinhyun Jang, Jungin Park|arXiv (Cornell University)|2023. 08. 14.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 동적으로 비디오에 특화된 순간 쿼리를 이벤트 추론을 통해 슬롯 어텐션과 게이팅 퓨전을 사용하여 구성하는 새로운 이벤트 인식 트랜스포머인 EaTR를 제안한다. 이를 통해 시공간적 국소화 성능을 향상시킨다. 이벤트 유닛을 콘텐츠 및 위치 인식 쿼리로 학습함으로써 EaTR는 여러 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 수렴 속도가 빠르고 정확도가 향상된다.

ABSTRACT

Recent DETR-based video grounding models have made the model directly predict moment timestamps without any hand-crafted components, such as a pre-defined proposal or non-maximum suppression, by learning moment queries. However, their input-agnostic moment queries inevitably overlook an intrinsic temporal structure of a video, providing limited positional information. In this paper, we formulate an event-aware dynamic moment query to enable the model to take the input-specific content and positional information of the video into account. To this end, we present two levels of reasoning: 1) Event reasoning that captures distinctive event units constituting a given video using a slot attention mechanism; and 2) moment reasoning that fuses the moment queries with a given sentence through a gated fusion transformer layer and learns interactions between the moment queries and video-sentence representations to predict moment timestamps. Extensive experiments demonstrate the effectiveness and efficiency of the event-aware dynamic moment queries, outperforming state-of-the-art approaches on several video grounding benchmarks.

연구 동기 및 목표

  • DETR 기반의 비디오 거시징 모델에서 입력에 종속되지 않는 순간 쿼리의 한계를 해결하여, 비디오에 특화된 시공간적 구조에 대한 인식을 향상시키기 위해.
  • 비디오에 특화된 이벤트 유닛을 학습하여 콘텐츠 및 위치 인식 쿼리로서의 동적 순간 쿼리를 도입함으로써 시공간 추론 성능을 향상시키기 위해.
  • 문장과 비디오 표현 간의 상호작용을 향상시키기 위해 관련 없는 순간 쿼리를 필터링하고 문장과 관련된 쿼리에 초점을 맞추기 위해.
  • 신뢰할 수 있고 입력에 특화된 참조 검색 영역을 제공함으로써 훈련 수렴 속도를 빠르게 하고 정확도를 높이기 위해.
  • 이벤트 수준 및 순간 수준의 추론을 통합하는 통합 프레임워크를 제안하여 더 정밀한 비디오 거시징을 달성하기 위해.

제안 방법

  • 비디오 특징에서 특징적인 이벤트 유닛을 식별하기 위해 슬롯 어텐션 메커니즘을 사용하여, 초기 동적 순간 쿼리로서 콘텐츠 및 위치 쿼리를 생성한다.
  • 유사도 기반으로 순간 쿼리를 문장 표현과 적응적으로 융합하는 게이팅 퓨전 트랜스포머(GF) 레이어를 도입하여 정보성 있는 쿼리를 강화하고 관련 없는 쿼리를 억제한다.
  • 식별된 이벤트 유닛에서 동적 순간 쿼리를 구성하여 추론 시 입력에 특화된 참조 검색 영역으로 활용한다.
  • 크로스 어텐션을 갖춘 트랜스포머 디코더를 사용하여 순간 쿼리가 비디오-문장 표현과 상호작용할 수 있도록 하여 정밀한 타임스탬프 예측을 가능하게 한다.
  • 새로운 이벤트 로컬라이제이션 손실($\mathcal{L}_{\text{event}}$)과 표준 검출 손실을 포함하는 다중 과제 목적함수를 사용하며, 하이퍼파ram터 $\lambda_{\text{event}}$를 통해 균형을 맞춘다.
  • 학습 가능한 쿼리 임베딩을 순간 쿼리에 사용하며, 이는 이벤트 유닛을 기반으로 초기화하고 훈련 중에 엔드 투 엔드로 업데이트한다.
(a) Video grounding
(a) Video grounding

실험 결과

연구 질문

  • RQ1비디오에 특화된 시공간적 구조를 통합함으로써 이벤트 인식 동적 순간 쿼리가 비디오 거시징 성능을 향상시킬 수 있는가?
  • RQ2고정 또는 가중치 없는 쿼리 상호작용에 비해 게이팅 퓨전 메커니즘이 입력 문장에 대한 순간 쿼리의 관련성은 어떻게 향상시키는가?
  • RQ3슬롯 어텐션을 통해 이벤트 유닛을 학습하는 것이 입력에 종속되지 않는 순간 쿼리에 비해 수렴 속도를 빠르게 하고 일반화 성능을 향상시키는가?
  • RQ4훈련 목표에서 이벤트 로컬라이제이션 손실과 검출 손실 간의 최적 균형은 무엇인가?
  • RQ5고정된 입력에 종속되지 않는 쿼리에 비해 동적 순간 쿼리는 주의 분포와 예측 신뢰성 측면에서 어떻게 비교되는가?

주요 결과

  • EaTR는 ActivityNet-1.3, TACRED, MSVD 등 여러 비디오 거시징 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, Moment-DETR와 같은 이전 SOTA 모델을 능가한다.
  • Moment-DETR보다 수렴 속도가 뚜렷이 빠르며, 이는 동적이고 이벤트 인식 쿼리가 더 나은 초기 참조 검색 영역을 제공함으로써 훈련 효율성을 향상시킨다는 것을 보여준다.
  • 제거 실험 결과, 게이팅 퓨전 레이어가 덧셈, 연결, 다중 헤드 크로스 어텐션 퓨전보다 우수한 성능을 보이며, 관련 없는 쿼리를 효과적으로 필터링한다는 점을 확인한다.
  • 최적의 이벤트 슬롯 수 $N$은 10이며, 이는 장기 이벤트를 포착하기 어려운 경우 또는 과적합이 발생하는 경우 성능 저하가 발생하기 때문이다.
  • 균형 하이퍼파ram터 $\lambda_{\text{event}}$는 강한 영향을 미친다: 성능은 $\lambda_{\text{event}} = 3$에서 최고에 도달하며, 이보다 낮거나 높은 값은 성능 저하를 초래한다.
  • 주의 시각화 결과, EaTR의 동적 쿼리는 비디오 콘텐츠에 적응하여 균형 잡히고 정보적인 주의 패턴을 제공하는 반면, 입력에 종속되지 않는 쿼리는 너무 많은 비디오-문장 상호작용에 의존하여 오류를 유발한다.
(b) Previous DETR-based approach
(b) Previous DETR-based approach

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.