Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Sentence Temporal and Semantic Relations in Video Activity Localisation

Jiabo Huang, Yang Liu|arXiv (Cornell University)|2021. 07. 23.
Multimodal Machine Learning Applications참고 문헌 36인용 수 9
한 줄 요약

이 논문은 크로스센텐스 관계 탐색(CRM)을 제안하며, 이는 크로스센텐스 시계열 순서와 의미 일관성 제약 조건을 활용하여 순간 지목 성능을 향상시키는 약한 지도 학습 방법이다. 문단 수준의 관계—예를 들어 활동 순서의 연속성과 문장 간 의미 일관성—를 모델링함으로써 비디오-텍스트 정렬의 모호성을 줄이고, 특히 복잡한 서술에 대해 ActivityNet-Captions 및 Charades에서 최신 기준 성능을 달성한다.

ABSTRACT

Video activity localisation has recently attained increasing attention due to its practical values in automatically localising the most salient visual segments corresponding to their language descriptions (sentences) from untrimmed and unstructured videos. For supervised model training, a temporal annotation of both the start and end time index of each video segment for a sentence (a video moment) must be given. This is not only very expensive but also sensitive to ambiguity and subjective annotation bias, a much harder task than image labelling. In this work, we develop a more accurate weakly-supervised solution by introducing Cross-Sentence Relations Mining (CRM) in video moment proposal generation and matching when only a paragraph description of activities without per-sentence temporal annotation is available. Specifically, we explore two cross-sentence relational constraints: (1) Temporal ordering and (2) semantic consistency among sentences in a paragraph description of video activities. Existing weakly-supervised techniques only consider within-sentence video segment correlations in training without considering cross-sentence paragraph context. This can mislead due to ambiguous expressions of individual sentences with visually indiscriminate video moment proposals in isolation. Experiments on two publicly available activity localisation datasets show the advantages of our approach over the state-of-the-art weakly supervised methods, especially so when the video activity descriptions become more complex.

연구 동기 및 목표

  • 각 문장을 독립적으로 다루는 약한 지도 학습 기반의 비디오 활동 국지화 방법의 한계를 해결하기 위해.
  • 각 문장의 시계열 경계를 기록하지 않으면서도 정밀도를 향상시키기 위해 애너테이션의 편향과 비용을 줄이기 위해.
  • 문단 내에서의 본질적인 크로스센텐스 관계—시계열 순서와 의미 일관성—를 학습 중 보조 신호로 활용하기 위해.
  • 다중 문장 간의 맥락 정보를 활용하여 복잡하거나 모호한 질의의 국지화 능력을 향상시키기 위해.
  • 특히 의미적으로 모호하거나 대명사 기반의 서술이 있는 상황에서 기존의 약한 지도 학습 방법을 능가하기 위해.

제안 방법

  • 문단 내 문장의 순서와 동일한 시계열 순서를 따르도록 하는 시계열 일관성 제약 조건을 도입한다.
  • 쌍으로 구성된 문장 서술을 연결된 질의로 간주하고, 의미 일관성 제약 조건을 적용하여 모델이 두 지정된 순간의 합집합에 대해 높은 IoU를 가지는 비디오 세그먼트를 선택하도록 보장한다.
  • 비디오 특징과 텍스트 임베딩 간의 상호작용을 모델링하기 위해 자기 주의 및 교차 주의 메커니즘을 갖춘 다중 모odal 네트워크(MMN) 백본을 사용한다.
  • 대비 학습 전략을 적용하여, 크로스센텐스 관계 신호를 활용해 정확한 순간 제안과 잘못된 제안을 구분하도록 모델을 학습시킨다.
  • 대비 손실과 두 가지 관계 제약 조건(시계열 및 의미 일관성)을 조합하여 엔드 투 엔드로 모델을 훈련시켜 제안 선택을 안내한다.
  • 주의 단위를 활용해 장거리 의존성을 포착하고 시각-텍스트 정렬을 향상시키며, 아블레이션 연구를 통해 과도한 깊이를 피하기 위해 중간 정도의 깊이에서 최적의 성능를 얻음을 확인한다.

실험 결과

연구 질문

  • RQ1문단 서술 내 크로스센텐스 시계열 순서가 약한 지도 학습 환경에서 비디오 순간 국지화의 정확도를 향상시키는가?
  • RQ2쌍으로 구성된 문장 간 의미 일관성 제약을 적용하면 복잡하거나 대명사 기반의 서술에서의 모호성이 감소하는가?
  • RQ3크로스센텐스 관계 제약 조건이 복잡한 비디오 서술에 대해 각 문장 기반 모델링 대비 국지화 성능에 어떤 영향을 미치는가?
  • RQ4주의 메커니즘이 비디오-텍스트 정렬에서 크로스센텐스 맥락을 포착하는 데 얼마나 기여하는가?
  • RQ5문단 수준의 서술에서 유도된 관계 신호가 비용이 많이 드는 각 문장의 시계열 애너테이션을 대체할 수 있는가?

주요 결과

  • CRM은 ActivityNet-Captions 및 Charades 데이터셋에서 최신 기준 성능을 달성하였으며, ActivityNet-Captions에서 IoU=0.5일 때 68.14%의 리콜률을 기록하여 기존의 약한 지도 학습 방법을 크게 앞서 간다.
  • 모델은 복잡한 서술에 대해 리콜률이 10% 이상 향상되었으며, 이는 질문이 모호하거나 맥락 의존적인 경우 크로스센텐스 관계가 특히 유익함을 보여준다.
  • 실험 결과, SOTA 기준 모델이 예측한 65%의 순간 쌍이 잘못된 시계열 순서를 가지는 것으로 나타나, 명시적인 시계열 일관성 모델링의 필요성을 입증한다.
  • 의미 일관성 실험 결과, ActivityNet-Captions의 38%의 서술이 모호한 참조(예: 대명사)를 포함하고 있으며, CRM은 크로스센텐스 맥락을 통해 이를 효과적으로 해결한다.
  • 아블레이션 연구 결과, 시계열 및 의미 일관성 제약 조건이 모두 필수적임을 확인하였으며, 둘 중 하나를 제거하면 성능이 크게 떨어지며, 특히 복잡한 설정에서 의미 일관성 제약 조건이 가장 큰 성능 향상을 보였다.
  • 주의 메커니즘의 사용은 성능 향상을 이끌었지만, 너무 많은 레이어를 쌓을 경우 제한된 훈련 데이터에서 과적합으로 인해 성능 저하가 발생함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.