Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Debiasing Temporal Sentence Grounding in Video

Hao Zhang, Aixin Sun|arXiv (Cornell University)|2021. 11. 08.
Multimodal Machine Learning Applications참고 문헌 48인용 수 6
한 줄 요약

이 논문은 영상 내 시간적 문장 기준화(TSGV)에서 분포 편향을 줄이기 위해 두 가지 탈편향 전략—영상 자르기 기반 오버샘플링을 통한 데이터 탈편향 및 단일모odal 영상 및 쿼리 브랜치를 사용한 모델 탈편향—을 제안한다. 훈련 데이터 분포를 균형 있게 하고 손실 조정을 통해 편향을 분리함으로써, 외부 분포(out-of-distribution) 테스트 세트에서 일반화 능력을 향상시켜 Charades-CD에서 13.84%의 성능 격차 감소와 ActivityNet-CD에서 63.05%의 격차 감소를 달성하여 모델의 강건성 향상이著명하다.

ABSTRACT

The temporal sentence grounding in video (TSGV) task is to locate a temporal moment from an untrimmed video, to match a language query, i.e., a sentence. Without considering bias in moment annotations (e.g., start and end positions in a video), many models tend to capture statistical regularities of the moment annotations, and do not well learn cross-modal reasoning between video and language query. In this paper, we propose two debiasing strategies, data debiasing and model debiasing, to "force" a TSGV model to capture cross-modal interactions. Data debiasing performs data oversampling through video truncation to balance moment temporal distribution in train set. Model debiasing leverages video-only and query-only models to capture the distribution bias, and forces the model to learn cross-modal interactions. Using VSLNet as the base model, we evaluate impact of the two strategies on two datasets that contain out-of-distribution test instances. Results show that both strategies are effective in improving model generalization capability. Equipped with both debiasing strategies, VSLNet achieves best results on both datasets.

연구 동기 및 목표

  • 시간적 문장 기준화 영상(TSGV) 데이터셋에서 순간 주석(annotation)의 통계적 규칙성에 기반해 모델이 과적합하는 분포 편향 문제를 해결하기 위해.
  • 편향된 주석 패턴에 대한 의존도를 줄임으로써, 외부 분포(ood) 테스트 세트에서의 모델 일반화 능력을 향상시키기 위해.
  • 데이터 수준과 모델 수준에서 편향을 타깃으로 삼는 상호보완적인 두 가지 탈편향 전략—데이터 탈편향 및 모델 탈편향—을 제안하고 검증하기 위해.
  • 탈편향이 내부 분포(in-distribution) 성능을 희생시키지 않으면서도 외부 분포 일반화에서 더 나은 강건성과 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 데이터 탈편향은 각 영상에서 겹치지 않는 여러 클립을 생성하기 위해 영상 자르기(video truncation)를 수행하여, 다양한 시작/종료 시간을 가진 새로운 훈련 샘플을 생성함으로써 순간 주석의 시간 분포를 균형 잡는다.
  • 이 방법은 부족한 시간 영역에서의 순간을 오버샘플링하여, 모델이 통계적 편향이 아닌 다중모odal 상호작용에 집중하도록 유도한다.
  • 모델 탈편향은 영상 전용 및 쿼리 전용 입력을 위한 두 개의 단일모달 브랜치를 도입하여, 편향 분포를 독립적으로 학습하고 추정한다.
  • 훈련 중 손실 조정을 적용한다: 단일모달 모델에 의해 예측된 편향 예시의 기울기를 줄이고, 덜 편향된 예시의 기울기를 증폭시켜 강건한 다중모달 학습을 촉진한다.
  • 탈편향 프레임워크는 VSLNet 기반 모델에 통합되어 최소한의 아키텍처 변경으로 종단 간(end-to-end) 훈련이 가능하도록 한다.
  • 이 방법은 내부 분포(iid)와 외부 분포(ood) 테스트 세트가 별도로 마련된 Charades-CD와 ActivityNet-CD에서 평가된다.

실험 결과

연구 질문

  • RQ1TSGV 데이터셋에서의 분포 편향이 외부 분포 테스트 세트에서의 모델 일반화에 어떤 영향을 미치는가?
  • RQ2영상 자르기 기반의 데이터 수준 증강이 순간 주석 분포를 효과적으로 재균형화하고 모델의 통계적 규칙성에 대한 의존도를 줄일 수 있는가?
  • RQ3영상 및 쿼리 단일모달 모델이 주요 TSGV 모델 훈련 중 편향을 얼마나 효과적으로 분리할 수 있는가?
  • RQ4데이터 탈편향과 모델 탈편향 전략을 병합하면 단독으로 적용했을 때보다 더 나은 일반화 성능을 달성할 수 있는가?
  • RQ5편향이 보정되지 않은 경우 모델의 성능이 외부 분포 세트에서 얼마나 악화되는가, 그리고 제안된 방법이 이 악화를 얼마나 효과적으로 완화할 수 있는가?

주요 결과

  • Charades-CD 데이터셋에서, VSLNet의 내부 분포와 외부 분포 테스트 세트 간 성능 격차(p_gap)는 데이터 탈편향을 통해 30.70%에서 13.84%로 감소하여 일반화 능력이著명하게 향상됨.
  • 모델 탈편향만 적용했을 경우, VSLNet의 Charades-CD에서 p_gap는 15.67%로 감소하여 단일모달 브랜치를 통한 효과적인 편향 분리가 가능함을 시사함.
  • 데이터 및 모델 탈편향 전략을 모두 적용했을 경우, VSLNet는 두 데이터셋에서 모두 최고의 전반적 성능를 기록하였으며, 특히 외부 분포 일반화에서 가장 큰 향상이 이루어짐.
  • 더 복잡한 ActivityNet-CD 데이터셋에서, 두 탈편향 전략을 모두 적용했을 경우 VSLNet의 p_gap는 63.05%에서 30.70%로 감소하여 도전적인 다변화된 데이터에서의 강건성을 입증함.
  • 데이터 탈편향에서 클립 수(N_clip)는 성능에 영향을 미치며, N_clip = 5일 때 두 데이터셋에서 가장 우수한 외부 분포 일반화 성능를 기록함. N_clip = 4 및 6보다 뛰어남.
  • 제거 실험(ablation study) 결과, 효과적인 모델 탈편향을 위해서는 영상 전용 및 쿼리 전용 단일모달 브랜치가 모두 필요하며, 단일 브랜치만 사용할 경우 외부 분포 세트에서 성능이 열등함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.