Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-granularity Correspondence Learning from Long-term Noisy Videos

Yijie Lin, Jie Zhang|arXiv (Cornell University)|2024. 01. 30.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 장기적인 비디오 이해를 위한 다중 균질성 대응 학습을 통합하는 노이즈에 강건한 최적 운반 프레임워크인 Norton을 제안한다. 이는 시간적 최적 운반, 소프트 최대값 정렬, 결함 있는 음성 샘플 보정을 통해 굵은 단위(클립-캡션)와 미세한 단위(프레임-단어)의 오차를 동시에 해결한다. Norton은 최소한의 계산 오버헤드로 장거리 시간적 의존성을 효과적으로 모델링하여 비디오 검색, 비디오QA, 동작 분할 벤치마크에서 최신 기준 성능을 달성한다.

ABSTRACT

Existing video-language studies mainly focus on learning short video clips, leaving long-term temporal dependencies rarely explored due to over-high computational cost of modeling long videos. To address this issue, one feasible solution is learning the correspondence between video clips and captions, which however inevitably encounters the multi-granularity noisy correspondence (MNC) problem. To be specific, MNC refers to the clip-caption misalignment (coarse-grained) and frame-word misalignment (fine-grained), hindering temporal learning and video understanding. In this paper, we propose NOise Robust Temporal Optimal traNsport (Norton) that addresses MNC in a unified optimal transport (OT) framework. In brief, Norton employs video-paragraph and clip-caption contrastive losses to capture long-term dependencies based on OT. To address coarse-grained misalignment in video-paragraph contrast, Norton filters out the irrelevant clips and captions through an alignable prompt bucket and realigns asynchronous clip-caption pairs based on transport distance. To address the fine-grained misalignment, Norton incorporates a soft-maximum operator to identify crucial words and key frames. Additionally, Norton exploits the potential faulty negative samples in clip-caption contrast by rectifying the alignment target with OT assignment to ensure precise temporal modeling. Extensive experiments on video retrieval, videoQA, and action segmentation verify the effectiveness of our method. Code is available at https://lin-yijie.github.io/projects/Norton.

연구 동기 및 목표

  • 장기적인 비디오 이해에서 클립-캡션 및 프레임-단어 쌍이 자주 오차가 나는 다중 균질성 노이즈 대응(MNC) 문제를 해결하기 위해.
  • 전체 장기 비디오의 직접 모델링을 피하여 장거리 시간적 의존성 학습의 계산 비용을 줄이기 위해.
  • 비디오-텍스트 대응에서 비동기 및 관련 없는 오차(粗 granularity)와 부분적 상관관계(細 granularity) 노이즈를 동시에 다룸으로써 비디오 표현 학습을 향상시키기 위해.
  • 최적 운반 기반 재할당을 통해 클립-캡션 대비 학습에서 잠재적으로 결함 있는 음성 샘플을 활용하여 시간 모델링 정확도를 향상시키기 위해.
  • 粗 granularity 및 細 granularity 대응을 하나의 최적 운반 프레임워크로 통합하여 확장 가능하고 강건한 비디오-언어 사전학습을 가능하게 하기 위해.

제안 방법

  • Norton는 최적 운반(OT) 기반의 비디오-단락 대비 손실을 활용하여 클립과 자연어 단락 간의 시퀀스 수준 거리를 측정함으로써 장기적인 시간적 정렬에 강건한 성능을 제공한다.
  • 비효율적인 클립과 캡션을 걸러내고 운반 거리 기반으로 비동기 쌍을 재정렬함으로써 굵은 단위 오차를 감소시키기 위해, 정렬 가능한 프롬프트 버킷(APB)을 도입한다.
  • 토큰 수준의 소프트 최대값 연산자를 적용하여 클립-캡션 쌍 내에서 중요한 단어와 핵심 프레임을 식별하고, 로그-합-지배 근사법을 통해 미세한 유사도 측정을 향상시킨다.
  • 최적 운반을 사용하여 클립과 캡션 간의 정렬 타겟을 할당하고, 잘못된 음성 샘플을 보정함으로써 클립-캡션 대비 학습에서 정확한 시간 모델링을 보장한다.
  • 통합된 OT 기반 최적화 내에서 비디오-단락 및 클립-캡션 대비 손실을 통합함으로써 다중 균질성 대응의 엔드 투 엔드 학습을 가능하게 한다.
  • 행동 분할을 위해 단일 레이어 분류 헤드를 갖춘 시각 인코더를 활용하고, 비디오 검색 및 비디오QA에 표준 평가 프로토콜을 적용한다.

실험 결과

연구 질문

  • RQ1최적 운반은 어떻게 장기적인 비디오-언어 학습에서 굵은 단위와 미세한 단위의 오차를 동시에 해결하는 데 활용될 수 있는가?
  • RQ2정렬 가능한 프롬프트 버킷은 노이즈가 있는 클립-캡션 대응 상황에서 비디오-단락 검색의 강건성에 얼마나 기여하는가?
  • RQ3소프트 최대값 연산자는 주목할 만한 시각적 및 텍스트적 요소에 집중함으로써 프레임-단어의 미세한 대응을 향상시킬 수 있는가?
  • RQ4최적 운반 기반 재할당을 통해 결함 있는 음성 샘플을 활용하면 장기 비디오에서 클립-캡션 대비 학습이 어떻게 향상되는가?
  • RQ5다양한 하이퍼파라미터 설정(예: log-sum-exp의 α, APB의 p)은 다중 균질성 대응 학습의 전체 성능에 어떤 영향을 미치는가?

주요 결과

  • Norton는 비디오 검색에서 최신 기준 성능을 달성하였으며, 비디오-단락 검색에서 R@1 76.1% 및 R@5 95.0%를 기록하여 이전 방법인 TempCLR 및 VideoCLIP를 능가한다.
  • YouCookII에서의 행동 분할 성능은 프레임 단위 정확도 75.2%를 달성하였으며, 최고의 베이스라인인 VideoCLIP보다 1.5% 높다.
  • 제거 실험 결과, 결함 있는 음성 샘플 보정 전략을 통합함으로써 R@1이 베이스라인 대비 1.4% 향상되어 노이즈가 많은 환경에서의 효과성을 입증한다.
  • α = 1인 소프트 최대값 연산자를 사용할 경우 최고의 성능을 기록하였으며, 평균 평균 기준 대비 R@1에서 0.3% 향상되어 미세한 대응에서의 기여를 입증한다.
  • p = 30% (하위 30% 유사도 임계값)인 정렬 가능한 프롬프트 버킷을 사용할 경우, 배경이 있는 비디오-단락 검색에서 R@1이 베이스라인 대비 0.9% 향상되어 최적의 성능을 기록한다.
  • 전체 Norton 모델(J)은 클립-캡션 검색에서 R@1 24.2% 및 R@5 51.9%를 기록하여 모든 평가 지표에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.