Skip to main content
QUICK REVIEW

[논문 리뷰] TACo: Token-aware Cascade Contrastive Learning for Video-Text Alignment

Jianwei Yang, Yonatan Bisk|arXiv (Cornell University)|2021. 08. 23.
Multimodal Machine Learning Applications참고 문헌 53인용 수 4
한 줄 요약

TACo는 문법적 정보를 반영한 대비 손실과 계단식 샘플링 전략을 통해 내용어(명사, 동사)에 초점을 맞춰 비디오-텍스트 정렬을 향상시키는 토큰 인지형 계단식 대비 학습 방법을 제안한다. 이 방법은 추가 파rameter 없이 YouCook2, MSR-VTT, ActivityNet 세 가지 텍스트-비디오 검색 벤치마크에서 최고 성능을 달성한다.

ABSTRACT

Contrastive learning has been widely used to train transformer-based vision-language models for video-text alignment and multi-modal representation learning. This paper presents a new algorithm called Token-Aware Cascade contrastive learning (TACo) that improves contrastive learning using two novel techniques. The first is the token-aware contrastive loss which is computed by taking into account the syntactic classes of words. This is motivated by the observation that for a video-text pair, the content words in the text, such as nouns and verbs, are more likely to be aligned with the visual contents in the video than the function words. Second, a cascade sampling method is applied to generate a small set of hard negative examples for efficient loss estimation for multi-modal fusion layers. To validate the effectiveness of TACo, in our experiments we finetune pretrained models for a set of downstream tasks including text-video retrieval (YouCook2, MSR-VTT and ActivityNet), video action step localization (CrossTask), video action segmentation (COIN). The results show that our models attain consistent improvements across different experimental settings over previous methods, setting new state-of-the-art on three public text-video retrieval benchmarks of YouCook2, MSR-VTT and ActivityNet.

연구 동기 및 목표

  • 대비 학습에서 기능어와 내용어를 동일하게 취급하는 비디오-텍스트 작업에서의 세분화된 정렬 부족 문제를 해결하기 위해.
  • 다중 모odal 융합 과정에서 대비 손실 추정의 효율성과 효과를 높이기 위해 초기 손실의 정렬 점수를 기반으로 구조적으로 하드 네거티브 예제를 선택함으로써.
  • 문법 클래스 정보를 활용하는 두 단계의 대비 학습 파이프라인을 통해 비디오-텍스트 정렬을 향상시키기 위해.
  • 제안된 방법이 검색, 동작 단계 국소화, 동작 분할과 같은 다양한 후행 작업으로 잘 일반화되는지 입증하기 위해.
  • 이전 방법들과 비교해 더 단순하고 파rameter 효율적인 대비 학습 프레임워크를 통해 최고 성능을 달성하기 위해.

제안 방법

  • 문법 클래스에 기반해 내용어(예: 명사, 동사)에 대해서만 유사도를 계산하는 토큰 인지형 대비 손실을 도입하여 세분화된 기반 정렬을 향상시킨다.
  • 초기 손실(L1 및 L2)의 정렬 점수를 사용해 최종 대비 손실을 위한 작은 하드 네거티브 예제 집합을 선택하는 계단식 샘플링 방법을 적용한다.
  • 문장 수준의 손실(L1), 내용어에 대한 토큰 수준의 손실(L2), 그리고 하드 네거티브에 대한 최종 문장 수준의 손실(L3)을 순차적으로 사용한다.
  • 정렬 점수를 L1 및 L2에서 온라인으로 활용해 L3의 하드 네거티브 예제를 유도하는 다단계 훈련 파이프라인을 구현함으로써 계산 비용을 감소시킨다.
  • 표준 트랜스포머 기반의 비디오-언어 모델 아키텍처를 유지하되, 문법 인지형 손실과 구조적 샘플링을 통해 대비 학습 목표를 강화한다.
  • Howto100M에서 훈련하고, 검색, 국소화, 분할을 위한 표준 평가 프로토콜을 사용해 후행 데이터셋에서 미세조정한다.

실험 결과

연구 질문

  • RQ1모든 단어를 동일하게 취급하는 것과 비교해, 대비 학습 목표에서 내용어(명사, 동사)에 집중하는 것이 비디오-텍스트 정렬을 향상시키는가?
  • RQ2초기 정렬 점수를 기반으로 하드 네거티브를 계단식으로 샘플링하는 것이 랜덤 샘플링보다 다중 모달 융합 레이어 학습을 더 효율적으로 개선하는가?
  • RQ3추가 파rameter 없이도 복잡한 다손실 프레임워크보다 더 단순한 대비 학습 파이프라인으로도 비디오-텍스트 검색에서 최고 성능을 낼 수 있는가?
  • RQ4TACo에서 학습된 표현은 동작 단계 국소화 및 동작 분할과 같은 후행 작업으로 얼마나 잘 전이되는가?
  • RQ5다양한 도메인 갭을 가진 다양한 벤치마크에서 TACo의 성능은 최고 수준의 방법들과 비교해 어떻게 되는가?

주요 결과

  • TACo는 세 가지 텍스트-비디오 검색 벤치마크에서 최고 성능을 기록한다: YouCook2 (R1@1: 86.3%), MSR-VTT (R1@1: 55.7%), ActivityNet (R1@1: 72.4%), 이는 이전 방법들을 능가한다.
  • YouCook2에서 TACo는 이전 최고 성능 방법보다 Recall@1에서 2.1%p의 절대적 향상을 달성하여 강력한 제로샷 일반화 능력을 보였다.
  • 미세조정 후 TACo는 MSR-VTT에서 58.2%의 Recall@1, ActivityNet에서 73.1%를 기록하여 도메인 이동 상황에서도 뛰어난 성능을 보였다.
  • 행동 단계 국소화를 위한 CrossTask에서 TACo는 평균 Recall이 1.2%p 높아 UniVL을 능가했으며, 더 나은 다중 모달 정렬 능력을 보였다.
  • 행동 분할을 위한 COIN 데이터셋에서 TACo는 평균 F1 점수 78.9%를 기록했으며, MIL-NCE를 능가하고 UniVL과 동등한 성능을 보여 비디오 표현 학습 능력이 뛰어나다는 것을 입증했다.
  • 절단 실험 결과, 토큰 인지형 손실과 계단식 샘플링을 모두 조합할 경우 최고의 성능을 기록했으며, 각 구성 요소가 최종 성능 향상에 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.