Skip to main content
QUICK REVIEW

[논문 리뷰] COOT: Cooperative Hierarchical Transformer for Video-Text Representation Learning

Simon Ging, Mohammadreza Zolfaghari|arXiv (Cornell University)|2020. 11. 01.
Multimodal Machine Learning Applications참고 문헌 81인용 수 75
한 줄 요약

COOT은 주의-인식 특징 집계(attention-aware feature aggregation)와 맥락형 변환기(contextual transformer)를 포함한 계층적 트랜스포머와 교차 모달 사이의 순환 일관성 손실을 도입하여, 강한 장기 시간적 모델링과 최첨단 검색/자막 성능을 갖는 비디오-텍스트 임베딩을 학습한다.

ABSTRACT

Many real-world video-text tasks involve different levels of granularity, such as frames and words, clip and sentences or videos and paragraphs, each with distinct semantics. In this paper, we propose a Cooperative hierarchical Transformer (COOT) to leverage this hierarchy information and model the interactions between different levels of granularity and different modalities. The method consists of three major components: an attention-aware feature aggregation layer, which leverages the local temporal context (intra-level, e.g., within a clip), a contextual transformer to learn the interactions between low-level and high-level semantics (inter-level, e.g. clip-video, sentence-paragraph), and a cross-modal cycle-consistency loss to connect video and text. The resulting method compares favorably to the state of the art on several benchmarks while having few parameters. All code is available open-source at https://github.com/gingsi/coot-videotext

연구 동기 및 목표

  • 다양한 해상도 수준(프레임/단어, 클립/문장, 비디오/단락)을 활용하는 비디오-텍스트 임베딩 공동 학습을 촉진한다.
  • 로컬-전역 의미 사이의 상호작용을 모델링하고 intra-레벨 시간 맥락을 집계하는 메커니즘을 개발한다.
  • 비디오와 텍스트 표현 간의 의미 정렬을 촉진하기 위해 사이클-일관성 손실(cycle-consistency loss)을 적용한다.

제안 방법

  • Attention-FA 도입: 간단한 풀링을 대체하여 intra-레벨 시간 상호작용을 포착하는 주의-인식 특징 집계 레이어.
  • Contextual Transformer(CoT) 도입: 로컬(클립/문장)과 전역 맥락 간의 inter-level 상호작용을 모델링한다.
  • 교차 모달 사이클-일관성 손실(CMC) 추가: 모달리티 간 클립과 문장 간 의미 정렬을 강화한다.
  • 세 가지 수준의 계층적 트랜스포머 채택: 프레임/단어 특징에 대한 시간적 트랜스포머, 클립/문장 특징에 대한 주의 기반 집계, 최종 임베딩에 대한 맥락형 트랜스포머.
  • Zhang et al. (2021)에 따른 클립-문장, 비디오-단락, 글로벌 맥락 수준의 정렬 손실과 최종 목표에 대한 교차 모달 CMC 손실(8)을 사용한다.

실험 결과

연구 질문

  • RQ1비디오와 텍스트의 계층적 모델링이 교차 모달 정렬과 검색 정확도를 어떻게 향상시키는가?
  • RQ2 intra-레벨 주의 집중과 inter-레벨 맥락 상호작용이 비디오-텍스트 태스크의 표현 품질을 향상시키는가?
  • RQ3교차 모달 사이클-일관성 손실이 비디오와 텍스트 임베딩 간 의미 정렬을 개선하는가?

주요 결과

  • COOT은 ActivityNet-captions와 YouCook2 데이터셋에서 최첨단 검색 성능을 달성하며, 이전 방법들에 비해 현저한 개선을 보인다.
  • 일마블 연구는 Attention-FA와 Contextual Transformer(CoT), 그리고 CMC 손실이 각각 성능 향상에 기여한다는 것을 보여준다.
  • ActivityNet-captions에서 COOT은 HSE 기반선 대비 R@1에서 최대 16.6% 평균 개선을 보이며 파라미터 수가 크게 줄어들었고(10.6M, 약 60% 감소).
  • YouCook2에서 COOT은 HowTo100M에서 사전 학습된 특징을 사용할 때 특히 여러 동시대 방법들을 능가하며, 분류 사전학습을 넘어서는 계층적 모델링의 이점을 얻는다.
  • COOT은 학습된 표현을 사용한 비디오 자막 생성을 경쟁력 있게 수행하며, 다른 자막 파이프라인에 비해 입력 특징이 더 적은 편이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.