Skip to main content
QUICK REVIEW

[논문 리뷰] Video + CLIP Baseline for Ego4D Long-term Action Anticipation

Srijan Das, Michael S. Ryoo|arXiv (Cornell University)|2022. 07. 01.
Human Pose and Action Recognition인용 수 7
한 줄 요약

이 논문은 사전 훈련된 CLIP 모델과 Slowfast 영상 인코더의 특징을 융합하여 Ego4D 데이터셋에서 장기 행동 예측을 위한 비디오 + CLIP 베이스라인을 제안한다. 텍스트 프롬프트로부터 시간적 맥락을 얻는 크로스 어텐션을 사용해 CLIP 임베딩을 집계함으로써, 검증 세트에서 Z=20, K=5일 때 0.7125 편집 거리(동사)와 0.747(명사)를 기록하며 최신 기술을 초월하는 성능을 달성한다.

ABSTRACT

In this report, we introduce our adaptation of image-text models for long-term action anticipation. Our Video + CLIP framework makes use of a large-scale pre-trained paired image-text model: CLIP and a video encoder Slowfast network. The CLIP embedding provides fine-grained understanding of objects relevant for an action whereas the slowfast network is responsible for modeling temporal information within a video clip of few frames. We show that the features obtained from both encoders are complementary to each other, thus outperforming the baseline on Ego4D for the task of long-term action anticipation. Our code is available at github.com/srijandas07/clip_baseline_LTA_Ego4d.

연구 동기 및 목표

  • 사전 훈련된 이미지-텍스트 모델인 CLIP을 활용하여 일상 시각 영상에서의 장기 행동 예측을 향상시키기 위해.
  • CLIP가 프레임 수준의 이해는 강력하지만 동사 예측을 위한 시간적 추론 모델링 능력이 떨어지는 점을 보완하기 위해.
  • CLIP의 세밀한 시각 이해 능력과 Slowfast의 시간적 모델링 능력 간 상호보완적 융합을 탐색하여 행동 예측 성능 향상에 기여하기 위해.
  • 텍스트 임베딩과의 단순 평균 풀링 및 연결보다 주어진 텍스트 프롬프트 기반 어텐션 기반 특징 집계가 더 우수한 성능을 내는지 검증하기 위해.

제안 방법

  • 사전 훈련된 ViT-B/16 인코더를 사용해 비디오 클립의 각 프레임에서 CLIP 이미지 임베딩을 추출하며, 미세조정 없이 수행한다.
  • Ego4D 데이터셋의 상위 명사, 동사, 시나리오, 장소에 대한 프롬프트 템플릿을 사용해 CLIP의 텍스트 인코더를 통해 텍스트 임베딩을 생성한다.
  • 멀티헤드 크로스 어텐션 메커니즘을 사용해 CLIP 이미지 및 텍스트 임베딩을 융합하며, 텍스트 프롬프트를 쿼리로, 이미지 특징를 키/밸류로 사용한다.
  • CLIP 어텐션 집계 기반 기술자와 Slowfast 네트워크 특징(2048 + 512 차원)을 연결하여 클립 수준의 표현을 구성한다.
  • 기존 Ego4D 프레임워크를 따르며, 6층의 트랜스포머 집계 모듈과 디코더 네트워크를 사용해 시퀀스 예측을 수행한다.
  • 8개의 A5000 GPU를 사용해 배치 크기가 64인 상태에서 30 에포크 동안 학습하며, 기본 학습률을 0.0001로 설정해 집계 및 디코더 헤드를 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1비디오 전용 시간적 인코더와 융합된 사전 훈련된 CLIP 특징이 장기 행동 예측 성능 향상에 기여하는가?
  • RQ2CLIP 특징의 어텐션 기반 시간적 집계 방식이 단순 평균 풀링보다 비디오 수준의 표현 학습에서 더 나은 성능을 내는가?
  • RQ3CLIP의 시간적 모델링 부재에도 불구하고, 일상 시각 영상에서 동사 예측과 명사 예측에 대해 CLIP의 성능은 얼마나 유의미한가?
  • RQ4이미지 특징에 CLIP 텍스트 특징을 연결하면 이미지 특징만 사용할 때보다 추가적인 성능 향상이 이루어지는가?
  • RQ5하이브리드 CLIP + Slowfast 아키텍처가 원래 Ego4D 베이스라인을 초월해 장기 행동 예측 성능을 향상시킬 수 있는가?

주요 결과

  • CLIP 어텐션 변형 버전이 가장 뛰어난 성능을 기록하여, 편집 거리가 동사 0.7125, 명사 0.747을 기록하며 원래 베이스라인(0.745, 0.779)을 초월했다.
  • CLIP 이미지 전용 베이스라인(L2)은 원래 베이스라인보다 성능이 열 劣하였으며, 이는 난이도 높은 CLIP 특징이 동사 예측을 위한 시간적 추론 능력이 부족함을 시사한다.
  • CLIP 이미지 특징에 텍스트 특징을 추가로 연결한 L3는 성능 향상이 없었으며, 이는 명시적 텍스트 특징 연결이 추가적인 상호보완적 이득을 제공하지 않는다는 것을 의미한다.
  • CLIP 어텐션 메커니즘이 텍스트 프롬프트에 기반해 관련 프레임을 효과적으로 가중치를 부여함으로써 우수한 시간적 집계를 달성했다.
  • CLIP와 Slowfast 특징의 융합은 상호보완적인 정보를 제공하였으며, CLIP는 프레임 수준 이해를 강화하고 Slowfast는 운동 패턴을 포착했다.
  • 이 방법은 CVPR 2022에서 Ego4D 챌린지 장기 행동 예측 부문에서 2위를 기록하여, 테스트 세트에서의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.