Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP4Caption ++: Multi-CLIP for Video Caption

Mingkang Tang, Zhanyu Wang|arXiv (Cornell University)|2021. 10. 11.
Multimodal Machine Learning Applications참고 문헌 13인용 수 4
한 줄 요약

CLIP4Caption++는 다중 CLIP 영상 자동 번역 프레임워크를 제안하며, 세 가지 사전 훈련된 CLIP 모델(ViT-B/32, ViT-B/16, RN50x16)과 모션 특징을 위해 SlowFast를 사용하여 시각적 특징 추출을 향상시키고, 영상 자막을 통합하여 의미적 풍부함을 더하며, TSN 기반의 데이터 증강을 적용하고, 단어 수준 및 문장 수준의 앙상블 전략을 활용한다. 이 방법은 VATEX에서 86.5 CIDEr, YC2C에서 148.4, TVC에서 64.5를 기록하여 VALUE 챌린지 2021 영상 자동 번역 과제에서 1위를 차지했다.

ABSTRACT

This report describes our solution to the VALUE Challenge 2021 in the captioning task. Our solution, named CLIP4Caption++, is built on X-Linear/X-Transformer, which is an advanced model with encoder-decoder architecture. We make the following improvements on the proposed CLIP4Caption++: We employ an advanced encoder-decoder model architecture X-Transformer as our main framework and make the following improvements: 1) we utilize three strong pre-trained CLIP models to extract the text-related appearance visual features. 2) we adopt the TSN sampling strategy for data enhancement. 3) we involve the video subtitle information to provide richer semantic information. 3) we introduce the subtitle information, which fuses with the visual features as guidance. 4) we design word-level and sentence-level ensemble strategies. Our proposed method achieves 86.5, 148.4, 64.5 CIDEr scores on VATEX, YC2C, and TVC datasets, respectively, which shows the superior performance of our proposed CLIP4Caption++ on all three datasets.

연구 동기 및 목표

  • 다양한 강력한 사전 훈련된 CLIP 모델을 사용하여 영상 자동 번역의 시각적 특징 표현을 향상시키는 것.
  • 영상 자막 정보를 캡션 모델에 통합하여 의미적 이해를 향상시키는 것.
  • TSN 기반 프레임 샘플링을 통한 데이터 증강을 통해 훈련의 일반화 능력을 향상시키는 것.
  • 단어 수준 및 문장 수준의 앙상블 전략을 통해 모델의 강건성과 출력 품질을 향상시키는 것.
  • 추가 사전 훈련 또는 데이터 없이도 벤치마크 영상 자동 번역 데이터셋에서 최고 성능을 달성하는 것.

제안 방법

  • 영상 프레임에서 다중 스케일, 텍스트에 정렬된 시각적 특징을 추출하기 위해 세 가지 사전 훈련된 CLIP 모델—CLIP(ViT-B/32), CLIP(ViT-B/16), CLIP(RN50x16)—를 사용한다.
  • 64프레임 클립에서 별도의 느린 및 빠른 경로를 사용해 다른 프레임 속도로 작동하는 SlowFast(8x8)와 ResNet-50을 활용해 운동 특징을 추출한다.
  • 훈련 중 TSN 샘플링을 적용하여 K개의 세그먼트 각각에서 한 프레임씩 무작위로 샘플링함으로써 데이터 다양성을 증가시키고 일반화 능력을 향상시킨다.
  • 비디오 자막을 토큰화하고 시각적 특징과 함께 임베딩하며, 공통 임베딩 레이어와 토큰 유형 임베딩을 사용해 모odal 간을 구분한다.
  • 시각적 특징과 텍스트 특징을 연결하고 토큰 유형 임베딩을 통해 융합한 후, X-Linear/X-Transformer 인코더-디코더 아키텍처에 입력한다.
  • 두 단계 훈련 파이프라인을 구현한다: 첫 번째 단계는 향상된 특징에서의 사전 훈련, 두 번째 단계는 CIDEr 점수를 직접 최적화하기 위해 SCST를 사용한 미세 조정.

실험 결과

연구 질문

  • RQ1여러 사전 훈련된 CLIP 모델을 조합하면 영상 자동 번역을 위한 시각적 표현 품질을 향상시킬 수 있는가?
  • RQ2영상 자막을 통합하면 생성된 캡션의 의미적 풍부함에 어떤 영향을 미치는가?
  • RQ3TSN 기반 샘플링은 영상 자동 번역에서 모델의 일반화 능력을 얼마나 향상시키는가?
  • RQ4단어 수준 및 문장 수준의 앙상블 전략은 단일 모델 출력을 초월해 캡션 품질을 크게 향상시킬 수 있는가?
  • RQ5SCST 미세 조정을 통한 엔드 투 엔드 훈련은 표준 지도 학습에 비해 더 높은 CIDEr 점수를 낼 수 있는가?

주요 결과

  • 앙상블 모델은 VATEX 테스트 세트에서 86.5 CIDEr를 기록하여 이전 최고 성능을 초월했다.
  • YC2C에서는 148.4 CIDEr를 달성하여 대규모이고 다양한 영상 자동 번역 벤치마크에서 강력한 성능을 보였다.
  • TVC에서는 64.5 CIDEr를 기록하여 특성과 다양성이 다른 여러 데이터셋에서의 강건성을 입증했다.
  • 절단 실험 결과, SCST 미세 조정은 기준 모델 대비 CIDEr 점수를 24.1% 향상시켰으며, 목표 지표 최적화에 효과적임을 입증했다.
  • 자막 정보 추가로 CIDEr 점수가 0.8 포인트 향상되어 의미적 맥락을 풍부화시키는 데 기여함을 보여주었다.
  • 단어 수준 및 문장 수준의 앙상블 전략을 함께 적용하면 기준 모델 대비 CIDEr 점수를 31.2% 향상시켜 최종 출력 품질 향상에 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.