Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-end Dense Video Captioning as Sequence Generation

Wanrong Zhu, Bo Pang|arXiv (Cornell University)|2022. 04. 18.
Multimodal Machine Learning Applications인용 수 16
한 줄 요약

이 논문은 다중모odal Transformer를 사용하여 이벤트 로컬라이제이션과 캡셔닝 생성을 하나의 시퀀스-투-시퀀스 작업으로 통합하는 엔드 투 엔드 디퍼지 비디오 캡셔닝 프레임워크를 제안한다. 분할과 캡셔닝을 모두 시퀀스 생성으로 공식화함으로써, 대규모 사전 훈련된 텍스트 모델(예: T5)을 활용하고 YouCook2 및 ViTT에서 경쟁적인 성능을 달성한다. 이는 공동 모델링이 분할 정확도를 향상시키고 일반 및 도메인 전용 사전 훈련을 효과적으로 활용할 수 있음을 시사한다.

ABSTRACT

Dense video captioning aims to identify the events of interest in an input video, and generate descriptive captions for each event. Previous approaches usually follow a two-stage generative process, which first proposes a segment for each event, then renders a caption for each identified segment. Recent advances in large-scale sequence generation pretraining have seen great success in unifying task formulation for a great variety of tasks, but so far, more complex tasks such as dense video captioning are not able to fully utilize this powerful paradigm. In this work, we show how to model the two subtasks of dense video captioning jointly as one sequence generation task, and simultaneously predict the events and the corresponding descriptions. Experiments on YouCook2 and ViTT show encouraging results and indicate the feasibility of training complex tasks such as end-to-end dense video captioning integrated into large-scale pretrained models.

연구 동기 및 목표

  • 이벤트 로컬라이제이션과 캡셔닝을 별도의 모델로 사용하는 두 단계 기반 디퍼지 비디오 캡셔닝 파이프라인의 한계를 해결하기 위해.
  • 디퍼지 비디오 캡셔닝과 같은 복잡한 다중모달 작업이 하나의 시퀀스 생성 파라다임으로 통합될 수 있는지 탐색하기 위해.
  • 작업을 시퀀스 생성으로 재정의함으로써, 대규모 사전 훈련된 텍스트 모델(예: T5)을 엔드 투 엔드 디퍼지 비디오 캡셔닝에 활용할 수 있도록 하기 위해.
  • 일반 목적(예: T5) 및 도메인 전용(예: WikiHow) 사전 훈련이 디퍼지 비디오 캡셔닝 성능에 미치는 영향을 평가하기 위해.
  • 분할과 캡셔닝을 공동으로 모델링할 경우 고립된 작업 훈련 대비 성능 향상이 이루어지는지 조사하기 위해.

제안 방법

  • 모델는 시퀀스-투-시퀀스 생성 작업으로 간주하여, 타겟 시퀀스가 이벤트 경계와 해당 캡셔닝을 구조화된 토큰 형식으로 인코딩하도록 한다.
  • 저자들은 단순 연결(SimpleConcat) 및 임베딩 타임(EmbTime)과 같은 다수의 작업 정의를 설계하여, 시간 경계와 캡셔닝을 하나의 텍스트 시퀀스에 통합하여 엔드 투 엔드 훈련을 가능하게 한다.
  • 시각적 특징은 비디오 프레임에서, 텍스트 임베딩은 타겟 시퀀스에서 유래된 다중모달 트랜스포머 인코더-디코더 아키텍처를 사용한다.
  • 일반 목적(예: T5) 및 도메인 전용(예: WikiHow) 텍스트 코퍼스에서의 사전 훈련을 통해 YouCook2 및 ViTT에서 미세조정을 수행한다.
  • 단일 디코더를 통한 공동 최적화를 통해 분할과 캡셔닝을 동시에 처리함으로써 별도의 아키텍처나 파이프라인을 피할 수 있다.
  • 다중 작업 사전 훈련을 지원하며, 기존의 대규모 시퀀스 생성 모델 인fra를 재사용할 수 있다.

실험 결과

연구 질문

  • RQ1디퍼지 비디오 캡셔닝이 효과적으로 하나의 시퀀스 생성 작업으로 모델링될 수 있는가? 이는 사전 훈련된 언어 모델을 사용한 엔드 투 엔드 훈련을 가능하게 하는가?
  • RQ2이벤트 로컬라이제이션과 캡셔닝을 공동으로 모델링할 경우, 두 단계 파이프라인 대비 성능 향상이 이루어지는가?
  • RQ3일반 목적(예: T5)과 도메인 전용(예: WikiHow) 텍스트 코퍼스에서의 사전 훈련이 디퍼지 비디오 캡셔닝에 어떤 영향을 미치는가?
  • RQ4작업 무관 및 작업 특정 사전 훈련의 이점은 통합될 수 있으며, 도메인 전용 데이터가 있을지라도 일반 사전 훈련이 여전히 유의미한 성능 향상에 기여하는가?
  • RQ5시퀀스 정의 방식(예: SimpleConcat 대비 EmbTime)의 선택이 모델 성능과 훈련 안정성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 엔드 투 엔드 시퀀스 생성 접근법은 YouCook2 및 ViTT에서 경쟁적인 성능을 달성하며, 분할 정확도에서 이전의 두 단계 기반 방법을 능가한다.
  • T5 및 WikiHow에서의 사전 훈련은 상당한 성능 향상을 가져오며, 조합(T5 + WikiHow)이 가장 큰 향상을 이룬다.
  • 도메인 전용 사전 훈련(WikiHow)이 이루어진 상태에서도 T5에서의 추가 사전 훈련이 측정 가능한 추가 성능 향상을 제공함으로써 상호보완적인 이점이 있음을 시사한다.
  • 분할과 캡셔닝을 공동으로 모델링할 경우, 단순히 로컬라이제이션에 집중한 모델 대비 분할 mIoU가 향상된다.
  • 분할 예측의 IoU가 높은 경우(≥90%), YouCook2에서는 평균 ROUGE-L 점수가 30.18, ViTT에서는 44.33에 도달하여 정확한 로컬라이제이션에서 높은 캡셔닝 품질을 확보함을 보여준다.
  • EmbTime 정의 방식은 일부 설정에서 SimpleConcat 대비 비현저한 향상을 보였지만, 결과는 혼합적이며, 훈련에서부터 시작하는 설정에서는 변동성이 높았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.