Skip to main content
QUICK REVIEW

[논문 리뷰] Spatio-Temporal Dynamics and Semantic Attribute Enriched Visual Encoding for Video Captioning

Nayyer Aafaq, Naveed Akhtar|arXiv (Cornell University)|2019. 02. 27.
Multimodal Machine Learning Applications참고 문헌 58인용 수 13
한 줄 요약

이 논문은 2D 및 3D CNN 특징에 대한 계층적 단순 푸리에 변환을 사용하여 시공간적 역동성과 의미적 속성을 향상시키는 새로운 시각적 인코딩 방법을 제안한다. 또한 객체 검출기를 통해 공간적 및 의미적 맥락을 확보한다. 강화된 시각적 특징은 경량의 이중층 GRU 언어 모델에 입력되어 MSVD 및 MSR-VTT에서 METEOR와 ROUGE-L 각각 최대 2.64%, 2.44% 향상으로 새로운 최고 성능을 달성한다.

ABSTRACT

Automatic generation of video captions is a fundamental challenge in computer vision. Recent techniques typically employ a combination of Convolutional Neural Networks (CNNs) and Recursive Neural Networks (RNNs) for video captioning. These methods mainly focus on tailoring sequence learning through RNNs for better caption generation, whereas off-the-shelf visual features are borrowed from CNNs. We argue that careful designing of visual features for this task is equally important, and present a visual feature encoding technique to generate semantically rich captions using Gated Recurrent Units (GRUs). Our method embeds rich temporal dynamics in visual features by hierarchically applying Short Fourier Transform to CNN features of the whole video. It additionally derives high level semantics from an object detector to enrich the representation with spatial dynamics of the detected objects. The final representation is projected to a compact space and fed to a language model. By learning a relatively simple language model comprising two GRU layers, we establish new state-of-the-art on MSVD and MSR-VTT datasets for METEOR and ROUGE_L metrics.

연구 동기 및 목표

  • 표준 평균 풀링 CNN 특징을 초월한 시각적 특징 표현 향상을 통해 비디오 자동 생성 성능을 향상시키는 것.
  • 2D 및 3D CNN 활성화에 대한 계층적 단순 푸리에 변환을 통해 비디오의 명시적 시공간 역동성을 모델링하는 것.
  • 객체 검출기 및 3D CNN를 통해 얻은 객체 정체성, 위치, 운동과 같은 고수준 의미적 속성을 통합하여 시각적 표현을 풍부하게 하는 것.
  • 풍부한 시각적 인코딩과 함께 간단한 얕은 GRU 언어 모델이 복잡한 모델을 능가할 수 있음을 입증하는 것.
  • METEOR 및 ROUGE-L 지표를 사용하여 MSVD 및 MSR-VTT 기준 데이터셋에서 새로운 최고 성능을 확립하는 것.

제안 방법

  • 전체 비디오에 걸쳐 2D (InceptionResNetV2) 및 3D (C3D) CNN의 활성화 맵에 계층적 단순 푸리에 변환(SFT)을 적용하여 미세한 시간 역동성을 인코딩한다.
  • YOLO 객체 검출기를 사용하여 경계 상자 위치, 클래스 레이블, 객체 수를 포함한 객체 수준의 의미 정보를 추출하여 공간 역동성과 수량성을 모델링한다.
  • 언어 모델 사전와 어휘를 정렬함으로써 3D CNN 및 객체 검출기 출력에서 유래한 의미 임베딩을 통합한다.
  • SFT로 인코딩된 역동성과 의미적 속성을 통합한 융합된 시각적 표현을 완전 연결층을 통해 압축된 저차원 공간으로 투영한다.
  • 압축된 시각적 코드를 기반으로 압축된 시각적 코드를 기반으로 이중층 게이팅 순환 단위(Gated Recurrent Unit, GRU) 언어 모델을 훈련시켜 자연어 자동 생성 문장을 생성한다.
  • 신경 세포 단위 활성화를 시간에 걸쳐 처리하는 계층적 SFT 전략을 통해 비디오의 시간적 진화 패턴을 유지한다.

실험 결과

연구 질문

  • RQ1보다 정교한 시각적 인코딩 메커니즘이 표준 CNN 특징의 평균 풀링을 초월해 비디오 자동 생성 성능을 크게 향상시킬 수 있는가?
  • RQ2CNN 활성화에 대한 계층적 단순 푸리에 변환이 비디오 시퀀스의 시공간 역동성을 얼마나 잘 포착하고 유지할 수 있는가?
  • RQ3객체 정체성, 위치, 운동과 같은 고수준 의미적 속성이 더 정확하고 기술적인 자동 생성 문장 생성에 기여하는 정도는 어떠한가?
  • RQ4풍부한 의미적 정보와 역동성을 지닌 시각적 특징이 제공될 경우, 상대적으로 단순한 이중층 GRU 언어 모델이 더 복잡한 모델을 능가할 수 있는가?
  • RQ5제안된 시각적 인코딩 방법이 MSVD 및 MSR-VTT와 같은 다양한 비디오 자동 생성 기준 데이터셋에 일반화되는가?

주요 결과

  • 제안된 방법은 MSVD 데이터셋에서 새로운 최고 성능을 달성하여 이전 방법 대비 METEOR는 최대 2.64% 향상되고 ROUGE-L은 2.44% 향상되었다.
  • MSR-VTT 데이터셋에서는 METEOR 점수 28.4와 ROUGE-L 점수 60.7을 기록하여 M3-VC, RecNet local, TDDF를 포함한 모든 비교 모델을 능가했다.
  • 2D 및 3D CNN 특징에 대한 계층적 SFT 사용이 표준 평균 풀링보다 뚜렷한 성능 향상을 보였으며, 추론 분석 결과 상당한 성능 향상이 확인되었다.
  • GRU 레이어 수를 두 개 초과로 늘일 경우 BLEU-4 성능이 악화되어 제안된 시각적 인코딩과 함께 두 개의 GRU 레이어가 최적임을 시사한다.
  • GRU 레이어의 상태 크기를 2048로 설정할 경우 최적의 성능을 달성했으며, 더 높은 크기(예: 4096)로 늘려도 성능 향상이 없었다.
  • 정성적 분석 결과, 생성된 문장이 부분 클립에 집중하기보다는 객체의 수량, 운동, 전체 비디오 맥락을 더 잘 포착하고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.