Skip to main content
QUICK REVIEW

[논문 리뷰] Non-Autoregressive Coarse-to-Fine Video Captioning

Bang Yang, Yuexian Zou|arXiv (Cornell University)|2019. 11. 27.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 순차적 디코딩으로 인해 느린 자동회귀형 비디오 캡션 모델의 문제를 해결하기 위해, 먼저 병렬로 시각적 단어(명사 및 동사)를 생성하여 굵은 틀을 형성한 후, 전용 디코딩 알고리즘을 사용해 반복적으로 보완하는 비자동회귀적 코arse-to-fine 비디오 캡션 모델을 제안한다. 이 방법은 MSVD 및 MSR-VTT 벤치마크에서 상태의 성능을 달성하며, 자동회귀 모델 대비 3.2배 빠른 추론 속도를 기록하고, 더 뛰어난 다양성과 유창성을 확보한다.

ABSTRACT

It is encouraged to see that progress has been made to bridge videos and natural language. However, mainstream video captioning methods suffer from slow inference speed due to the sequential manner of autoregressive decoding, and prefer generating generic descriptions due to the insufficient training of visual words (e.g., nouns and verbs) and inadequate decoding paradigm. In this paper, we propose a non-autoregressive decoding based model with a coarse-to-fine captioning procedure to alleviate these defects. In implementations, we employ a bi-directional self-attention based network as our language model for achieving inference speedup, based on which we decompose the captioning procedure into two stages, where the model has different focuses. Specifically, given that visual words determine the semantic correctness of captions, we design a mechanism of generating visual words to not only promote the training of scene-related words but also capture relevant details from videos to construct a coarse-grained sentence "template". Thereafter, we devise dedicated decoding algorithms that fill in the "template" with suitable words and modify inappropriate phrasing via iterative refinement to obtain a fine-grained description. Extensive experiments on two mainstream video captioning benchmarks, i.e., MSVD and MSR-VTT, demonstrate that our approach achieves state-of-the-art performance, generates diverse descriptions, and obtains high inference efficiency. Our code is available at https://github.com/yangbang18/Non-Autoregressive-Video-Captioning.

연구 동기 및 목표

  • 순차적 디코딩으로 인해 느린 자동회귀형 비디오 캡션 모델의 문제를 해결하기 위해.
  • 학습 중에 자주 생략되는 시각적으로 기반된 단어(예: 명사 및 동사)의 향상된 훈련을 통해 캡션 품질을 향상시키기 위해.
  • 비자동회귀 모델이 의미적 정확성과 유창성을 잘 포착하지 못하는 한계를 코arse-to-fine 두 단계의 캡션 생성 과정을 통해 극복하기 위해.
  • 단어 수준의 보완을 지원하는 새로운 디코딩 파라다임을 통해 고속, 다양성, 정확도를 동시에 확보한 캡션 생성을 가능하게 하기 위해.

제안 방법

  • 마스크된 언어 모델링을 사용해 양방향 자기주의 언어 모델을 훈련시켜, 어떤 단어 조합이라도 병렬 예측이 가능하도록 한다.
  • 먼저 핵심 시각적 단어(명사 및 동사)를 예측하여 굵은 틀이 되는 문장 템플릿을 형성하는 시각적 단어 생성 메커니즘을 도입한다.
  • 두 단계의 디코딩 프로세스를 적용한다: 먼저 템플릿에 적절한 단어를 채운 후, 저신뢰도 또는 잘못된 단어를 반복적으로 보완한다.
  • CT-MP, CT-EF, CT-L2R와 같은 적응형 디코딩 알고리즘을 적용하여, 잘못 생성된 단어를 동적으로 재예측함으로써 유창성과 관련성 향상을 도모한다.
  • 비자동회귀적 생성을 가능하게 하면서도 강력한 문맥 의존성을 유지하기 위해 마스크된 언어 모델링 목적함수를 활용한다.
  • 훈련 중에 시각적 단어의 정확도를 강조하는 전용 손실 함수를 사용하여 의미 기반의 정확성을 향상시킨다.

실험 결과

연구 질문

  • RQ1비자동회귀적 디코딩은 비디오 캡션에서 캡션 품질을 희생시키지 않고도 높은 추론 속도를 달성할 수 있는가?
  • RQ2시각적 단어 생성을 우선시하는 코arse-to-fine 접근 방식이 더 정확하고 다양한 캡션을 생성하는 데 기여하는가?
  • RQ3저신뢰도 단어의 반복적 보완이 비자동회귀 캡션에서 유창성과 세부 정보 포착을 향상시키는가?
  • RQ4속도, 정확도, 다양성 측면에서 제안된 방법은 자동회귀 및 표준 비자동회귀 기준 모델에 비해 어떻게 비교되는가?

주요 결과

  • NACF 모델은 MSVD 및 MSR-VTT에서 모두 최고 성능을 기록했으며, CIDEr-D 점수는 각각 114.4와 42.47을 기록해 이전 방법들을 능가했다.
  • MSR-VTT에서 NACF는 51.8%의 Vocab Usage와 51.4%의 Novel 점수를 기록해 강력한 캡션 다양성을 보였다.
  • MSVD에서 NACF는 자동회귀 모델(예: AR-B with B=5) 대비 최대 3.2배 빠른 추론 속도를 기록했으며, 성능 저하 없이 성능을 유지했다.
  • CT-MP 및 CT-EF 디코딩 알고리즘이 CT-L2R를 크게 능가해, 동적 재예측이 단조로운 생성보다 필수적임을 입증했다.
  • 정성적 결과 분석에서 NACF는 자동회귀 및 비자동회귀 기준 모델 대비 핵심 시각적 요소(예: 'roof', 'lab', 'spongebob')를 더 잘 포착하는 것으로 나타났다.
  • 실패 사례는 시각적 단어 생성의 부족과 관련이 있었으며, 이는 시각적 단어 예측 향상이 성능 향상에 기여할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.