Skip to main content
QUICK REVIEW

[논문 리뷰] Image Captioning via Compact Bidirectional Architecture

Song, Zijie, Yuanen Zhou|arXiv (Cornell University)|2022. 01. 06.
Multimodal Machine Learning Applications인용 수 14
한 줄 요약

이 논문은 단일이고 병렬화 가능한 디코더에서 왼쪽에서 오른쪽 및 오른쪽에서 왼쪽으로의 캡션 생성을 동시에 학습하는 Compact Bidirectional Transformer (CBTIC)를 제안한다. 양방향 흐름을 밀접하게 결합하고 모델 출력 순위 매기기를 통한 문장 수준의 앙상블을 가능하게 함으로써, 시각-언어 사전학습 없이도 MSCOCO에서 최신 기준 성능을 달성하며, 이전의 사전학습되지 않은 모델들보다 CIDEr 점수에서 최대 4.6% 향상된다.

ABSTRACT

Most current image captioning models typically generate captions from left-to-right. This unidirectional property makes them can only leverage past context but not future context. Though refinement-based models can exploit both past and future context by generating a new caption in the second stage based on pre-retrieved or pre-generated captions in the first stage, the decoder of these models generally consists of two networks~(i.e. a retriever or captioner in the first stage and a captioner in the second stage), which can only be executed sequentially. In this paper, we introduce a Compact Bidirectional Transformer model for image captioning that can leverage bidirectional context implicitly and explicitly while the decoder can be executed parallelly. Specifically, it is implemented by tightly coupling left-to-right(L2R) and right-to-left(R2L) flows into a single compact model to serve as a regularization for implicitly exploiting bidirectional context and optionally allowing explicit interaction of the bidirectional flows, while the final caption is chosen from either L2R or R2L flow in a sentence-level ensemble manner. We conduct extensive ablation studies on MSCOCO benchmark and find that the compact bidirectional architecture and the sentence-level ensemble play more important roles than the explicit interaction mechanism. By combining with word-level ensemble seamlessly, the effect of sentence-level ensemble is further enlarged. We further extend the conventional one-flow self-critical training to the two-flows version under this architecture and achieve new state-of-the-art results in comparison with non-vision-language-pretraining models. Finally, we verify the generality of this compact bidirectional architecture by extending it to LSTM backbone. Source code is available at https://github.com/YuanEZhou/cbtic.

연구 동기 및 목표

  • 생성 중 과거의 맥락만 접근 가능한 단방향 캡션 모델의 한계를 해결하기 위해.
  • 캡션 품질 향상을 위해 단일이고 병렬화 가능한 디코더 아키텍처에서 양방향 맥락 모델링을 가능하게 하기 위해.
  • 개선 기반 모델의 순차적 종속성을 제거하기 위해 왼쪽에서 오른쪽 및 오른쪽에서 왼쪽 흐름을 하나의 컴act한 모델로 통합하기 위해.
  • 두 개의 별도 모델을 훈련하지 않고도 문장 수준의 앙상블을 실현하여 추론 효율성과 성능을 향상시키기 위해.
  • 자기 비판적 훈련을 이중 흐름 아키텍처로 확장하여 엔드 투 엔드 최적화를 수행하기 위해.

제안 방법

  • 모델은 공유된 가중치를 가진 단일 트랜스포머 디코더를 사용하여 동시에 왼쪽에서 오른쪽(L2R) 및 오른쪽에서 왼쪽(R2L) 캡션 생성 흐름을 지원한다.
  • 훈련 중에는 각 이미지가 <l2r> 접두사가 붙은 L2R 캡션과 <r2l> 접두사가 붙은 R2L 캡션 두 개와 쌍을 이루며, 통합된 손실을 통해 함께 훈련된다.
  • 디코딩 중에 교차 attention 메커니즘을 통해 L2R 및 R2L 흐름 간의 명시적 상호작용을 선택적으로 활성화할 수 있다.
  • 추론 중에는 L2R 및 R2L 출력이 동시에 생성되며, 문장 수준의 앙상블을 위해 확률이 더 높은 출력이 선택된다.
  • 여러 모델 인스턴스의 확률 분포를 평균화함으로써 단어 수준의 앙상블을 통합한다.
  • 자기 비판적 훈련을 이중 흐름 설정으로 확장하여, L2R 및 R2L 출력을 모두 사용해 CIDEr 점수를 최적화한다.

실험 결과

연구 질문

  • RQ1컴act한 단일 모델 아키텍처가 캡션 생성에서 과거 및 미래 맥락을 효과적으로 활용할 수 있는가?
  • RQ2L2R 및 R2L 출력을 통한 문장 수준의 앙상블이 두 개의 별도 모델을 훈련하지 않고도 성능 향상을 이끌 수 있는가?
  • RQ3공유된 가중치를 통한 암묵적 맥락 모델링과 비교해 명시적 상호작용이 양방향 흐름 간에 어떤가?
  • RQ4제안된 이중 흐름 자기 비판적 훈련이 기존의 단일 흐름 훈련보다 더 나은 성능을 낼 수 있는가?
  • RQ5컴act한 아키텍처가 양방향 맥락 학습에 대해 어느 정도 정규화 역할을 하는가?

주요 결과

  • 컴act한 양방향 아키텍처는 암묵적으로 양방향 맥락을 활용하는 데 효과적인 정규화 요소로 작용하며, 명시적 상호작용 메커니즘보다 뛰어난 성능을 보인다.
  • L2R 및 R2L 출력 순위 매기기를 통한 문장 수준의 앙상블은 별도의 두 모델을 훈련하는 것과 유사한 성능을 달성하면서도 추가적인 추론 비용 없이 실현 가능하다.
  • MSCOCO Karpathy 테스트 스플릿에서 CBTIC 모델은 앙상블 설정에서 CIDEr 점수 40.0을 기록하며, 사전학습되지 않은 모든 모델보다 뛰어난 성능을 보였다.
  • 공식 테스트 서버에서 c5 및 c40 참조를 사용할 경우, 최고의 경쟁 모델(RSTNet)보다 CIDEr 점수에서 각각 4.1% 및 4.6% 향상되었다.
  • CIDEr 점수 향상에도 불구하고, R2L 흐름은 악성 종결어(예: '풋볼을 든 남자')를 생성하는 경향을 보여, BLEU 점수는 38.9에서 38.0으로 약간 하락했다.
  • 단어 수준과 문장 수준의 앙상블을 결합하면 성능 향상이 더욱 증폭되며, 두 앙상블 전략이 상호 보완적인 이점을 가짐을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.