Skip to main content
QUICK REVIEW

[논문 리뷰] X-Linear Attention Networks for Image Captioning

Yingwei Pan, Ting Yao|arXiv (Cornell University)|2020. 03. 31.
Multimodal Machine Learning Applications참고 문헌 41인용 수 8
한 줄 요약

이 논문은 시각적 및 언어적 특징 간의 이차 상호작용을 공간적 및 채널별 이중선형 풀링을 통해 모델링하는 새로운 통합 주의 블록인 X-Linear Attention Networks(X-LAN)을 제안한다. 이러한 블록을 쌓고 이미지 인코더와 문장 디코더에 통합함으로써 X-LAN는 COCO Karpathy 테스트 분할에서 CIDEr 점수 132.8%를 기록하며 최신 기술 수준을 달성하였으며, 이는 고차원 상호작용을 통한 뛰어난 다중모odal 추론 능력을 보여준다.

ABSTRACT

Recent progress on fine-grained visual recognition and visual question answering has featured Bilinear Pooling, which effectively models the 2$^{nd}$ order interactions across multi-modal inputs. Nevertheless, there has not been evidence in support of building such interactions concurrently with attention mechanism for image captioning. In this paper, we introduce a unified attention block -- X-Linear attention block, that fully employs bilinear pooling to selectively capitalize on visual information or perform multi-modal reasoning. Technically, X-Linear attention block simultaneously exploits both the spatial and channel-wise bilinear attention distributions to capture the 2$^{nd}$ order interactions between the input single-modal or multi-modal features. Higher and even infinity order feature interactions are readily modeled through stacking multiple X-Linear attention blocks and equipping the block with Exponential Linear Unit (ELU) in a parameter-free fashion, respectively. Furthermore, we present X-Linear Attention Networks (dubbed as X-LAN) that novelly integrates X-Linear attention block(s) into image encoder and sentence decoder of image captioning model to leverage higher order intra- and inter-modal interactions. The experiments on COCO benchmark demonstrate that our X-LAN obtains to-date the best published CIDEr performance of 132.0% on COCO Karpathy test split. When further endowing Transformer with X-Linear attention blocks, CIDEr is boosted up to 132.8%. Source code is available at \url{https://github.com/Panda-Peter/image-captioning}.

연구 동기 및 목표

  • 기존 주의 메커니즘이 이미지 설명에서 일차 상호작용만 모델링하고 다중모달 추론이 효과적으로 구현되지 않는 한계를 해결하기 위해.
  • 이중선형 풀링을 사용하여 시각적 및 언어적 모odal 간의 이차 상호작용을 포괄하는 통합 주의 블록을 제안하기 위해.
  • 블록을 쌓고 파rameter-free 방식으로 ELU를 적용하여 고차원 상호작용, 심지어 무한차원 상호작용을 모델링하기 위해.
  • X-Linear 주의 블록을 이미지 인코더와 문장 디코더 양쪽에 통합하여 내모달(내부 수준) 및 간모달(시각-언어) 표현 학습을 향상시키기 위해.
  • 향상된 다중모달 추론을 통해 이미지 설명 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • X-Linear 주의 블록은 이중선형 풀링을 통해 쿼리와 키포인트의 외적곱을 계산하여 시각적 특징과 언어 히든 상태 간의 이차 상호작용을 모델링한다.
  • 두 개의 임bedding 레이어와 소프트맥스 연산을 통해 이중선형 출력에 기반한 공간적 주의 가중치를 예측함으로써 관련된 이미지 영역에 집중할 수 있도록 한다.
  • 압축-흥신 메커니즘이 공간적 특징을 집계하고 시그모이드 게이팅을 적용하여 채널별 주의를 계산함으로써 채널 중요도를 정교화한다.
  • 주의된 특징은 공간적 및 채널별 주의 벡터에 의해 조절된 이중선형 풀링된 쿼리-밸류 쌍의 가중합으로 계산된다.
  • 다중 X-Linear 블록을 쌓음으로써 고차원 상호작용을 모델링하고, 추가적인 파라미터 없이 ELU를 적용하여 무한차원 상호작용을 가능하게 한다.
  • X-LAN 아키텍처는 이러한 블록을 Faster R-CNN 기반 이미지 인코더와 LSTM/Transformer 디코더에 통합하여 내모달(영역 수준) 및 간모달(시각-언어) 추론 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1이중선형 풀링이 주의 메커니즘에 효과적으로 통합되어 이미지 설명에서 이차 상호작용을 모델링할 수 있는가?
  • RQ2공간적 및 채널별 주의 분포를 동시에 모델링함으로써 시각-언어 특징 정렬이 어떻게 향상되는가?
  • RQ3X-Linear 주의 블록을 쌓는 것으로 과적합이나 과도한 파라미터 증가 없이 고차원 상호작용을 실현할 수 있는가?
  • RQ4X-Linear 주의를 이미지 인코더와 문장 디코더 양쪽에 통합함으로써 이미지 설명 성능에 뚜렷한 향상이 이루어지는가?
  • RQ5X-Linear 블록에 ELU를 사용함으로써 파라미터 없이도 효과적인 무한차원 상호작용 모델링이 가능한가?

주요 결과

  • X-LAN는 Transformer 디코더와 통합되었을 때 COCO Karpathy 테스트 분할에서 새로운 최신 기술 수준의 CIDEr 점수 132.8%를 기록하였다.
  • 인코더에 네 개의 X-Linear 블록을 스택한 모델은 CIDEr 점수 120.4%를 기록하였으며, 스택 수 증가에 따라 점진적인 성능 향상을 보였다.
  • X-Linear 블록에 ELU를 추가함으로써 네 개의 블록을 사용할 경우 성능이 122.0%로 향상되었으며, 이는 고차원 상호작용의 효과적인 모델링을 시사한다.
  • 제거 실험 결과, 디코더에서 기존 주의를 X-Linear 주의로 대체함으로써 CIDEr 점수가 114.1%에서 117.0%로 향상됨을 확인하였다.
  • 주의 시각화 결과 X-LAN는 항상 관련된 이미지 영역에 집중하는 것으로 나타났으며, Up-Down과 같은 기준 모델에서 관찰되는 오해석을 피하고 있었다.
  • 네 개 이상의 스택 블록을 초과하면 성능 향상이 정체되며, 이는 모델 용량과 과적합 사이의 상충 관계를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.