Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Visually Grounded Sentence Representations with Self-Attention

Kang Min Yoo, Youhyun Shin|arXiv (Cornell University)|2017. 12. 02.
Multimodal Machine Learning Applications참고 문헌 38인용 수 6
한 줄 요약

이 논문은 시각적으로 기반된 문장 표현 학습을 위한 자기주의 강화된 인코더를 제안하며, 인코딩 중에 시각적으로 두드러진 단어에 초점을 맞추도록 모델을 가능하게 함으로써 언어와 시각 간의 정렬을 향상시킨다. 결과적으로 자기주의를 통합함으로써 전이 작업에서 성능이 크게 향상되며, 특히 통합 문장 표현과 함께 사용할 경우 문장 표현이 더 의미적으로이고 시각적으로 기반된 성질을 띠게 된다.

ABSTRACT

Sentence representation models trained only on language could potentially suffer from the grounding problem. Recent work has shown promising results in improving the qualities of sentence representations by jointly training them with associated image features. However, the grounding capability is limited due to distant connection between input sentences and image features by the design of the architecture. In order to further close the gap, we propose applying self-attention mechanism to the sentence encoder to deepen the grounding effect. Our results on transfer tasks show that self-attentive encoders are better for visual grounding, as they exploit specific words with strong visual associations.

연구 동기 및 목표

  • 인코딩 과정에 더 깊이 시각 신호를 통합하여 문장 표현의 기반 문제를 해결한다.
  • 기존 모델이 인코더의 최종 은닉 상태에서만 언어와 시각을 연결하는 데에 국한된 한계를 극복한다.
  • 문장 인코더에서 자기주의가 시각적으로 관련성이 높은 단어를 식별하고 강조하는 능력을 향상시킬 수 있는지 조사한다.
  • 다중 모odal 인코더-디코더 프레임워크를 통해 언어와 시각의 공동 학습을 통해 일반 문장 표현의 품질을 향상시킨다.
  • 자기주의 문장 표현이 하류 NLP 전이 작업에서 더 나은 성능을 내는지 입증한다.

제안 방법

  • 기본 다중 모달 인코더-디코더 프레임워크로 [8]의 Cap2All 모델을 변형 적용하여, 소스 캡션에서 이미지 특징과 타겟 캡션을 동시에 예측한다.
  • 인코딩 중에 강한 시각적 연관성을 가진 단어에 동적으로 초점을 맞출 수 있도록 문장 인코더에 자기주의 메커니즘을 도입한다.
  • 양방향 LSTM을 사용해 입력 캡션을 인코딩하고, 정방향 및 역방향 은닉 상태의 최대 풀링을 통해 문장 표현을 계산한다.
  • 문장 표현을 이미지 특징 공간으로 투영하고, 예측된 이미지 특징과 진짜 이미지 특징 간 유사도를 최대화하기 위해 로그-지수-합 쌍별 순위 손실을 사용해 훈련한다.
  • 일반화 성능 향상을 위해 결과 문장 표현을 ST-LN(레이어 정규화된 스킵-스토리의) 표현과 연결한다.
  • 배치 크기가 128인 미니배치를 사용해 COCO5K 데이터셋에서 훈련하며, 음성 샘플은 동일 배치에서 추출한다.

실험 결과

연구 질문

  • RQ1문장 인코더에서 자기주의가 시각적으로 기반된 문장 표현의 품질을 향상시킬 수 있는가?
  • RQ2모델이 시각적으로 두드러진 단어에 주목할 수 있는 능력이 하류 NLP 전이 작업에서의 성능 향상으로 이어지는가?
  • RQ3자기주의 인코더는 표준 LSTM 기반 인코더에 비해 시각적 기반 및 전이 성능 측면에서 어떻게 비교되는가?
  • RQ4자기주의 메커니즘이 강한 시각적 연관성을 가진 단어를 식별하고 강조하는 데 얼마나 기여하는가?
  • RQ5자기주의가 작업 특화 미세조정 없이도 문장 표현의 표현 능력을 향상시킬 수 있는가?

주요 결과

  • 자기주의 메커니즘은 문장 표현 품질을 크게 향상시키며, ST-LN 표현과 결합했을 때 8개 전이 작업 중 5개에서 성능 향상을 보였다.
  • Att. Cap2All 모델은 MRPC에서 F1 점수 81.88을 기록하여 베이스라인 Cap2All 모델(82.26)을 능가했고, SST에서 정확도 83.03을 달성하여 베이스라인(81.16)을 초월했다.
  • SICK 관련성 평가에서 자기주의 모델은 피어슨 상관계수 84.54를 기록하여 베이스라인 Cap2All(84.37)보다 略적으로 뛰어났다.
  • 주의 시각화 결과, 모델이 'man', 'black', 'guitar', 'cat', 'bowl'과 같이 시각적으로 두드러진 단어에 주목하는 것을 확인하여 단어 수준에서 효과적인 기반을 확보한 것으로 나타났다.
  • CR, MPQA, MRPC에서의 일부 성능 저하에도 불구하고 전체 추세는 일관된 향상을 보여, 자기주의가 표현의 풍부함을 향상시킨다는 것을 시사한다.
  • 모델는 전문화된 방법과 비교해도 경쟁 가능한 성능을 보였으며, 통합 목표 함수에 따라 엔드 투 엔드로 훈련되었음에도 불구하고 이미지 및 캡션 검색 작업에서 뛰어난 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.