Skip to main content
QUICK REVIEW

[논문 리뷰] Textually Enriched Neural Module Networks for Visual Question Answering

Khyathi Raghavi Chandu, Mary Arpita Pyreddy|arXiv (Cornell University)|2018. 09. 23.
Multimodal Machine Learning Applications참고 문헌 26인용 수 7
한 줄 요약

이 논문은 질문 구문 분석 과정에서 발생하는 정보 손실을 줄이기 위해 이미지 캡션과 외부 지식을 통합하여 텍스트로 풍부하게 강화된 신경 모듈 네트워크(NMN)를 제안한다. 관련 캡션 내용에 주의를 기울이고 외부 지식 기반 시스템을 활용함으로써, VQA 1.0 테스트-디브에서 정확도를 57.1%로 향상시켰으며, 맥락적 또는 일반 지식 기반 추론이 필요한 질문에서 두드러진 성능 향상을 보였다.

ABSTRACT

Problems at the intersection of language and vision, like visual question answering, have recently been gaining a lot of attention in the field of multi-modal machine learning as computer vision research moves beyond traditional recognition tasks. There has been recent success in visual question answering using deep neural network models which use the linguistic structure of the questions to dynamically instantiate network layouts. In the process of converting the question to a network layout, the question is simplified, which results in loss of information in the model. In this paper, we enrich the image information with textual data using image captions and external knowledge bases to generate more coherent answers. We achieve 57.1% overall accuracy on the test-dev open-ended questions from the visual question answering (VQA 1.0) real image dataset.

연구 동기 및 목표

  • 질문을 파싱 트리로 단순화할 때 발생하는 신경 모듈 네트워크(NMN)의 정보 손실 문제를 해결한다.
  • 이미지 캡션을 보조 텍스트적 맥락으로 통합하여 시각-언어적 추론 능력을 향상시킴으로써 VQA 성능을 향상시킨다.
  • 주의 메커니즘을 도입하여 관련성이 없는 캡션 내용으로 인한 노이즈를 줄인다.
  • 이미지 및 캡션 데이터 외의 외부 지식 기반 시스템을 통합하여 지식 집약형 질문에 대한 답변을 향상시킨다.
  • 캡션 기반 주의와 지식 통합의 영향을 개방형 VQA 벤치마크에서 평가하며, 특히 복잡하거나 모호한 질문에 대해 분석한다.

제안 방법

  • 캡션 텍스트를 인코딩하기 위해 LSTM을 사용하고, 캡션 토큰에 대한 소프트 주의를 통해 관련 부분에 주목함으로써 이미지 캡션을 NMN 아키텍처에 통합한다.
  • 질문 단어와 관련된 캡션 어휘 조각을 정렬하는 소프트 주의 메커니즘을 적용하여, 관련성이 없는 캡션 내용을 걸러내어 노이즈를 감소시킨다.
  • 카운팅 질문을 처리하기 위해 측정 모듈(Measure module)을 도입하여 기존의 기술 기반 모듈(Describe module)을 대체함으로써 수치적 추론 능력을 향상시킨다.
  • 일반 지식이나 사실 기반 지식이 필요한 질문을 위해 외부 지식 기반 시스템을 활용하여 시각적 특징을 강화한다.
  • 이식형 융합 레이어를 사용하여 이미지 특징(CNN에서 추출), 질문 특징(LSTM에서 추출), 캡션 특징(주의 기반 LSTM에서 추출)을 요소별 곱셈으로 통합하고, 이후 소프트맥스 레이어를 통해 답변 예측을 수행한다.
  • 역전파를 사용하여 전체 모델을 엔드 투 엔드로 훈련시키며, 주의 가중치와 지식 검색 파rameter를 함께 최적화한다.

실험 결과

연구 질문

  • RQ1질문의 파싱 단순화 과정에서 손실되는 언어 정보를 보존하기 위해 이미지 캡션을 통합함으로써 신경 모듈 네트워크의 VQA 성능 향상이 가능한가?
  • RQ2전체 캡션을 사용하는 대신 관련 캡션 조각에만 주의를 기울이는 것이 노이즈를 줄이고 정답 정확도를 향상시키는가?
  • RQ3외부 지식 기반 시스템을 통합함으로써 사실 기반 또는 일반 지식이 필요한 질문에 대한 추론 능력이 어느 정도 향상되는가?
  • RQ4제안된 캡션 주의 메커니즘은 복잡하거나 모호한 질문을 다룰 때 기존 표준 NMN보다 어떻게 성능을 냈는가?
  • RQ5모델에서 여전히 지속되는 오류는 무엇이며, 일반적인 용어가 포함된 캡션으로 인해 잘못된 연관성(스파urious associations)이 유도되는 경우는 어떻게 영향을 받는가?

주요 결과

  • 제안된 캡션 주의 메커니즘이 VQA 1.0 벤치마크에서 테스트-디브 정확도를 1.2% 포인트 향상시켰다(55.9%에서 57.1%로).
  • 훈련 세트에서 1.9%의 성능 향상을 기록하여, 풍부한 텍스트적 지도 정보를 통한 일반화 능력 향상이 확인되었다.
  • 캡션이 질문과 관련성이 있을 경우, 예를 들어 'two planes flying'이나 'a pizza'와 같은 경우, 모델은 '2'와 'pizza'와 같이 정확한 답변을 내놓아 표준 NMN보다 뛰어난 성능을 보였다.
  • 캡션에 일반적 또는 오해의 소지가 있는 용어가 포함된 경우 모델이 오작동하는 경우가 있었는데, 예를 들어 훈련 데이터의 편향으로 인해 'group'이라는 단어를 높은 수치(5)로 오해하여 정답(6)을 잘못 예측한 경우가 있었다.
  • 캡션이 질문과 관련이 없는 경우, 캡션 주의 메커니즘이 성능 향상에 기여하지 못했으며, 낮은 품질의 캡션으로 인한 노이즈의 위험성을 드러냈다.
  • 측정 모듈이 기술 기반 모듈보다 성능 향상이 없었는데, 이는 주의 맵에서의 정보 손실나 또는 이미지 특징의 충분한 활용이 이루어지지 않았기 때문일 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.