[논문 리뷰] Generating Natural Language Explanations for Visual Question Answering using Scene Graphs and Visual Attention
이 논문은 VQA를 위한 자연어 설명을 생성하기 위해 장면 그래프와 시각적 주의를 활용하는 다중 모달 접근법을 제시하며, 추가 라벨링된 설명 데이터 없이 Visual Genome 데이터와 인간 판단으로 검증합니다.
In this paper, we present a novel approach for the task of eXplainable Question Answering (XQA), i.e., generating natural language (NL) explanations for the Visual Question Answering (VQA) problem. We generate NL explanations comprising of the evidence to support the answer to a question asked to an image using two sources of information: (a) annotations of entities in an image (e.g., object labels, region descriptions, relation phrases) generated from the scene graph of the image, and (b) the attention map generated by a VQA model when answering the question. We show how combining the visual attention map with the NL representation of relevant scene graph entities, carefully selected using a language model, can give reasonable textual explanations without the need of any additional collected data (explanation captions, etc). We run our algorithms on the Visual Genome (VG) dataset and conduct internal user-studies to demonstrate the efficacy of our approach over a strong baseline. We have also released a live web demo showcasing our VQA and textual explanation generation using scene graphs and visual attention.
연구 동기 및 목표
- VQA 출력에 대한 텍스트 정당화를 생성하여 설명 가능한 질의응답을 촉진한다.
- 장면 그래프 기반의 NL 표현과 VQA 주의 맵을 결합하여 설명의 근거를 식별한다.
- 기존의 장면 그래프 주석과 주의 guided 선택을 활용하여 추가 주석된 설명 데이터를 피한다.
- 질적 분석과 소규모 사용자 연구를 통해 이 접근법이 합리적인 설명을 제공함을 보여준다.
제안 방법
- ResNet-152의 이미지 특징과 GloVe로 임베딩된 LSTM의 질문 특징을 갖춘 VQA 모델을 사용한다.
- VQA 중 이미지 영역에 대한 주의 열 지도를 생성하여 관련 장면 요소를 식별한다.
- 장면 그래프 엔티티(객체, 관계, 영역 설명)로부터 NL 표현을 추출하고 관련성을 점수화한다.
- 주목 정렬, QA에 대한 언어 모델의 관련성, 설명 길이/영역 항을 결합한 복합 점수로 장면 그래프 엔티티를 순위화한다.
- 상위 순위의 설명 중에서 슬롯 채우기 형태의 설명을 생성하거나 영역 설명이 없는 경우 설명적 그래프 구성요소를 이용해 설명한다.
- NL-전용 기준선과의 비교 및 소규모 인간 평가를 수행한다.
실험 결과
연구 질문
- RQ1장면 그래프와 시각적 주의에 기반한 NL 설명이 VQA 답변에 대한 유용한 정당화를 제공하는가?
- RQ2주목 guided 장면 그래프 근거를 포함하는 것이 NL-전용 접근법에 비해 설명의 품질을 향상시키는가?
- RQ3VG의 서로 다른 장면 그래프에서 영역 설명 기반과 객체/관계 기반 설명의 효과는 어느 정도인가?
- RQ4시각적 신호와 언어 신호를 결합하는 것이 사용자 인지 설명 관련성에 어떤 영향을 주는가?
주요 결과
- 다중 모달 설명은 소규모 내부 연구에서 인간 평가 지표에서 NL-전용 기준선을 능가한다.
- 주목 guided 장면 그래프 근거를 사용하는 것이 상위 순위의 QA 쌍에 대해 더 관련성 높은 설명을 제공한다.
- 상위 설명 세트에는 종종 영역 설명들이 포함되며 예를 들어 '테니스 선수 가 공을 치는 모습' 또는 '여자가 테니스 공을 치는 모습'과 같은 구체적인 근거를 보여준다.
- 논문은 다중 모달 설명이 NL-전용 기준선에 비해 메트릭에 따라 52-55%의 사례에서 우수한 결과를 보고한다.
- 인간 평가자와의 A/B 테스트에서 다중 모달 접근 방식이 언어 모델 전용 설명보다 VQA 결정 과정과 더 잘 정렬됨을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.