[논문 리뷰] Attentive Explanations: Justifying Decisions and Pointing to the Evidence (Extended Abstract)
이 논문은 시각적 질문 응답 및 활동 인식을 위한 인간이 주석 처리한 텍스트 설명과 시각적 지목 정보를 포함한 대규모 데이터셋 VQA-X와 ACT-X를 소개한다. 이와 함께 이중 주의 메커니즘을 사용하여 결정 예측, 자연어 설명 생성, 시각적 증거에 대한 주의를 동시에 학습하는 다중모달 모델(PJ-X)을 제안하며, 설명의 품질과 인간이 주석 처리한 증거와의 일치도를 크게 향상시킨다.
Deep models are the defacto standard in visual decision problems due to their impressive performance on a wide array of visual tasks. On the other hand, their opaqueness has led to a surge of interest in explainable systems. In this work, we emphasize the importance of model explanation in various forms such as visual pointing and textual justification. The lack of data with justification annotations is one of the bottlenecks of generating multimodal explanations. Thus, we propose two large-scale datasets with annotations that visually and textually justify a classification decision for various activities, i.e. ACT-X, and for question answering, i.e. VQA-X. We also introduce a multimodal methodology for generating visual and textual explanations simultaneously. We quantitatively show that training with the textual explanations not only yields better textual justification models, but also models that better localize the evidence that support their decision.
연구 동기 및 목표
- 시각적 결정 과제를 위한 인간이 주석 처리한 텍스트 및 시각적 증거가 포함된 데이터셋의 부족을 해결하기 위해.
- 인간의 사고 방식과 일치하는 텍스트 설명과 시각적 주의 맵을 생성할 수 있는 다중모달 모델을 개발하기 위해.
- 기준 설명을 학습함으로써 모델의 국소화 및 설명 품질 향상 여부를 조사하기 위해.
- 설명 생성을 위한 주의 메커니즘을 학습함으로써 인간이 주석 처리한 시각적 증거와의 일치도 향상 여부를 평가하기 위해.
- 모델의 결정에 기반해 설명을 조정함으로써 더 높은 품질의 설명을 도출할 수 있는지 입증하기 위해.
제안 방법
- 대규모 데이터셋 두 종류를 제안: VQA-X(30,000개의 설명 문장이 포함된 VQA용), ACT-X(54,000개의 문장이 포함된 활동 인식용), 모두 인간이 주석 처리한 텍스트 설명과 시각적 지점 정보를 포함.
- 해당 답변를 뒷받침하는 영역을 분할하여 지목하는 시각적 지점 주석을 수집함으로써, 모델의 주의 분석 평가를 위한 기준 데이터를 제공.
- 결정 예측을 위한 주의(ann-att)와 설명 생성을 위한 주의(exp-att)를 별도로 구현한 Pointing and Justification (PJ-X) 모델을 설계.
- 이미지, 질문, 답변, 텍스트 설명의 supervision만을 사용하여 모델을 엔드 투 엔드로 학습하며, 설명 영역에 대한 명시적 바운딩 박스가 필요로 하지 않음.
- 이중 주의 메커니즘을 통해 예측 및 설명 생성 과정에서 모델의 집중 영역를 내성적으로 분석할 수 있도록 하여, 동시 최적화를 가능하게 함.
- 지능형 주의 맵의 정확도를 평가하기 위해 인간이 주석 처리한 지점과의 비교를 위해 지구 이동 거리(EMD)와 순서 상관관계를 사용하여 인간의 사고와의 일치도 검증.
실험 결과
연구 질문
- RQ1인간이 주석 처리한 텍스트 설명을 기반으로 학습할 경우, 시각적 질문 응답 및 활동 인식 과제에서 생성된 설명의 품질이 향상되는가?
- RQ2설명 생성 과정에서 모델의 주의가 인간이 주석 처리한 시각적 증거와 얼마나 일치하는가?
- RQ3모델의 예측(예: 답변 또는 클래스 레이블)에 기반해 설명을 생성하는 것이 이미지 특징만을 사용하는 경우보다 더 효과적인가?
- RQ4설명 생성을 위한 주의 메커니즘을 통합함으로써 텍스트 설명과 시각적 기반의 품질이 향상되는가?
- RQ5주의 영역에 대한 명시적 supervision 없이도, 단일 모델이 결정 예측, 설명 생성, 시각적 주의를 동시에 최적화할 수 있는가?
주요 결과
- PJ-X 모델은 자동 평가 및 인간 평가 지표에서 모두 베이스라인 모델을 뛰어넘으며, ACT-X에서 인간 평가 점수 26.4, VQA-X에서 33.6을 기록.
- 기준 설명(VQA-X 및 ACT-X)을 기반으로 학습한 모델는 이미지 설명만을 사용해 학습한 모델 대비 인간 평가에서 10.4점 향상.
- 모델의 예측(예: 답변 또는 클래스 레이블)에 기반해 설명을 생성하는 방식은 이미지 특징만을 사용하는 캡션 모델 대비 ACT-X에서 7.2점, VQA-X에서 14.4점 향상.
- 설명 주의 맵(exp-att)은 예측 주의 맵(ans-att)보다 인간의 시각적 지점과 더 잘 일치하며, ACT-X에서 순서 상관관계 0.3744, VQA-X에서 0.3132 기록.
- exp-att 맵의 지구 이동 거리(EMD)는 VQA-X에서 4.31, ACT-X에서 3.8로, 기준 모델보다 유의미하게 낮아 인간이 주석 처리한 시각적 증거와의 일치도가 뛰어남.
- 제거 실험 결과, 설명을 위한 주의 메커니즘과 기준 설명의 supervision이 모두 필수적임을 확인: 둘 중 하나를 제거할 경우 설명 품질이 크게 저하됨.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.