[논문 리뷰] Natural Language Interaction with Explainable AI Models
이 논문은 자연어 상호작용 프레임워크를 제안하여 설명 가능한 AI(XAI) 모델이 And-Or 그래프(AOG) 파싱 그래프를 입력으로 사용해 인간이 이해할 수 있는 설명을 생성한다. 사용자 질문을 10종류의 대비 유형으로 분류하고, 직접 증거, 부분 기반 추론, 맥락 기반 추론의 세 가지 추론 유형을 활용하여, 새로운 애너테이션된 데이터셋을 통해 의사소통 및 일반 지식 기반 설명이 사용자에게 가장 선호됨을 입증한다.
This paper presents an explainable AI (XAI) system that provides explanations for its predictions. The system consists of two key components -- namely, the prediction And-Or graph (AOG) model for recognizing and localizing concepts of interest in input data, and the XAI model for providing explanations to the user about the AOG's predictions. In this work, we focus on the XAI model specified to interact with the user in natural language, whereas the AOG's predictions are considered given and represented by the corresponding parse graphs (pg's) of the AOG. Our XAI model takes pg's as input and provides answers to the user's questions using the following types of reasoning: direct evidence (e.g., detection scores), part-based inference (e.g., detected parts provide evidence for the concept asked), and other evidences from spatio-temporal context (e.g., constraints from the spatio-temporal surround). We identify several correlations between user's questions and the XAI answers using Youtube Action dataset.
연구 동기 및 목표
- 사용자가 XAI 모델의 예측에 대해 대화 방식으로 질의할 수 있는 자연어 상호작용 시스템을 개발한다.
- 사용자 질문을 이해하기 위해 XAI 상호작용에서의 사용자 의도를 더 잘 파악하기 위해 10종류의 대비 유형으로 질문을 분류하고 식별한다.
- 직접 증거, 부분 기반 추론, 맥락 기반 추론 등의 설명 유형 중 사용자가 선호하는 것이 무엇인지, 다양한 질문 유형에 따라 평가한다.
- 550개의 질문-설명 쌍을 포함한 새로운 애너테이션된 설명 데이터셋을 YouTube Action 데이터셋에서 유래해 구축하여, 설명 선호도에 대한 실증적 분석을 지원한다.
제안 방법
- 시각 모델의 예측를 표현하기 위해 And-Or 그래프(AOG) 파싱 그래프(pgs)를 입력으로 사용하여 계층적이고 구성적인 시각적 개념을 포괄한다.
- 사용자가 암시적으로 수행하는 비교를 모델링하기 위해 사용자 질문을 10종류의 대비 유형(예: WH-X, WH-X-NOT-Y, NOT-X)으로 분류한다.
- 세 가지 추론 유형을 사용해 설명을 생성한다: (1) 직접 증거(예: 검출 점수), (2) 부분 기반 추론(예: 앉는 예측을 뒷받침하는 사지 자세), (3) 맥락 기반 추론(예: 의사소통, 일반 지식, 반대가정).
- YouTube Action 데이터셋의 55개 도메인에서 유래한 550개의 질문-설명 쌍을 포함하는 새로운 데이터셋을 애너테이션하며, 25명의 graduate 및 30명의 undergraduate 학생이 선호하는 설명 유형을 레이블링한다.
- 각 질문이 최대 5개의 설명 유형과 쌍을 이루는 다중 레이블 애너테이션 체계를 도입하여 선호도 패턴의 통계적 분석을 가능하게 한다.
- 질문 유형에 따른 설명 유형의 비율 분포를 분석하여, 의사소통 및 일반 지식 기반 추론이 높은 선호도를 보이는 경향을 밝혀낸다.
실험 결과
연구 질문
- RQ1사용자가 XAI 모델의 설명을 구할 때 주로 묻는 대비 유형의 질문은 무엇인가?
- RQ2직접 증거, 부분 기반 추론, 맥락 기반 추론 등의 설명 유형 중 사용자가 다양한 질문 유형에 대해 선호하는 것은 무엇인가?
- RQ3의사소통 관계와 일반 지식 기반 추론은 사용자 인지의 설명 품질에 어떤 영향을 미치는가?
- RQ4질문 유형과 인간 상호작용 기반 XAI 시스템에서 선호되는 설명 형식 간의 상관관계는 무엇인가?
- RQ5대화 기록은 다중 턴 상호작용에서 설명 유형 선택에 어떤 영향을 미치는가?
주요 결과
- WH-X 질문(예: '사람이 왜 앉아 있나요?')의 경우, 단순한 질문임에도 불구하고 46.2%의 사용자가 감마 유형 설명(Gamma-type, 상향식 맥락 기반 추론)을 선호하여, 기본 질문에서도 맥락 기반 설명에 대한 강한 선호도를 보임을 시사한다.
- WH-X-NOT-Y 질문(예: '왜 앉아 있는 것일까, 서 있는 것일까?')의 경우, 36.5%는 알파 유형 설명(Alpha, 직접 증거)을, 34.6%는 감마 유형 설명을 선택하여 증거와 맥락 사이에 균형 잡힌 선호도가 존재함을 보여준다.
- 의사소통 기반 설명은 전체적으로 가장 선호되는 유형으로, DO-X-NOT-Y 질문에 대해 81.4%의 응답에서 선택되었으며, 개념 간의 관계적 일관성이 설명에서 매우 중요하게 여겨짐을 시사한다.
- 일반 지식 기반 추론은 두 번째로 선호되는 설명 유형으로, DO-NOT-X 질문의 69.3%와 WH-NOT-Y 질문의 50.1%에서 선택되었으며, 부재나 否정을 설명할 때 세계 지식의 중요성을 강조한다.
- AOG 기반 알파, 베타, 감마 설명의 조합는 전체 애너테이션의 30% 이상를 차지하여, XAI 설명에서 구조화된 시각적 추론이 효과적이고 관련성이 있음을 확인한다.
- 데이터셋 분석 결과, WH-X1-NOT-X2 질문(다중 인스턴스 포함)에 대한 응답 중 46.6%가 의사소통 기반 설명이었으며, 이는 다수의 실체를 비교할 때 관계 기반 추론이 핵심적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.