[논문 리뷰] Knowledge-Grounded Self-Rationalization via Extractive and Natural Language Explanations
이 논문은 외부 지식에 기반한 추출적 근거(ERs)와 자연어 설명(NLEs)를 함께 최적화함으로써 작업 성능과 설명의 품질을 동시에 달성하는 자기 설명 프레임워크인 RExC를 제안한다. RExC는 작업 정확도에서 SOTA 성능을 유지하면서도 ER 및 NLE 품질에서 SOTA 성능을 달성하며, 근거나 스니펫에 대한 직접적 지도 학습 없이도 충실하고 지식 기반의 설명을 제공한다.
Models that generate extractive rationales (i.e., subsets of features) or natural language explanations (NLEs) for their predictions are important for explainable AI. While an extractive rationale provides a quick view of the features most responsible for a prediction, an NLE allows for a comprehensive description of the decision-making process behind a prediction. However, current models that generate the best extractive rationales or NLEs often fall behind the state-of-the-art (SOTA) in terms of task performance. In this work, we bridge this gap by introducing RExC, a self-rationalizing framework that grounds its predictions and two complementary types of explanations (NLEs and extractive rationales) in background knowledge. Our framework improves over previous methods by: (i) reaching SOTA task performance while also providing explanations, (ii) providing two types of explanations, while existing models usually provide only one type, and (iii) beating by a large margin the previous SOTA in terms of quality of both types of explanations. Furthermore, a perturbation analysis in RExC shows a high degree of association between explanations and predictions, a necessary property of faithful explanations.
연구 동기 및 목표
- 자기 설명 모델에서 성능과 설명 가능성의 상충 관계를 해결하기 위해 배경 지식을 설명 생성에 통합함으로써.
- 기존 모델이 하나의 설명 유형만 생성하는 한계를 극복하기 위해 고급 추출적 근거(ERs)와 자연어 설명(NLEs)를 공동으로 생성함으로써.
- 공용지식과 같은 외부 지식 자원에 근거하여 설명을 근거로 함으로써 설명의 충실도와 타당성을 향상시키기 위해.
- NLE 지도 학습 없이도 선택된 지식 스니펫을 암묵적 설명으로 활용하여 제로샷 NLE 생성을 가능하게 하기 위해.
- 작업 성능과 설명 가능성 간 격차를 해소하여 설명 품질과 후행 작업 정확도에서 모두 SOTA 결과를 달성하기 위해.
제안 방법
- RExC는 입력 특징에 대한 이진 잠재 변수를 통해 먼저 추출적 근거(ERs)를 선택하는 통합 프레임워크를 사용한다.
- 선택된 ERs를 바탕으로 외부 지식 자원을 쿼리하여 관련 지식 스니펫을 검색한다.
- 예측 작업에 대한 관련성에 따라 가장 적절한 지식 스니펫을 선택하는 스니펫 선택 모듈이 작동한다.
- 선택된 스니펫은 자연어 설명(NLE) 생성기에 전달되어 인간이 읽을 수 있는 정당화 근거를 생성한다.
- 생성된 NLE는 최종 예측자에 입력으로 사용되며, 모든 구성 요소가 변분 학습을 통해 공동으로 훈련된다.
- 프레임워크는 근거나 스니펫 선택에 대한 직접적 지도 학습이 필요 없이 최종 예측과 NLE에 대한 지도 학습만으로 종단 간(end-to-end)으로 훈련된다.
실험 결과
연구 질문
- RQ1자기 설명 모델이 추출적 근거와 자연어 설명을 동시에 생성하면서도 최고의 작업 성능을 달성할 수 있는가?
- RQ2외부 지식에 근거한 설명은 자기 설명 모델에서 설명의 품질과 충실도를 향상시키는가?
- RQ3선택된 지식 스니펫을 암묵적 설명으로 활용함으로써 제로샷 설정에서도 고급 자연어 설명을 생성할 수 있는가?
- RQ4모델은 설명이 모델의 의사결정 과정에 충실한지를 어떻게 보장하는가?
- RQ5지식 기반 자기 설명은 이전 모델에서 관찰된 성능-설명 가능성 격차를 해소할 수 있는가?
주요 결과
- RExC는 자연어 및 시각-언어 도메인의 다섯 가지 작업에서 추출적 근거와 자연어 설명 품질 모두에서 SOTA 성능을 달성한다.
- RExC는 후행 작업에서 가장 강력한 비설명 모델과 동일한 성능을 보이며, 성능-설명 가능성 격차를 효과적으로 해소한다.
- 이전 SOTA 모델보다 NLE 및 ER 품질 모두에서 뚜렷한 우월성을 보이며, 더 높은 설명 충실도를 입증한다.
- 변형 분석을 통해 RExC의 설명이 매우 충실하며 설명과 예측 간 강한 연관성을 보임을 확인하였다.
- 선택된 지식 스니펫을 NLE로 사용하는 제로샷 버전인 RExC-ZS는 경쟁력 있는 성능을 달성했고, 때로는 전체 NLE 지도 학습으로 훈련된 모델를 뛰어넘기도 한다.
- 스니펫에 대한 직접적 지도 학습 없이도 관련 지식 스니펫을 효과적으로 선택할 수 있음을 입증하여, 자원이 제한된 환경에서도 효과적인 설명 생성이 가능함을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.