[논문 리뷰] Bridging the Gap: Providing Post-Hoc Symbolic Explanations for Sequential Decision-Making Problems with Inscrutable Representations
이 논문은 내부 표현이 투명하지 않은 순차적 결정 기반 에이전트에 대해 사용자가 지정한 개념을 기반으로 대조적 후행 기반의 기호적 설명을 생성하기 위한 프레임워크를 제안한다. 에이전트의 경로에서 국소 기호적 동적 모델(예: PDDL 유사)을 학습함으로써, 한 행동 시퀀스가 다른 행동 시퀀스보다 선호되는 이유를 설명하며, 몬테주마의 복수와 소코반 변형에서 사용자 연구를 통해 높은 설명 신뢰도와 실용성을 입증하였다.
As increasingly complex AI systems are introduced into our daily lives, it becomes important for such systems to be capable of explaining the rationale for their decisions and allowing users to contest these decisions. A significant hurdle to allowing for such explanatory dialogue could be the vocabulary mismatch between the user and the AI system. This paper introduces methods for providing contrastive explanations in terms of user-specified concepts for sequential decision-making settings where the system's model of the task may be best represented as an inscrutable model. We do this by building partial symbolic models of a local approximation of the task that can be leveraged to answer the user queries. We test these methods on a popular Atari game (Montezuma's Revenge) and variants of Sokoban (a well-known planning benchmark) and report the results of user studies to evaluate whether people find explanations generated in this form useful.
연구 동기 및 목표
- 순차적 결정 과정에서 AI 시스템과 인간 사용자 간의 어휘 불일치 문제를 해결하기 위해.
- 사용자가 이해할 수 있는 개념을 사용해, 한 행동이 다른 행동보다 선호되는 이유를 대조적 설명으로 생성할 수 있도록 하기 위해.
- 사용자가 지정한 용어로 전제 조건과 영향을 포착하는 에이전트 내부 모델의 국소 기호적 근사 모델을 개발하기 위해.
- 설명 품질을 확보하기 위해 설명 신뢰도를 도입하고, 임계값 기반의 정밀도 측정 기준을 제공하기 위해.
- 실제 순차적 결정 과제에서의 실용성을 평가하기 위해 IRB 승인을 받은 사용자 연구를 수행하기 위해.
제안 방법
- 에이전트 실행 중 수집한 상태-행동-상태 경로에서 국소 기호적 동적 모델(예: PDDL 스타일)을 구성하기 위해.
- 학습된 분류기들을 사용해 사용자가 지정한 개념을 에이전트의 내부 표현에 매핑하기 위해.
- 학습된 기호적 모델을 사용해 대조적 질의에 답하기 위해, 대체 행동 시퀀스의 전제 조건과 영향을 분석하기 위해.
- 에이전트의 실제 행동에 대한 모델의 정밀도를 반영하는 확률 추정치로 설명 신뢰도를 계산하기 위해.
- 현재 어휘가 부족할 경우 새로운 관련 개념을 습득하기 위한 지침을 제공하는 메타-순차적 결정 프레임워크를 통합하기 위해.
- 확률적 설정으로의 확장 경로를 포함한 결정론적 순차적 결정 과제에 적용하기 위해.
실험 결과
연구 질문
- RQ1내부 표현이 투명하지 않은 에이전트가 수행한 순차적 결정에 대해, AI 시스템이 사용자가 지정한 개념을 기반으로 대조적 설명을 생성할 수 있는가?
- RQ2사용자 연구 결과로 측정된 바에 비춰, 이러한 설명은 사용자의 이해도 향상과 신뢰도 향상에 얼마나 효과적인가?
- RQ3설명 신뢰도가 설명 품질 및 사용자가 신뢰도를 어떻게 평가하는지와 얼마나 관련이 있는가?
- RQ4사용자 어휘가 부족할 경우 시스템은 이를 감지하고 새로운 관련 개념을 습득하기 위한 지침을 제공할 수 있는가?
- RQ5사용자 이해도와 실용성 측면에서, 이 방법은 선형성 기반 또는 특징 기반 설명 방법보다 어떻게 비교되는가?
주요 결과
- 몬테주마의 복수와 소코반 변형에서의 사용자 연구 결과, 참가자들은 제안된 방법을 사용해 생성된 대조적 설명이 유용하고 이해하기 쉽다고 평가했다.
- 시스템의 설명 신뢰도 메트릭은 저정밀도 설명을 효과적으로 걸러내어 설명 과정의 신뢰성을 향상시켰다.
- 에이전트의 내부 모델이 비기호적이고 투명하지 않은 경우에도, 이 방법은 사용자가 정의한 개념 기반 설명을 성공적으로 생성했다.
- 현재 개념 집합이 부족한 경우를 식별하는 데 프레임워크가 가능했으며, 개념 습득을 위한 체계적인 접근법을 제공했다.
- 신뢰도 임계값 통합으로 잘못된 설명의 위험을 줄여 인간-AI 상호작용의 신뢰성을 높였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.