Skip to main content
QUICK REVIEW

[논문 리뷰] Order Matters: Generating Progressive Explanations for Planning Tasks in Human-Robot Teaming

Mehrdad Zakershahrak, Shashank Rao Marpally|arXiv (Cornell University)|2020. 04. 16.
AI-based Problem Solving and Planning참고 문헌 32인용 수 4
한 줄 요약

이 논문은 인간-로봇 팀워크를 위한 점진적 설명 생성(PEG) 프레임워크를 제안하며, 목표 기반 마르코프 결정 과정(MDP)과 역강화학습(IRL)을 사용해 인간의 정보 순서에 대한 인지적 선호도를 모델링한다. 이 방법은 인간 선호도 데이터로부터 보상 함수를 학습하며, 인지적 흡수에 맞게 순서가 정렬된 점진적 설명이 인지 부하를 감소시키고 임상적 성과를 10.9% 향상시키며, 주관적 노력도 18.5% 감소시킨다(NASA TLX).

ABSTRACT

Prior work on generating explanations in a planning and decision-making context has focused on providing the rationale behind an AI agent's decision making. While these methods provide the right explanations from the explainer's perspective, they fail to heed the cognitive requirement of understanding an explanation from the explainee's (the human's) perspective. In this work, we set out to address this issue by first considering the influence of information order in an explanation, or the progressiveness of explanations. Intuitively, progression builds later concepts on previous ones and is known to contribute to better learning. In this work, we aim to investigate similar effects during explanation generation when an explanation is broken into multiple parts that are communicated sequentially. The challenge here lies in modeling the humans' preferences for information order in receiving such explanations to assist understanding. Given this sequential process, a formulation based on goal-based MDP for generating progressive explanations is presented. The reward function of this MDP is learned via inverse reinforcement learning based on explanations that are retrieved via human subject studies. We first evaluated our approach on a scavenger-hunt domain to demonstrate its effectively in capturing the humans' preferences. Upon analyzing the results, it revealed something more fundamental: the preferences arise strongly from both domain dependent and independence features. The correlation with domain independent features pushed us to verify this result further in an escape room domain. Results confirmed our hypothesis that the process of understanding an explanation was a dynamic process. The human preference that reflected this aspect corresponded exactly to the progression for knowledge assimilation hidden deeper in our cognitive process.

연구 동기 및 목표

  • 설명자 시각에 치중된 설명 생성의 격차를 보완하여 설명 수신자의 인지 부하와 이해 과정을 중심으로 하는 것.
  • 순차적 설명에서 정보 순서에 대한 인간의 선호도를 모델링하며, 순차적 진행이 이해도 향상에 기여함을 인식하는 것.
  • 인지적 노력 최소화와 임상적 성과 최대화를 위해 설명 단계의 순서를 학습할 수 있는 일반화 가능한 프레임워크를 개발하는 것.
  • 도메인 독립적 특징(예: 액션 거리, 레벤슈타인 거리)과 도메인 독립적 특징(예: 조건의 공간적 위치)이 함께 인간의 설명 순서 선호도를 형성하는지 검증하는 것.
  • 점진적 설명이 객관적 임상 정확도와 주관적 인지 부하 지표 모두에서 측정 가능한 향상을 이끌어내는지 입증하는 것.

제안 방법

  • 각 상태가 부분적 설명을 나타내고, 행동이 다음 설명 단계를 추가하는 것을 의미하는 목표 기반 마르코프 결정 과정(MDP)으로 점진적 설명 생성을 공식화한다.
  • MTurk를 통해 실시한 군중 기반 연구에서 수집한 인간 선호도 데이터로부터 보상 함수를 학습하기 위해 역강화학습(IRL)을 적용한다.
  • 도메인 독립적 특징(예: 액션 거리, 레벤슈타인 거리)과 도메인 독립적 특징(예: x_min, y_min, x_max, y_max)의 조합을 사용해 설명 전환의 인지 비용을 표현한다.
  • 사냥터 도메인에서 21개의 인간 주석 기반 설명 순서를 학습하고, 탈출방 도메인에서 87명의 참가자를 대상으로 테스트한다.
  • 학습된 보상 함수를 적용해 인지적 노력의 인식을 최소화하고 임상적 성과를 최대화하는 점진적 설명을 생성한다.
  • 두 개의 서로 다른 도메인에서 주관적(NASA TLX) 및 객관적(임상 정확도) 지표를 사용해 방법을 검증한다.

실험 결과

연구 질문

  • RQ1사람들은 점진적 설명에서 정보 순서에 대해 측정 가능한 선호도를 보이며, 이러한 선호도는 학습이 가능한가?
  • RQ2도메인 독립적 특징(예: 액션 거리, 레벤슈타인 거리)과 도메인 독립적 특징(예: 조건의 공간적 위치)이 인간의 설명 순서 선호도에 어느 정도 영향을 미치는가?
  • RQ3인지적 흡수를 반영하도록 순서가 정렬된 점진적 설명은 비점진적 기반 대비 임상적 성과 향상과 인지 부하 감소를 이끌어내는가?
  • RQ4설명 이해의 인지 과정은 동적인가? 그리고 이는 IRL을 통해 학습된 특징 가중치에 반영되는가?
  • RQ5제안된 프레임워크는 다양한 도메인(예: 사냥터 및 탈출방) 간에서 일반화 가능하며, 일관된 설명 품질 향상을 유지하는가?

주요 결과

  • 제안된 PEG 방법은 모든 NASA TLX 지표에서 랜덤, 맨하탄, 기반 방법보다 유의미하게 뛰어나며, 가중치 TLX 점수에서 통계적으로 유의미한 향상(α < 0.05)을 보였다.
  • 탈출방 도메인에서 임상 정확도는 랜덤(85.4%)에서 PEG(96.3%)로 향상되어 10.9% 포인트 증가했다.
  • 레벤슈타인 거리 및 액션 거리 특징이 가장 높은 정규화 가중치(각각 0.46 및 0.44)를 확보하여 인지적 노력 인식에 강력한 영향을 미침을 시사했다.
  • 계획 비용 거리 특징은 낮은 가중치(0.04)를 확보하여 탈출방 도메인에서는 계획 비용 증가와 인지적 노력 증가 간 상관관계가 없음을 시사했다.
  • PEG로 생성된 설명 순서는 단계 간 액션 거리 곡선이 더 매끄럽게 나타나, 설명 흐름의 점진성에 대한 시각적 확인을 가능하게 했다.
  • 결과는 인간의 설명 순서 선호도가 도메인 독립적 및 도메인 독립적 특징에 의해 함께 형성됨을 확인하였으며, 설명 이해 과정에서의 인지적 흡수의 동적 성격을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.