[논문 리뷰] Explaining Autonomy: Enhancing Human-Robot Interaction through Explanation Generation with Large Language Models
이 논문은 인간-로봇 상호작용(HRI)에서 자율 로봇 행동에 대한 인간이 이해할 수 있는 설명을 생성하기 위해 대규모 언어 모델(LLM)을 활용한 검색 증강 생성(RAG) 시스템을 제안한다. 로봇 로그 데이터를 해석하고 맥락 인식 설명을 생성함으로써, 사용자 신뢰도와 이해도를 햖스시키며, 유럽 로봇 리그 프레임워크에서의 주행 작업 평가 결과, 기술적 배경을 가진 사용자들에게 고품질의 설명을 제공함을 확인하였다.
This paper introduces a system designed to generate explanations for the actions performed by an autonomous robot in Human-Robot Interaction (HRI). Explainability in robotics, encapsulated within the concept of an eXplainable Autonomous Robot (XAR), is a growing research area. The work described in this paper aims to take advantage of the capabilities of Large Language Models (LLMs) in performing natural language processing tasks. This study focuses on the possibility of generating explanations using such models in combination with a Retrieval Augmented Generation (RAG) method to interpret data gathered from the logs of autonomous systems. In addition, this work also presents a formalization of the proposed explanation system. It has been evaluated through a navigation test from the European Robotics League (ERL), a Europe-wide social robotics competition. Regarding the obtained results, a validation questionnaire has been conducted to measure the quality of the explanations from the perspective of technical users. The results obtained during the experiment highlight the potential utility of LLMs in achieving explanatory capabilities in robots.
연구 동기 및 목표
- 자율 로봇의 설명 가능성에 대한 증가하는 수요를 해결하여 인간-로봇 상호작용(HRI)에서 사용자 신뢰도와 시스템 투명도를 향상시키기 위해.
- 낮은 수준의 로봇 로그 데이터를 다양한 기술적 배경을 가진 사용자가 이해할 수 있는 자연어 설명으로 변환하는 시스템을 개발하기 위해.
- 실제 로봇 주행 시나리오에서 LLM이 생성한 설명의 품질과 사용성 평가하기 위해.
- 데이터 해석, 사용자 인식 설명 구축, 검색 증강 생성을 통합하는 설명 생성 파이프라인을 체계화하기 위해.
- 실제 경쟁 로봇 환경(유럽 로봇 리그)에서 사용자 평가를 통해 시스템의 효과성 검증하기 위해.
제안 방법
- 시스템은 자율 주행 작업 중 웨이포인트 추적, 장애물 탐지, 경로 계획 실패 등의 로봇 행동 데이터를 수집하고 로깅한다.
- 사용자 질의에 기반해 벡터 데이터베이스에서 관련된 로그 세그먼트를 검색하는 데 검색 증강 생성(RAG) 프레임워크를 사용한다.
- 微fine-tuned된 대규모 언어 모델(LLM)이 검색된 로그 데이터를 해석하고 사용자의 지식 수준에 맞는 자연어 설명을 구성한다.
- 설명 생성 파이프라인은 데이터 수집, 이해 가능한 데이터 해석, 사용자 인식 설명 구축의 세 단계로 구성된다.
- 시스템은 실제 주행 실행 로그를 바탕으로 평가되며, 특히 유럽 로봇 리그(ERL)에서 수집된 로그를 처리하고 기술적 사용자를 대상으로 설명을 생성한다.
- 사용자 평가는 설명의 품질, 명확성, 관련성 등을 평가하는 설문지를 통해 실시되며, '왜', '어떻게', '무엇'에 대한 질문에 대한 반응을 중심으로 한다.
실험 결과
연구 질문
- RQ1LLM은 자율 주행 작업 중 로봇 로그 데이터로부터 인간이 이해할 수 있는 설명을 효과적으로 생성할 수 있는가?
- RQ2RAG의 통합은 HRI 환경에서 LLM이 생성한 설명의 사실적 정확성과 관련성에 어떤 영향을 미치는가?
- RQ3기술적 배경을 가진 사용자들이 생성된 설명을 명확하고 정확하며 유용하다고 느끼는 정도는 어느 정도인가?
- RQ4사용자의 지식 수준 차이가 시스템이 생성한 설명의 품질 인식에 어떤 영향을 미치는가?
- RQ5경로 재계획, 장애물 회피와 같은 특정 유형의 로봇 이벤트 중에서 이 LLM-RAG 접근 방식으로 가장 효과적으로 설명되는 것은 무엇인가?
주요 결과
- LLM-RAG 시스템은 기술적 사용자들로부터 명확성, 정확성, 완전성 측면에서 높은 평가를 받은 설명을 성공적으로 생성하였다.
- 설명은 장애물로 인한 경로 재계획 또는 유효하지 않은 경로로 인한 행동과 같은 '왜'와 '어떻게' 질문에 효과적으로 대응하였다.
- 시스템은 웨이포인트 수신, 주행 실패, 목표 체크러너 경고와 같은 핵심 이벤트를 정확히 식별하고 설명하였다.
- 평가 결과, 사용자들은 설명 덕분에 특히 복잡하거나 실패한 주행 시나리오에서 로봇의 의사결정 과정을 더 잘 이해하게 되었다고 평가하였다.
- RAG 통합으로 설명의 사실 기반 성격이 향상되어, 제로샷 LLM 생성 대비 환상적 생성 현상이 감소하였다.
- 해석 가능한 이벤트에 집중하고 자연어로 맥락을 부여함으로써, 모호하거나 불완전한 로그 데이터 처리에 있어 시스템의 강건성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.