[论文解读] Explaining Autonomy: Enhancing Human-Robot Interaction through Explanation Generation with Large Language Models
本文提出了一种增强大型语言模型(LLMs)的检索增强生成(RAG)系统,用于在人机交互(HRI)中为自主机器人行为生成人类可理解的解释。通过解释机器人日志数据并生成上下文感知的解释,该系统提升了用户的信任度与理解力,在欧洲机器人联盟框架下的导航任务评估中,技术用户对高质量解释给予了积极评价。
This paper introduces a system designed to generate explanations for the actions performed by an autonomous robot in Human-Robot Interaction (HRI). Explainability in robotics, encapsulated within the concept of an eXplainable Autonomous Robot (XAR), is a growing research area. The work described in this paper aims to take advantage of the capabilities of Large Language Models (LLMs) in performing natural language processing tasks. This study focuses on the possibility of generating explanations using such models in combination with a Retrieval Augmented Generation (RAG) method to interpret data gathered from the logs of autonomous systems. In addition, this work also presents a formalization of the proposed explanation system. It has been evaluated through a navigation test from the European Robotics League (ERL), a Europe-wide social robotics competition. Regarding the obtained results, a validation questionnaire has been conducted to measure the quality of the explanations from the perspective of technical users. The results obtained during the experiment highlight the potential utility of LLMs in achieving explanatory capabilities in robots.
研究动机与目标
- 为应对自主机器人日益增长的可解释性需求,以提升人机交互(HRI)中的人类信任度与系统透明度。
- 开发一种将低层次机器人日志数据转化为用户可理解的自然语言解释的系统,适用于不同技术水平的用户。
- 在真实世界的机器人导航场景中,评估大型语言模型(LLM)生成解释的质量与可用性。
- 形式化一个解释生成流程,整合数据解读、用户感知的解释构建以及检索增强生成。
- 通过在竞争性机器人环境(欧洲机器人联盟)中开展用户评估,验证系统的有效性。
提出的方法
- 系统在自主导航任务期间收集并记录机器人行为数据,包括航路点跟踪、障碍物检测以及路径规划失败等。
- 采用检索增强生成(RAG)框架,根据用户查询从向量数据库中检索相关日志片段。
- 使用微调后的大型语言模型(LLM)解释检索到的日志数据,并构建针对用户知识水平的自然语言解释。
- 解释生成流程遵循三步走:数据收集、可解释的数据解读,以及用户感知的解释构建。
- 系统通过欧洲机器人联盟(ERL)的真实导航执行进行评估,日志经处理后生成面向技术用户的解释。
- 通过问卷调查开展用户评估,评估内容涵盖解释的质量、清晰度与相关性,重点关注对“为什么”、“如何”和“什么”类问题的回答。
实验结果
研究问题
- RQ1大型语言模型(LLMs)能否在自主导航任务中有效从机器人日志数据生成人类可理解的解释?
- RQ2RAG的集成在HRI场景中如何提升LLM生成解释的事实准确性与相关性?
- RQ3技术用户在多大程度上认为系统生成的解释清晰、准确且有帮助,以理解机器人行为?
- RQ4用户特定的知识水平在多大程度上影响其对系统生成解释质量的感知?
- RQ5哪些类型的机器人事件(例如路径重规划、避障)最能通过此LLM-RAG方法得到有效解释?
主要发现
- LLM-RAG系统成功生成了技术用户在清晰度、准确性和完整性方面评价较高的解释。
- 解释有效回应了关于机器人行为的“为什么”和“如何”类问题,例如因障碍物或无效路径导致的路线重规划。
- 系统正确识别并解释了关键事件,包括航路点接收、导航失败以及目标检查器警告。
- 评估结果显示,用户认为解释提升了其对机器人决策过程的理解,尤其是在复杂或导航失败的情境中。
- RAG的集成增强了解释的事实基础,相比零样本LLM生成,显著减少了幻觉现象。
- 系统在处理模糊或不完整的日志数据时表现出鲁棒性,通过聚焦于可解释事件并以自然语言进行情境化表达。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。