Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models as Zero-Shot Human Models for Human-Robot Interaction

Bowen Zhang, Harold Soh|arXiv (Cornell University)|2023. 03. 06.
Multimodal Machine Learning Applications참고 문헌 33인용 수 5
한 줄 요약

이 논문은 인간-로봇 상호작용(HRI)에서 대규모 언어 모델(LLM)을 제로샷 인간 모델로 사용하여, 미세조정이나 상호작용 데이터 없이도 인간 행동을 예측할 수 있도록 제안한다. LLM은 신뢰 기반 HRI 작업에서 전용 모델과 유사한 성능을 달성했으며, 시뮬레이션된 도구 전달 실험에서 LLM 기반 계획 모델을 사용한 로봇은 과신을 줄이고 수익을 55% 향상시켰다(평균 수익: -1.88 대 -4.24).

ABSTRACT

Human models play a crucial role in human-robot interaction (HRI), enabling robots to consider the impact of their actions on people and plan their behavior accordingly. However, crafting good human models is challenging; capturing context-dependent human behavior requires significant prior knowledge and/or large amounts of interaction data, both of which are difficult to obtain. In this work, we explore the potential of large-language models (LLMs) -- which have consumed vast amounts of human-generated text data -- to act as zero-shot human models for HRI. Our experiments on three social datasets yield promising results; the LLMs are able to achieve performance comparable to purpose-built models. That said, we also discuss current limitations, such as sensitivity to prompts and spatial/numerical reasoning mishaps. Based on our findings, we demonstrate how LLM-based human models can be integrated into a social robot's planning process and applied in HRI scenarios. Specifically, we present one case study on a simulated trust-based table-clearing task and replicate past results that relied on custom models. Next, we conduct a new robot utensil-passing experiment (n = 65) where preliminary results show that planning with a LLM-based human model can achieve gains over a basic myopic plan. In summary, our results show that LLMs offer a promising (but incomplete) approach to human modeling for HRI.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)이 작업 특화 데이터나 수작업으로 설정한 가정 없이도 인간-로봇 상호작용(HRI)에서 제로샷 인간 모델로 기능할 수 있는지 조사하는 것.
  • 기준 데이터셋을 사용하여 LLM이 사회적 HRI 시나리오에서 고수준 인간 상태와 행동을 모델링하는 데 효과적인지 평가하는 것.
  • LLM 기반 인간 모델을 신뢰 관련 HRI 작업을 위한 로봇 계획 과정에 통합하는 것을 보여주는 것.
  • 실제 HRI 환경에서 물리적 및 공간적 특성에 대한 추론을 수행할 때 LLM의 한계를 평가하는 것.
  • LLM과 하위 수준의 물리적 추론 모델을 조합한 하이브리드 모델링 접근법을 탐색하여 HRI 성능을 향상시키는 것.

제안 방법

  • 기존의 최고 성능을 보이는 두 개의 LLM—FLAN-T5와 GPT-3.5의 변종—을 제로샷 인간 모델로 활용하여 이전 인간-로봇 상호작용의 맥락적 시퀀스를 프롬프트로 제공함.
  • 세 가지 사회적 HRI 데이터셋에서 LLM의 성능을 평가하여 전용 기계학습 모델과 예측 정확도를 비교함.
  • LLM 기반 인간 모델을 심볼릭 계획기와 통합하여 시뮬레이션된 신뢰 기반 테이블 정리 작업에서 행동 시퀀스를 생성함.
  • 65명의 참가자가 참여한 새로운 로봇 도구 전달 실험을 설계하여, 로봇이 LLM 기반 모델을 사용해 인간의 간섭을 예측하고 행동을 조정하도록 함.
  • 두 가지 계획 전략을 구현함: 단기적 사고를 가진 기초 계획(Basic-Plan)과 비날리도구에 의 intensional failure를 유도하여 인간의 신뢰를 校정하는 LLM-Plan.
  • 인터랙티브 비디오 설문을 사용하여 실제 상호작용 없이도 로봇 행동을 시뮬레이션하고 인간의 신뢰 판단을 수집함.

실험 결과

연구 질문

  • RQ1대규모 언어 모델(LLM)이 인간-로봇 상호작용에서 미세조정이나 상호작용 데이터 없이도 효과적으로 제로샷 인간 모델로 기능할 수 있는가?
  • RQ2신뢰 조정 및 물건 전달과 같은 사회적 HRI 작업에서 LLM 기반 인간 모델의 성능이 전용 모델과 비교해 어떻게 되는가?
  • RQ3LLM 기반 인간 모델이 신뢰 기반 HRI 시나리오에서 로봇 계획을 얼마나 향상시킬 수 있는가?
  • RQ4물리적 또는 수치적 추론이 필요한 작업에서 LLM이 인간 행동을 모델링할 때의 주요 한계는 무엇인가?
  • RQ5물리적 물체의 특성(예: 손잡이 모양 등)이 인간의 신뢰에 어떻게 영향을 미치며, LLM은 이러한 감각적 요소를 고려할 수 있는가?

주요 결과

  • LLM은 제로샷 프롬프팅만으로도 세 가지 기준 HRI 데이터셋에서 전용 기계학습 모델과 유사한 예측 성능을 달성했다.
  • 65명의 참가자가 참여한 도구 전달 실험에서, Basic-Plan 그룹의 참가자 중 63.6%가 나이프를 전달하도록 허용한 반면, LLM-Plan 그룹은 단지 28.1%에 그쳤다.
  • LLM-Plan 로봇의 평균 수익은 -1.88로 기록되었고, 이는 Basic-Plan 로봇의 -4.24보다 유의미하게 높았다(p = 0.042).
  • 로봇이 가위에 의도적으로 실패하는 것을 관찰한 참가자 중 90%(20명 중 18명)가 나이프에 간섭하는 경향을 보여, 효과적인 신뢰 조정이 이루어졌음을 시사했다.
  • 참가자들의 신뢰 결정은 손잡이 모양과 같은 물리적 물체 특성에 영향을 받았으며, LLM 기반 모델은 이러한 요소를 고려하지 못했다.
  • LLM은 프롬프트 문법에 민감하게 반응했고, 공간적 및 수치적 추론에서 어려움을 겪어, 저수준의 물리적 상호작용을 모델링하는 데 한계를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.