Skip to main content
QUICK REVIEW

[논문 리뷰] LLM-Based Human-Robot Collaboration Framework for Manipulation Tasks

Haokun Liu, Yaonan Zhu|arXiv (Cornell University)|2023. 08. 29.
Robot Manipulation and LearningEngineering인용 수 3
한 줄 요약

이 논문은 고수준 자연어 명령어를 실행 가능한 동작 시퀀스로 변환하기 위해 계층적 작업 분해를 사용하는 LLM 기반 인간-로봇 협업 프레임워크를 제안한다. YOLO 기반 인식, 오류 보정을 위한 DMP 기반 원격 조작, 그리고 LLM 기반 계획을 통합함으로써, 시스템은 향상된 작업 타당성과 일반화 능력을 달성하였으며, 단기 예측 작업에서 성공률가 80%를 초과하고, DMP 보정을 통해 이전에는 실행 불가능했던 동작(예: bol을 잡는 것)의 완료를 가능하게 하였다.

ABSTRACT

This paper presents a novel approach to enhance autonomous robotic manipulation using the Large Language Model (LLM) for logical inference, converting high-level language commands into sequences of executable motion functions. The proposed system combines the advantage of LLM with YOLO-based environmental perception to enable robots to autonomously make reasonable decisions and task planning based on the given commands. Additionally, to address the potential inaccuracies or illogical actions arising from LLM, a combination of teleoperation and Dynamic Movement Primitives (DMP) is employed for action correction. This integration aims to improve the practicality and generalizability of the LLM-based human-robot collaboration system.

연구 동기 및 목표

  • 고수준 자연어 명령어의 해석을 가능하게 하여 가정용 조작 작업을 위한 로봇 작업 계획을 향상시키기.
  • 사람이 참여하는 원격 조작과 DMP 기반 궤적 학습을 통해 LLM이 생성한 동작 시퀀스의 정확도를 향상시키기.
  • 실시간 환경 인식과 동작 보정을 통합한 LLM 추론을 통해 시스템의 일반화 능력과 타당성을 향상시키기.
  • 장기 예측 작업을 관리 가능한 단기 예측 하위 작업으로 나누는 계층적 작업 분해 전략 개발하기.
  • 자율적 LLM 계획과 인간 주도 보정 간의 동적 전환을 통해 원활한 인간-로봇 협업을 가능하게 하기.

제안 방법

  • 시스템은 작업 특화 코퍼스에 맞춰 미세조정된 GPT-2를 사용하여 자연어 명령어를 실행 가능한 동작 함수로 매핑한다.
  • 계층적 작업 구조는 장기 예측 작업(10개 이상의 함수 포함)을 단기 예측 하위 작업(10개 이하의 함수 포함)으로 분해하고, 이를 개별 동작 함수에 매핑한다.
  • YOLO 기반 객체 검출은 실시간으로 정확한 객체 위치 추적을 제공하며, 이는 LLM의 계획 과정에 통합된다.
  • LLM이 생성한 동작이 실행 불가능한 경우, 시스템은 VR 인터페이스를 통해 인간의 시연를 캡처하는 원격 조작 모드로 전환된다.
  • 동적 운동 원리(DMPs)는 원격 조작된 궤적을 모델링하고 재현하여 안정적이고 일반화 가능한 동작 실행을 가능하게 한다.
  • LLM 계획, 인식, 원격 조작, DMP 보정을 통합하여 인간-로봇 협업을 위한 통합 상호작용 루프를 구현한다.
Figure 1: Framework of LLM-based task planning with enhanced HRC.
Figure 1: Framework of LLM-based task planning with enhanced HRC.

실험 결과

연구 질문

  • RQ1LLM은 로봇 조작을 위한 실행 가능한 동작 시퀀스로 고수준 언어 명령어를 효과적으로 분해할 수 있는가?
  • RQ2LLM이 생성한 동작 계획이 실행 불가능하거나 정확하지 않을 경우, 이를 어떻게 보정할 수 있는가?
  • RQ3실시간 YOLO 기반 인식 통합이 작업 실행 정확도에 얼마나 기여하는가?
  • RQ4DMP 기반 원격 조작은 LLM 기반 로봇 동작의 타당성과 일반화 능력을 향상시킬 수 있는가?
  • RQ5계층적 작업 분해는 장기 예측 조작 작업의 성공률에 어떤 영향을 미치는가?

주요 결과

  • 시스템은 '캐비닛 위를 청소하라'는 장기 예측 작업에서 성공률 0.80을 기록하여 복잡한 시퀀스에 대해 합리적인 성능을 보였다.
  • '볼을 잡는다' 작업은 LLM이 생성한 함수에만 의존할 경우 타당성 점수(FSB)가 0.00이었으며, 기본 동작 프리미티브의 한계를 보여주었다.
  • DMP 기반 원격 조작 보정은 '볼을 잡는다' 작업의 완료를 성공적으로 가능하게 하여 사람의 참여가 있는 보정의 효과를 입증하였다.
  • '캐비닛 위를 청소하라' 작업의 실행 가능성(Exec)은 0.80이었으며, 나머지 20%의 실패는 LLM의 함수 생성 과정에서 발생하는 랜덤성 때문이었다.
  • '잡기', '놓기', '열기'와 같은 단기 예측 작업들은 높은 성공률를 보였으며, 이는 간단한 동작에 대한 프레임워크의 효과성을 확인한다.
  • 장기 예측 작업에서의 오류 누적 문제는 여전히 도전 과제이며, 보다 향상된 보정 메커니즘과 원격 조작 입력의 정교화 필요성을 시사한다.
Figure 2: Experiment data.
Figure 2: Experiment data.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.