[논문 리뷰] Prompt a Robot to Walk with Large Language Models
이 논문은 GPT-4를 사용하여 소수의 텍스트 프롬프트를 활용해 작업 특화 미세조정 없이 직접 저수준 제어 명령어를 생성하는 새로운 프레임워크를 제안한다. 이 방법은 대규모 언어 모델(Large Language Models, LLMs)이 고차원 로봇 시스템에서 피드백 제어기로 기능하도록 하여 시뮬레이션에서 다양한 로봇과 지형에서 성공적인 동적 보행을 달성한다. 정규화된 보행 시간은 0.721이며, 도전적인 지형에서 성공률은 0.6%이다.
Large language models (LLMs) pre-trained on vast internet-scale data have showcased remarkable capabilities across diverse domains. Recently, there has been escalating interest in deploying LLMs for robotics, aiming to harness the power of foundation models in real-world settings. However, this approach faces significant challenges, particularly in grounding these models in the physical world and in generating dynamic robot motions. To address these issues, we introduce a novel paradigm in which we use few-shot prompts collected from the physical environment, enabling the LLM to autoregressively generate low-level control commands for robots without task-specific fine-tuning. Experiments across various robots and environments validate that our method can effectively prompt a robot to walk. We thus illustrate how LLMs can proficiently function as low-level feedback controllers for dynamic motion control even in high-dimensional robotic systems. The project website and source code can be found at: https://prompt2walk.github.io/ .
연구 동기 및 목표
- 대규모 언어 모델(Large Language Models, LLMs)이 작업 특화 미세조정 없이도 동적 로봇 보행을 위한 저수준 피드백 제어기로 기능할 수 있는지 조사하는 것.
- 실제 로봇 트레이제토리에서 수집한 소수의 프롬프트를 활용하여 LLM을 물리적 로봇 제어에 통합하는 데 도전하는 것.
- LLM이 암시적 학습(imitation)이나 강화 학습가 아닌, 인-컨텍스트 학습을 통해 안정적이고 동적인 보행 행동을 생성할 수 있는지 탐색하는 것.
- 다양한 로봇, 지형 및 시뮬레이션 환경에서 프레임워크의 유효성을 검증하는 것.
제안 방법
- 이 방법은 GPT-4를 사용한 소수의 프롬프트 파라다임을 사용하며, 프롬프트에는 기술 설명 프롬프트와 관측-행동 이력 시퀀스가 포함된다.
- 제어 명령어는 정규화된 목표 관절 위치로 생성되며, 200Hz에서 PD 제어기를 통해 추적되며, LLM은 10Hz에서 추론한다.
- 각 추론 루프 이후 새로운 관측과 행동으로 프롬프트를 동적으로 업데이트하여 맥락을 유지한다.
- 프레임워크는 사전 훈련된 강화 학습 정책 데이터를 사용하여 초기화되어 프롬프트 내에서 현실적인 시연를 제공한다.
- 텍스트 프롬프트는 작업 기술, 환경 관측, 행동 시퀀스를 포함하도록 철저히 설계되어 LLM의 인-컨텍스트 학습을 이끌어낸다.
- 이 접근법은 미세조정을 피하고, LLM의 인-컨텍스트 학습 능력을 활용하여 새로운 보행 작업으로 일반화하는 데 중점을 둔다.

실험 결과
연구 질문
- RQ1LLM이 작업 특화 미세조정 없이도 동적 로봇 보행을 위한 저수준 피드백 제어기로 기능할 수 있는가?
- RQ2소수의 프롬프트를 활용한 인-컨텍스트 학습이 LLM이 안정적이고 동적인 보행 행동을 생성하는 데 얼마나 효과적인가?
- RQ3기술 서술 및 관측-행동 시퀀스를 포함한 텍스트 프롬프트의 설계가 로봇 보행 성공에 얼마나 영향을 미치는가?
- RQ4제안된 프롬프트 프레임워크는 다양한 로봇 플랫폼과 지형으로 일반화 가능한가?
주요 결과
- 이 방법은 불균형 지형에서 정규화된 보행 시간(NWT)이 0.721로 나타나 장기적인 보행 성능가 효과적임을 보여주었다.
- 가장 도전적인 지형(E5)에서의 성공률은 0.6%였으며, 낮은 성공률에도 불구하고 복잡한 환경에서의 가능성을 입증하였다.
- LLM 정책은 규칙적이고 생체역학적으로 타당한 패턴을 보이는 관절 궤적을 생성하였으며, 강화 학습 기반 정책과는 뚜렷한 차이를 보였다.
- 기술 서술 프롬프트가 성공에 결정적인 역할을 하였으며, 수치적 관측과 행동만 제공된 경우 LLM은 보행에 실패하였다.
- 프레임워크는 여러 로봇(A1 및 ANYmal), 시뮬레이터(MuJoCo 및 Isaac Gym), 지형에서 일반화되었으며, 환경 간 강건성을 검증하였다.
- 프롬프트 설계는 취약하였으며, 미세한 변경만으로도 성능에 큰 영향을 미쳤다. 이는 LLM 기반 제어에서 더 나은 프롬프트 엔지니어링의 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.