[논문 리뷰] Self-Refined Large Language Model as Automated Reward Function Designer for Deep Reinforcement Learning in Robotics
이 논문은 로봇 분야의 딥 강화 학습에서 보상 함수 설계를 자동화하는 자기 개선형 대규모 언어 모델(Large Language Model, LLM) 프레임워크를 제안한다. 반복적으로 생성, 평가, 개선하는 방식으로 강화 학습 훈련에서의 피드백을 활용함으로써, 다양한 로봇 시스템에서 연속 제어 과제에서 수동으로 설계된 보상 함수와 동등하거나 이를 초월하는 성능을 보이는 보상 함수를 생성한다.
Although Deep Reinforcement Learning (DRL) has achieved notable success in numerous robotic applications, designing a high-performing reward function remains a challenging task that often requires substantial manual input. Recently, Large Language Models (LLMs) have been extensively adopted to address tasks demanding in-depth common-sense knowledge, such as reasoning and planning. Recognizing that reward function design is also inherently linked to such knowledge, LLM offers a promising potential in this context. Motivated by this, we propose in this work a novel LLM framework with a self-refinement mechanism for automated reward function design. The framework commences with the LLM formulating an initial reward function based on natural language inputs. Then, the performance of the reward function is assessed, and the results are presented back to the LLM for guiding its self-refinement process. We examine the performance of our proposed framework through a variety of continuous robotic control tasks across three diverse robotic systems. The results indicate that our LLM-designed reward functions are able to rival or even surpass manually designed reward functions, highlighting the efficacy and applicability of our approach.
연구 동기 및 목표
- 로봇 분야의 딥 강화 학습에서 고성능 보상 함수를 수동으로 설계하는 데 도전하는 데 목적을 두며.
- 대규모 언어 모델(LLM)이 자연어 입력을 사용하여 자율적으로 효과적인 보상 함수를 생성할 수 있는지 탐색한다.
- 강화 학습 훈련 피드백을 기반으로 LLM이 생성한 보상 함수를 향상시키는 자기 개선 루프를 개발한다.
- 다양한 연속 제어 로봇 과제에서 이 프레임워크를 평가하고 수동으로 설계된 보상 함수와 성능을 비교한다.
- 최소한의 인간 간섭으로도 LLM이 생성한 보상 함수가 우수하거나 동등한 성능을 달성할 수 있음을 입증한다.
제안 방법
- 프레임워크는 자연어 작업 기술서와 이용 가능한 상태 관측값을 기반으로 LLM이 초도 보상 함수를 생성함으로써 시작된다.
- 생성된 보상 함수는 DRL 에이전트의 훈련에 사용되며, 훈련 결과(예: 성공률, 보상 궤적 등)가 수집되고 평가된다.
- 훈련 수렴, 평균 보상, 성공률, 상태 이탈 정도 등의 평가 결과가 LLM으로 다시 피드백으로 제공된다.
- LLM은 사고의 사슬 체계를 활용하여 피드백를 바탕으로 보상 함수를 재설계함으로써 자기 개선을 수행한다.
- 생성, 평가, 개선의 루프가 성공률과 보상 안정성 측정 기준으로 높은 성능을 달성할 때까지 반복된다.
- 최종 보상 함수는 다수의 로봇 시스템(예: 4족 보행 로봇, 드론, 조작기)에서 연속 제어 과제를 통해 검증된다.
실험 결과
연구 질문
- RQ1LLM은 자연어와 상태 관측 기술서만을 사용하여 로봇 제어 과제의 보상 함수를 생성할 수 있는가?
- RQ2여러 반복을 거쳐 자기 개선 루프가 LLM이 생성한 보상 함수의 품질을 얼마나 효과적으로 향상시키는가?
- RQ3LLM이 생성한 보상 함수는 연속 제어 과제에서 수동 설계된 보상 함수와 동등하거나 이를 초월하는 성능을 달성할 수 있는가?
- RQ4강화 학습 훈련에서 LLM 기반 보상 함수 개선을 안내하는 데 가장 유용한 피드백 신호는 무엇인가?
- RQ5제안된 프레임워크는 다양한 로봇 플랫폼과 과제 유형에 대해 얼마나 일반화 가능한가?
주요 결과
- 자기 개선형 LLM 프레임워크는 4족 보행 로봇에 대해 99%의 성공률을 달성하는 보상 함수를 성공적으로 생성했으며, 이는 수동 설계된 보상 함수와 동일한 성능를 보였다.
- 세 번의 반복적 개선 후 LLM이 생성한 보상 함수는 평균 에피소드 보상 894를 기록했으며, 43,000단계에서 훈련 수렴을 달성했다.
- 최종 LLM 설계 보상 함수는 선형 속도 이탈을 0.183(정규화된 값)으로 줄여 안정적이고 정확한 전진 운동을 가능케 했다.
- 초기 버전 대비 성능 향상을 보였다: 두 번째 반복은 성공률 70%에 머물렀으나, 최종 버전은 목표 1(전진 속도)에서 99%, 목표 2(넘어짐 방지)에서 100%의 성공률을 기록했다.
- LLM이 생성한 보상 함수는 낙상 방지를 100%의 성공률로 달성하여, 수동 설계 기반 기준 성능과 동일한 결과를 보였다.
- 이 방법은 4족 보행, 드론 정지 비행, 로봇 조작 과제 등 다양한 로봇 시스템에서 일반화 가능성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.