[논문 리뷰] The MineRL BASALT Competition on Learning from Human Feedback
MineRL BASALT 경연대회는 사전에 정의된 보상 함수 대신 인간의 피드백을 사용하여 AI 에이전트를 훈련시키는 데 초점을 맞춘 벤치마크를 제안한다. 이는 마인크래프트에서 복잡하고 자연어로 기술된 작업을 다루며, 작업 완수 여부에 대해 인간의 판단을 통해 에이전트를 평가함으로써 가치 정렬 및 개방형 환경에서의 확장 가능한 모방 학습과 선호도 학습 연구를 촉진한다.
The last decade has seen a significant increase of interest in deep learning research, with many public successes that have demonstrated its potential. As such, these systems are now being incorporated into commercial products. With this comes an additional challenge: how can we build AI systems that solve tasks where there is not a crisp, well-defined specification? While multiple solutions have been proposed, in this competition we focus on one in particular: learning from human feedback. Rather than training AI systems using a predefined reward function or using a labeled dataset with a predefined set of categories, we instead train the AI system using a learning signal derived from some form of human feedback, which can evolve over time as the understanding of the task changes, or as the capabilities of the AI system improve. The MineRL BASALT competition aims to spur forward research on this important class of techniques. We design a suite of four tasks in Minecraft for which we expect it will be hard to write down hardcoded reward functions. These tasks are defined by a paragraph of natural language: for example, "create a waterfall and take a scenic picture of it", with additional clarifying details. Participants must train a separate agent for each task, using any method they want. Agents are then evaluated by humans who have read the task description. To help participants get started, we provide a dataset of human demonstrations on each of the four tasks, as well as an imitation learning baseline that leverages these demonstrations. Our hope is that this competition will improve our ability to build AI systems that do what their designers intend them to do, even when the intent cannot be easily formalized. Besides allowing AI to solve more tasks, this can also enable more effective regulation of AI systems, as well as making progress on the value alignment problem.
연구 동기 및 목표
- 수동으로 설계된 보상 함수의 대안으로 인간 피드백 학습(LfHF) 연구를 발전시키기 위해.
- 명확하지 않거나 잘 정의되지 않은 사양을 가진 작업에 대해 AI 에이전트를 훈련시키는 도전 과제를 해결하기 위해.
- 에이전트의 작업 완수 여부에 대해 인간의 판단에 기반해 평가하는 벤치마크를 만들기 위해, 단지 보상 최적화가 아닌 것에 중점을 두기 위해.
- 복잡한 자연어 지시어를 이해하고 실행할 수 있는 능력을 갖춘 확장 가능한 인간 중심의 AI 시스템을 촉진하기 위해.
- 다양한 피드백 방식을 통해 인간의 의도를 통합함으로써 보상 해킹과 이질성 문제를 줄이기 위해.
제안 방법
- 참가자들은 어떤 방법을 사용할지 자유롭게 선택할 수 있으며, 작업에 대해 사전에 정의된 보상 함수가 제공되지 않는다.
- 작업들은 '폭포를 만들고 그 폭포의 경치를 찍는다'와 같은 자연어 기술로 정의된다.
- 인간 평가자가 작업 설명에 기반해 에이전트 성능을 평가함으로써 의도된 행동과의 일치를 확보한다.
- 모방 학습 기반 모델의 초기화를 돕기 위해 인간의 행동 기록 데이터셋이 제공된다.
- 경연대회는 다양한 에이전트 행동과 목표를 지원하는 풍부한 개방형 환경인 MineRL 환경을 사용한다.
- 평가 과정에서 인간 평가자가 에이전트의 작업 완수 정도를 평가함으로써 환경 설계에 기인한 편향을 줄인다.
실험 결과
연구 질문
- RQ1인간 피드백을 통해 훈련된 에이전트는 개방형 환경에서 자연어로 기술된 복잡한 작업에 얼마나 잘 일반화되는가?
- RQ2보상 함수가 모호하거나 오해의 소지가 있는 상황에서 인간 피드백 학습이 전통적인 보상 형태 설계보다 성능이 뛰어나게 되는가?
- RQ3모방 학습과 선호도 기반 방법은 복잡하고 현실과 유사한 작업에서 인간의 의도와의 일치도를 얼마나 향상시키는가?
- RQ4자동 보상 신호와 비교해 인간 평가가 작업 성공을 측정하는 데 얼마나 더 효과적인가?
- RQ5다양한 피드백 방식(예: 시연, 비교) 중 어떤 것이 개방형 환경에서 가장 강력하고 인간 중심의 에이전트 행동을 이끌어내는가?
주요 결과
- 경연대회는 인간 피드백을 활용해 사전에 정의된 보상 함수 없이도 마인크래프트에서 자연어로 기술된 복잡한 작업을 수행할 수 있는 에이전트를 훈련시킬 수 있음을 성공적으로 입증했다.
- 제공된 인간 시연 데이터를 기반으로 한 모방 학습 기반 모델은 중간 정도의 성능을 달성했으며, 향후 향상의 좋은 기반을 제공했다.
- 인간 평가 결과에 따르면 에이전트가 작업 기술의 미묘한 요소를 이해하지 못하는 경우가 많아, 더 나은 일치 기법이 필요하다는 점이 드러났다.
- 마인크래프트의 개방형 특성 덕분에 LfHF 방법을 평가할 수 있는 강력한 시험무대가 되었으며, 보상 함수가 사용될 경우 의도하지 않은 행동에 대해 에이전트가 자주 보상을 받는 경우가 빈번했다.
- 참가자 간의 상호작용과 지식 공유를 촉진하기 위해 전용 디스코드 포럼을 운영함으로써 협업 중심의 연구 공동체가 조성되었다.
- 주로 인간 평가를 평가 지표로 사용함으로써 환경 설계에 기인한 편향을 줄이고 실제 세계의 작업 성공도를 더 잘 반영할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.