[논문 리뷰] Improving Multimodal Interactive Agents with Reinforcement Learning from Human Feedback
이 논문은 프로그래밍된 보상 함수에 의존하지 않고 인간 피드백에서 강화 학습(RLHF)을 사용하여 다중모달 상호작용 에이전트를 향상시키는 프레임워크를 제안한다. 시뮬레이션된 3D 상호작용 중 인간이 에이전트의 진행 상황에 대해 평가한 데이터를 수집하고, 이를 새로운 시간적 브래드리-테리(IBT) 보상 모델을 통해 모델링함으로써, BC+RL을 통해 에이전트를 훈련시켜 실시간 상호작용에서 인간 성능의 93%를 달성하였으며, 일부 작업에서는 평균 인간 성공률을 초월하였다.
An important goal in artificial intelligence is to create agents that can both interact naturally with humans and learn from their feedback. Here we demonstrate how to use reinforcement learning from human feedback (RLHF) to improve upon simulated, embodied agents trained to a base level of competency with imitation learning. First, we collected data of humans interacting with agents in a simulated 3D world. We then asked annotators to record moments where they believed that agents either progressed toward or regressed from their human-instructed goal. Using this annotation data we leveraged a novel method - which we call "Inter-temporal Bradley-Terry" (IBT) modelling - to build a reward model that captures human judgments. Agents trained to optimise rewards delivered from IBT reward models improved with respect to all of our metrics, including subsequent human judgment during live interactions with agents. Altogether our results demonstrate how one can successfully leverage human judgments to improve agent behaviour, allowing us to use reinforcement learning in complex, embodied domains without programmatic reward functions. Videos of agent behaviour may be found at https://youtu.be/v_Z9F2_eKk4.
연구 동기 및 목표
- 손으로 정의한 보상 함수 없이 인간 피드백을 사용하여 몸체적이고 다중모달인 에이전트를 훈련시키는 방법을 개발하는 것.
- 개방형 환경에서 복잡하고 모호한 인간 상호작용을 위한 정밀하고 강건한 보상 함수를 정의하는 데 도전하는 것.
- 인간이 참여하는 피드백을 통해 이동형 조작 및 双방향 언어 상호작용 작업에서의 에이전트 성능을 향상시키는 것.
- 디지털 비서, 게임 AI, 언어로 지시 가능한 로봇에 적용 가능한 확장 가능하고 일반화 가능한 프레임워크를 만드는 것.
- 기반 인간 평가에 기반한 RLHF가 애자일러닝 기준을 초월하고 특정 작업에서 평균 인간 성능을 초월할 수 있음을 입증하는 것.
제안 방법
- 3D 시뮬레이션 환경(Playhouse)에서 인간-인간 상호작용 데이터를 수집하여 행동 클로닝(BC)을 통해 初기 에이전트를 사전 훈련시켰다.
- 참가자가 목표 달성에 대한 에이전트 진행 상황을 실시간으로 평가하는 인간-중심 상호작용을 실시하여 진행 또는 후퇴의 이산적 순간을 표시하였다.
- 에이전트 궤적의 시간적 세그먼트에 대한 인간 평가에서 보상 함수를 학습하기 위해 시간적 브래드리-테리(IBT) 모델을 도입하였다.
- 시간에 따라 변화하는 인간 선호도를 포착할 수 있도록 IBT를 사용하여 보상 모델을 훈련시켜 조밀하고 순차적인 피드백을 가능하게 하였다.
- 학습된 보상 모델을 최적화하기 위해 행동 클로닝과 강화 학습의 조합(BC+RL)을 사용하여 에이전트를 미세 조정하였다.
- 참가자가 지시를 내리고 실시간으로 에이전트 성공률을 평가하는 실시간 인간 상호작용을 통해 에이전트를 평가하였다.

실험 결과
연구 질문
- RQ1복잡한 다중모달 상호작용 환경에서 강화 학습을 이끄는 데 효과적으로 인간의 에이전트 진행 상황 평가를 모델링할 수 있는가?
- RQ2인간 평가에서 학습된 보상 모델이 조작 및 언어 상호작용 작업 모두에서 애자일러닝 기준을 초월해 에이전트 성능을 향상시킬 수 있는가?
- RQ3개방형 자연스러운 상호작용에서 인간 피드백을 활용한 RLHF가 평균 인간 플레이어 수준과 비교하거나 이를 초월하는 성능을 달성할 수 있는 정도는 어느 정도인가?
- RQ4장기적, 다중모달 작업에서 시간에 민감한 보상 모델링을 지원하기 위해 인간 피드백을 어떻게 구성할 수 있는가?
- RQ5전체 궤적 비교가 필요 없이 IBT 모델이 시간에 걸쳐 인간 선호도를 효과적으로 포착할 수 있는가?
주요 결과
- BC+RL로 훈련된 에이전트는 실시간 상호작용 환경에서 인간 참가자의 성공률의 93%를 달성하여 BC 전용 에이전트보다 뚜렷이 뛰어난 성능을 보였다.
- 질문-답변 및 물체 조작과 같은 특정 상호작용 유형에서는 BC+RL 에이전트가 평균 인간 성과를 초월하였다.
- 시간적 브래드리-테리(IBT) 모델은 시간 세그먼트에 대한 인간 피드백을 효과적으로 포착하여 전체 궤적 비교 없이도 효과적인 보상 설계를 가능하게 하였다.
- 이 프레임워크는 이동형 조작 및 양방향 언어 상호작용을 포함한 다양한 작업에서 일반화 가능성을 입증하였다.
- 인간 평가 결과, 향상된 에이전트가 실시간 상호작용에서 더 능숙하고 목표 중심적으로 인식되었다.
- 이 방법은 수작업으로 설계된 보상 함수에 대한 의존도를 줄여 주었으며, 복잡하고 모호하며 실제 세계와 유사한 환경에서의 에이전트 훈련을 확장 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.