Skip to main content
QUICK REVIEW

[논문 리뷰] Communications that Emerge through Reinforcement Learning Using a (Recurrent) Neural Network

Katsunari Shibata|arXiv (Cornell University)|2017. 03. 10.
Reinforcement Learning in Robotics참고 문헌 12인용 수 3
한 줄 요약

이 논문은 순환 신경망(RNN)을 사용한 엔드 투 엔드 강화학습을 통해 협상, 신호 디지털화, 몸체 기반 통신과 같은 다양한 통신 프로토콜이 자연스럽게 유도되는 방식을 보여준다. 에이전트들은 사전에 정의된 기호나 통신 규칙 없이 보상 신호에 기반해 신호를 생성하고 해석하는 법을 학습하며, 충돌 없는 주행, 노이즈가 있는 환경에서의 이진 통신, 원시 카메라 입력에서의 실시간 로봇 제어를 달성한다.

ABSTRACT

Communication is not only an action of choosing a signal, but needs to consider the context and sensor signals. It also needs to decide what information is communicated and how it is represented in or understood from signals. Therefore, communication should be realized comprehensively together with its purpose and other functions. The recent successful results in end-to-end reinforcement learning (RL) show the importance of comprehensive learning and the usefulness of end-to-end RL. Although little is known, we have shown that a variety of communications emerge through RL using a (recurrent) neural network (NN). Here, three of them are introduced. In the 1st one, negotiation to avoid conflicts among 4 randomly-picked agents was learned. Each agent generates a binary signal from the output of its recurrent NN (RNN), and receives 4 signals from the agents three times. After learning, each agent made an appropriate final decision after negotiation for any combination of 4 agents. Differentiation of individuality among the agents also could be seen. The 2nd one focused on discretization of communication signal. A sender agent perceives the receiver's location and generates a continuous signal twice by its RNN. A receiver agent receives them sequentially, and moves according to its RNN's output to reach the sender's location. When noises were added to the signal, it was binarized through learning and 2-bit communication was established. The 3rd one focused on end-to-end comprehensive communication. A sender receives 1,785-pixel real camera image on which a real robot can be seen, and sends two sounds whose frequencies are computed by its NN. A receiver receives them, and two motion commands for the robot are generated by its NN. After learning, though some preliminary learning was necessary for the sender, the robot could reach the goal from any initial location.

연구 동기 및 목표

  • 사전에 정의된 기호나 통신 아키텍처 없이 종합적인 통신이 엔드 투 엔드 강화학습을 통해 유도될 수 있는지 조사하기 위해.
  • 에이전트가 보상 기반 학습을 통해 어떻게 협상, 신호 디지털화, 감각운동 작업에 기반한 통신을 학습할 수 있는지 탐색하기 위해.
  • 실제 세계와 유사한 동적인 환경에서 보상 신호만으로 통신 프로토콜이 자율적으로 학습될 수 있는지 보여주기 위해.
  • 강화학습 하에서 명시적인 기호나 아키텍처 우선 사항 없이도 RNN이 체계적이고 목적 있는 통신의 유도를 지원할 수 있는지 보여주기 위해.
  • 실제 로봇 시스템에서 엔드 투 엔드 강화학습을 사용해 원시 카메라 이미지에서 소리 신호를 생성하고 목표 지향적 주행을 제어하는 첫 번째 사례를 확립하기 위해.

제안 방법

  • 에이전트들은 센서 입력과 내부 상태에 기반해 순환 신경망(RNN)을 사용해 통신 신호를 생성하고 처리한다.
  • 통신은 독립적이고 분산된 강화학습(액터-크리틱 프레임워크)을 통해 학습되며, 보상은 에피소드 종료 시에만 주어진다.
  • 협상 작업에서는 에이전트들이 3라운드에 걸쳐 이진 신호를 주고받으며 경로 선택을 조율하고 충돌을 피한다.
  • 신호 디지털화 작업에서는 학습 중 노이즈가 도입되어 RNN 출력이 자율적으로 안정적인 2비트 이진 신호로 조직되며, 위치 정보를 전송하는 데 사용된다.
  • 몸체 기반 통신에서는 원시 1,785픽셀 카메라 이미지가 송신자 RNN을 통해 두 개의 음향 주파수로 매핑되며, 수신자 RNN이 이를 수신하고 해석해 로봇 동작 명령을 생성한다.
  • 직접 제어 학습의 초도 단계를 통해 송신자 네트워크 가중치를 사전 학습시켜, 실제 로봇 환경에서의 통신 학습 성공률을 높인다.

실험 결과

연구 질문

  • RQ1사전에 정의된 통신 프로토콜 없이 다수의 에이전트가 엔드 투 엔드 강화학습을 통해 협상을 유도할 수 있는가?
  • RQ2노이즈가 있는 조건에서 강화학습을 통해 연속적인 통신 신호가 자율적으로 이산적이고 내성적인 신호로 조직될 수 있는가?
  • RQ3원시 감각 입력(예: 카메라 이미지)에서부터 몸체 기반의 목적 있는 통신이 유도되어 실제 로봇 제어에 사용될 수 있는가?
  • RQ4RNN이 명시적인 기호나 아키텍처 우선 사항 없이 체계적이고 功能적인 통신의 유도를 어느 정도 지원할 수 있는가?
  • RQ5감독 없이 사전에 정의된 신호 의미 없이 보상 설계만으로도 통신 프로토콜을 학습할 수 있는가?

주요 결과

  • 협상 작업에서는 에이전트들이 3라운드의 이진 신호 교환을 통해 충돌을 피하고 충돌하지 않는 경로를 선택하는 데 성공했으며, 임의의 에이전트 조합에서도 동일하게 기능했다.
  • 학습 중 노이즈가 도입되자 RNN은 자율적으로 이진 신호를 생성했으며, 수신자 위치를 전송하는 데 안정적인 2비트 통신 프로토콜이 형성되었다.
  • 학습 후 수신자는 어떤 초기 위치에서든 한 번의 단계로 목표에 도달할 수 있었으며, 이는 통신 프로토콜이 강건하고 기능적임을 입증했다.
  • 몸체 기반 통신 작업에서는 송신자가 원시 카메라 이미지에서 소리 신호를 생성했고, 수신자가 실시간 음성 입력을 해석해 로봇을 목표 지점으로 유도했다.
  • 엔드 투 엔드 강화학습만으로도 성공적인 로봇 주행을 달성했으며, 송신자 RNN은 사전 기호 매핑 없이 공간 정보를 음향 주파수로 인코딩하는 법을 학습했다.
  • 직접 제어 학습에서의 사전 학습된 가중치 사용이 실제 로봇 환경에서의 통신 학습 수렴과 성공률을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.