[논문 리뷰] Functions that Emerge through End-to-End Reinforcement Learning - The Direction for Artificial General Intelligence -
이 논문은 순환 신경망(RNN)을 사용한 엔드 투 엔드 강화학습(Reinforcement Learning, RL)이 원시 센서 입력과 동작 출력에서 직접 복잡하고 다양한 인지 기능—이미지 인식, 기억, 주의, 예측, 목표 지향 행동—의 출현을 가능하게 한다고 보여준다. 이 기능들은 사전 정의된 기능 경계나 기호적 구조 없이도 발생한다. 핵심 기여는 RL을 통해 원시 인지에서 동작에 이르는 학습이 이루어질 경우 종합적이고 유연한 지능처럼 보이는 행동이 자연스럽게 유도된다는 점으로, 이는 인공 일반 지능(AGI)을 햖스는 핵심 길로 제시한다.
Recently, triggered by the impressive results in TV-games or game of Go by Google DeepMind, end-to-end reinforcement learning (RL) is collecting attentions. Although little is known, the author's group has propounded this framework for around 20 years and already has shown various functions that emerge in a neural network (NN) through RL. In this paper, they are introduced again at this timing. "Function Modularization" approach is deeply penetrated subconsciously. The inputs and outputs for a learning system can be raw sensor signals and motor commands. "State space" or "action space" generally used in RL show the existence of functional modules. That has limited reinforcement learning to learning only for the action-planning module. In order to extend reinforcement learning to learning of the entire function on a huge degree of freedom of a massively parallel learning system and to explain or develop human-like intelligence, the author has believed that end-to-end RL from sensors to motors using a recurrent NN (RNN) becomes an essential key. Especially in the higher functions, this approach is very effective by being free from the need to decide their inputs and outputs. The functions that emerge, we have confirmed, through RL using a NN cover a broad range from real robot learning with raw camera pixel inputs to acquisition of dynamic functions in a RNN. Those are (1)image recognition, (2)color constancy (optical illusion), (3)sensor motion (active recognition), (4)hand-eye coordination and hand reaching movement, (5)explanation of brain activities, (6)communication, (7)knowledge transfer, (8)memory, (9)selective attention, (10)prediction, (11)exploration. The end-to-end RL enables the emergence of very flexible comprehensive functions that consider many things in parallel although it is difficult to give the boundary of each function clearly.
연구 동기 및 목표
- 원시 센서 입력에서 동작 출력에 이르는 엔드 투 엔드 강화학습(RL)이 사전 정의된 기능 모듈 없이 인간과 유사한 복잡한 인지 기능의 출현을 가능하게 할 수 있음을 보여주는 것.
- AI에서 흔히 사용되는 기능 모듈화가 인위적인 제약과 프레임 문제를 야기하며, 진정으로 민감하고 종합적인 지능의 출현을 제한한다는 점을 주장하는 것.
- 백프로파게이션을 시간에 따라 적용(BPTT)한 강화학습(RL) 신호를 통해 훈련된 순환 신경망(RNN)이 메모리, 주의, 예측과 같은 동적 기능을 자율적으로 개발할 수 있음을 보여주는 것.
- 특히 입력/출력 경계가 모호한 고차원 기능에 대해 엔드 투 엔드 RL이 인공 일반 지능(AGI)을 달성하기 위한 필수 프레임워크임을 위치 지우는 것.
- 간단한 작업에서도 다양한 기능이 강화학습을 통해 자연스럽게 유도됨을 경험적으로 입증하는 것—예를 들어 물체 추적, 선택적 주의, 적응적 탐색과 같은 행동을 관찰함으로써.
제안 방법
- 정책과 가치 함수로 순환 신경망(RNN)을 사용한 엔드 투 엔드 강화학습을 수행하며, 희박한 보상 신호를 통해 시간에 따른 역전파(BPTT)로 훈련한다.
- 원시 카메라 픽셀 입력과 원시 동작 명령 출력을 입력 및 출력 공간으로 사용하여 사전 처리나 수작업으로 설계된 특징을 배제한다.
- 시험·오류 학습을 통해 누적 보상을 최대화하도록 RNN을 훈련시켜, 시간에 따른 역전파를 통해 메모리 및 예측과 같은 동적 기능이 유도되도록 한다.
- 액터-크리틱 아키텍처(Actor-Q)를 구현하여 내부 RNN 상태에 기반해 행동(예: '이동' 또는 '포획')을 선택함으로써 연속적 제어 및 의사결정을 가능하게 한다.
- 부분 관측 가능성(예: 움직이는 물체가 자주 보이지 않는 경우)을 갖춘 작업을 설계하여, 명시적인 계획이나 궤적 생성 없이도 예측 및 적응 능력을 시험한다.
- 학습 안정성과 장기적 책임 할당을 지원하기 위해 전이 행렬이 항등행렬에 가까워지도록 피드백 가중치 초기화를 수행한다.
실험 결과
연구 질문
- RQ1사전 정의된 기능 모듈이나 기호적 표현 없이도 엔드 투 엔드 RL을 통해 고차원의 복잡한 인지 기능이 출현할 수 있는가?
- RQ2순환 신경망(RNN)이 희박한 보상 신호만을 사용하여 부분 관측 가능한 환경에서 예측, 기억, 주의, 행동을 수행하는 데 얼마나 효과적으로 학습할 수 있는가?
- RQ3원시 센서에서 액추에이터에 이르는 엔드 투 엔드 RL은 기존의 모듈화된 접근 방식에 비해 복잡한 행동 학습에서 얼마나 더 민감하고 적응력 있는가?
- RQ4선택적 주의, 기억, 예측과 같은 기능들이 이러한 기능을 위한 특별한 아키텍처 설계 없이도 RNN의 내부 동적 특성에서 자연스럽게 유도될 수 있는가?
- RQ5명시적인 세계 모델이 없는 상황에서 RNN의 시간 처리 능력이 계획 및 탐색과 같은 고차원 기능의 출현에 어떤 역할을 하는가?
주요 결과
- 에이전트는 자주 보이지 않는 움직이는 물체의 운동을 예측하며, 시야 중앙 근처에서 기다려 갑작스러운 방향 전환에 대응하는 방식을 학습했다.
- 보이지 않는 물체를 포획하는 작업에서, 에이전트는 스스로 범위의 앞쪽으로 이동하여 기다리다가 재등장 시 추적 및 포획하는 전략을 개발했다. 이는 운동 방향이 갑작스럽게 변화하더라도 유지되었다.
- 시스템은 목적 있는 연관 기억을 보였는데, 이는 명시적인 기억 모듈 없이도 과거 상태를 활용해 미래 행동을 안내했다.
- 선택적 주의가 자연스럽게 유도됨: 전용 주의 메커니즘이 없이도 에이전트는 맥락에 따라 관련 이미지 영역에 집중하는 방식을 학습했다.
- 모호하거나 목표가 보이지 않는 상황에서도 과거 경험에 기반해 행동을 조정함으로써 효과적이고 결정적인 탐색을 보였다.
- 영장류 뇌에서 관찰된 보상 기대 신경세포의 출현을 시뮬레이션을 통해 설명하였으며, RL로 훈련된 RNN이 신경생물학적 현상을 재현할 수 있음을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.