[논문 리뷰] Neural optimal feedback control with local learning rules
이 논문은 생물학적으로 타당한 신경망인 Bio-OFC를 제안한다. 이는 국소적 시냅스 가소성 규칙만을 사용하여 적응형 칼만 필터링과 모델 자유 정책 기울기 제어를 통합한다. 이는 소음이 많고 지연된 감각 피드백 하에서도 시스템의 동역학이나 노이즈 공분산에 대한 사전 지식 없이 온라인 상태 추정과 제어를 가능하게 하며, 비행 안정화 및 접근과 같은 작업에서 안정적이고 직접적인 궤적 제어를 달성한다.
A major problem in motor control is understanding how the brain plans and executes proper movements in the face of delayed and noisy stimuli. A prominent framework for addressing such control problems is Optimal Feedback Control (OFC). OFC generates control actions that optimize behaviorally relevant criteria by integrating noisy sensory stimuli and the predictions of an internal model using the Kalman filter or its extensions. However, a satisfactory neural model of Kalman filtering and control is lacking because existing proposals have the following limitations: not considering the delay of sensory feedback, training in alternating phases, and requiring knowledge of the noise covariance matrices, as well as that of systems dynamics. Moreover, the majority of these studies considered Kalman filtering in isolation, and not jointly with control. To address these shortcomings, we introduce a novel online algorithm which combines adaptive Kalman filtering with a model free control approach (i.e., policy gradient algorithm). We implement this algorithm in a biologically plausible neural network with local synaptic plasticity rules. This network performs system identification and Kalman filtering, without the need for multiple phases with distinct update rules or the knowledge of the noise covariances. It can perform state estimation with delayed sensory feedback, with the help of an internal model. It learns the control policy without requiring any knowledge of the dynamics, thus avoiding the need for weight transport. In this way, our implementation of OFC solves the credit assignment problem needed to produce the appropriate sensory-motor control in the presence of stimulus delay.
연구 동기 및 목표
- 지연되고 노이즈가 많은 감각 피드백을 처리하는 생물학적으로 타당한 최적 피드백 제어(OFC)의 신경 구현이 부족한 문제를 해결하기 위해.
- 추정, 시스템 식별, 제어 단계를 별도로 나누는 기존의 방식이 아닌, 상태 추정(적응형 칼만 필터링을 통한)과 제어(정책 기울기 통한)를 통합한 온라인 단일 프레임워크를 개발하기 위해.
- 기존의 OFC에서 일반적으로 요구되는 노이즈 공분산과 시스템 동역학에 대한 전역 지식에 의존하지 않도록 하여 생물학적 타당성을 높이기 위해.
- 백프로파게이션에서 발생하는 가중치 이동 문제를 피하기 위해, 오직 국소적 시냅스 가소성 규칙만을 사용하여 완전히 온라인, 단일 단계 학습 알고리즘을 구현하기 위해.
- 지연된 피드백과 비제곱형 비용 함수를 가진 작업에서 표준 정책 기울기 방법이 과도한 반복과 불안정성으로 실패하는 상황에서도 강건한 성능을 보여주기 위해.
제안 방법
- 신경망은 내부 상태 추정, 예측 오차(예측과 지연된 감각 피드백 간의 불일치), 제어 명령을 나타내는 별도의 뉴런 집단을 사용한다.
- 전역 보상 신호를 사용하여 정책 기울기 학습을 통해 시냅스 업데이트를 유도함으로써, 시스템 동역학에 대한 지식이 없이도 모델 자유 제어를 가능하게 한다.
- 적응형 칼만 필터링은 온라인 시스템 식별을 통해 실현되며, 이로써 네트워크는 실시간으로 시스템의 동역학과 노이즈 특성을 학습할 수 있다.
- 시냅스 가소성 규칙은 엄격히 국소적이다: 각 시냅스는 전후의 활성도와 전역 신경조절 신호에만 기반하여 업데이트되며, 생물학적 타당성 조건을 충족시킨다.
- 모델은 각 시간 단계에서 내부 루프나 수렴 검사를 피함으로써 효율적인 온라인 처리가 가능하며, 계산 복잡도가 다루기 쉬운 수준을 유지한다.
- 모든 구성 요소(상태 추정, 예측 오차 계산, 제어 정책 학습 포함)에 동일한 학습 규칙를 적용함으로써, 다양한 작업으로의 일반화가 가능하다.
실험 결과
연구 질문
- RQ1국소 학습 규칙만을 사용하고 노이즈 공분산 및 시스템 동역학에 대한 사전 지식 없이도 생물학적으로 타당한 신경망이 최적 피드백 제어를 수행할 수 있는가?
- RQ2지연된 감각 피드백은 신경 제어 시스템에 어떻게 효과적으로 통합될 수 있으며, 운동 제어에서의 불안정성과 과도한 반응을 방지할 수 있는가?
- RQ3추정, 시스템 식별, 제어 단계를 별도로 나누는 전통적인 방식을 대체할 수 있는 통합된 단일 단계 학습 알고리즘이 존재하는가?
- RQ4적응형 칼만 필터링과 결합된 모델 자유 정책 기울기 접근 방식은 지연된 피드백이 있는 작업에서 표준 정책 기울기 방법보다 얼마나 뛰어난 성능을 보일 수 있는가?
- RQ5뇌의 예측 코딩 프레임워크는 국소 가소성 규칙을 사용하는 신경망을 통해 어떻게 상태 추정과 제어를 동시에 수행할 수 있는가?
주요 결과
- Bio-OFC는 100ms 지연된 감각 피드백 하에서도 시뮬레이션된 파리의 비행을 안정화시키며, 과도한 반복 없이 직접 궤적 제어를 달성한다. 반면 표준 정책 기울기 에이전트는 과도하게 반복하고 후진한다.
- 이중 적분자 작업과 손 도달 작업 모두에서 모델은 지연되고 노이즈가 많은 자극에 대해 안정적인 성능을 보이며, 강건성을 입증한다.
- 비제곱형 L1 비용 함수가 적용된 작업에서는 Bio-OFC가 표준 정책 기울기 방법을 능가하며, 지연된 피드백과 예측 상태 추정의 부재로 인해 실패하는 표준 방법과는 대조된다.
- 네트워크는 적응형 칼만 필터링을 통해 시스템 동역학과 노이즈 특성을 실시간으로 학습함으로써, 오프라인 校정이나 사전 지식이 필요 없어진다.
- 국소 학습 규칙의 사용은 내부 루프나 수렴 검사를 피함으로써 완전한 온라인 운영을 가능하게 하며, 알고리즘의 계산 효율성과 확장성을 높인다.
- 이 아키텍처는 알려진 뇌 영역과 잘 부합한다: 파리에이터 코르티시스는 상태 추정을, 소뇌는 시스템 식별을, 운동/전운동 피각은 제어 정책 실행을 담당한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.