[논문 리뷰] A Data-Driven Reinforcement Learning Solution Framework for Optimal and Adaptive Personalization of a Hip Exoskeleton
이 논문은 인간-로봇 역학을 모델링하지 않고도 힙 고갈기계에 대한 토크 보조를 자동으로 개인화하는 데이터 기반 강화학습 프레임워크를 제안한다. 피크 및 오프셋 두 가지 시간 매개변수를 최적화하여, 최소 제곱 정책 반복법과 이전 일률 비율 기반 비용 함수를 사용하여, 건강한 피험자에서 단일 힙 확장 걷기 동안 힙 확장근 활성도를 28% 감소시켰다. 이는 실시간에서의 적응적이고 최적의 개인화를 입증한다.
Robotic exoskeletons are exciting technologies for augmenting human mobility. However, designing such a device for seamless integration with the human user and to assist human movement still is a major challenge. This paper aims at developing a novel data-driven solution framework based on reinforcement learning (RL), without first modeling the human-robot dynamics, to provide optimal and adaptive personalized torque assistance for reducing human efforts during walking. Our automatic personalization solution framework includes the assistive torque profile with two control timing parameters (peak and offset timings), the least square policy iteration (LSPI) for learning the parameter tuning policy, and a cost function based on transferred work ratio. The proposed controller was successfully validated on a healthy human subject to assist unilateral hip extension in walking. The results showed that the optimal and adaptive RL controller as a new approach was feasible for tuning assistive torque profile of the hip exoskeleton that coordinated with human actions and reduced activation level of hip extensor muscle in human.
연구 동기 및 목표
- 고갈기계에서 인간-로봇 통합의 원활함을 해결하기 위해 자동으로 개인화된 토크 보조를 가능하게 하기 위해.
- 제어 설계에서 인간-로봇 역학을 명시적으로 모델링할 필요를 제거하기 위해.
- 걷기 중 최소한의 인간 노력으로 보조 토크 프로파일을 최적화하기 위해 강화학습을 사용하기 위해.
- 개별 사용자 역학과 보행 패턴에 적응하여 실시간으로 조정 가능한 프레임워크를 개발하기 위해.
- 단일 힙 확장 보조를 위한 건강한 인간 피험자에서 시스템을 검증하기 위해.
제안 방법
- 프로파일링된 보조 토크에 두 가지 시간 매개변수(피크 시간, 오프셋 시간)를 사용하는 프레임워크.
- 이 매개변수를 조정하기 위한 최적 정책을 학습하기 위해 최소 제곱 정책 반복법(LSPI)을 사용.
- 평가 및 학습 유도를 위해 이전 일률 비율 기반 비용 함수를 사용.
- 사전 역학 모델이 필요 없이 인간-로봇 상호작용 데이터에서 직접 학습하는 RL 에이전트.
- 실시간 피드백을 통해 인간 피험자와의 닫힌 루프 시스템에서 제어기 학습 및 검증.
- 사용자 특화 보행 주기와 일치시키기 위해 지속적으로 토크 시간을 조정함으로써 적응형 개인화를 가능하게 함.
실험 결과
연구 질문
- RQ1인간-로봇 역학을 모델링하지 않고도 데이터 기반 강화학습 접근이 힙 고갈기계의 토크 보조를 효과적으로 개인화할 수 있는가?
- RQ2RL 프레임워크는 개인 사용자의 보행 패턴에 얼마나 잘 적응하여 근육 활성도를 최소화할 수 있는가?
- RQ3걷기 중 힙 확장근의 노력 감소를 위한 최적의 피크 및 오프셋 시간 설정은 무엇인가?
- RQ4반복되는 걷기 시험 동안 일관된 성능 향상이 달성될 수 있는가?
- RQ5이전 일률 비율 기반 비용 함수는 RL 정책의 수렴성과 효과성에 어떤 영향을 미치는가?
주요 결과
- RL 기반 제어기가 비보조 걷기와 비교해 힙 확장근의 활성도를 28% 감소시켰다.
- 실시간 피크 및 오프셋 시간 매개변수 조정을 통해 최적이고 적응형 개인화를 달성했다.
- 데이터 기반 접근법은 인간-로봇 역학의 명시적 모델링이 필요 없음을 보여주어 제어기 설계를 단순화했다.
- 최소 제곱 정책 반복(LSPI) 알고리즘이 상호작용 데이터로부터 안정적이고 효율적인 정책 학습을 가능하게 했다.
- 건강한 피험자와의 실제 인간-로봇 상호작용 환경에서 프레임워크의 실현 가능성과 효과성을 입증했다.
- 이전 일률 비율 기반 비용 함수가 인간의 노력 최소화를 향해 RL 에이전트를 효과적으로 유도했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.