Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Sample-efficient Deep Reinforcement Learning with Episodic Policy Transfer for PID-Based Control in Cardiac Catheterization Robots

Olatunji Mumini Omisore, Toluwanimi Oluwadara Akinyemi|arXiv (Cornell University)|2021. 10. 28.
Mechanical Circulatory Support Devices참고 문헌 20인용 수 8
한 줄 요약

이 논문은 로봇 심장 카테터화술을 위한 적응형 PID 튜닝을 위해 에피소드 기반 정책 전이를 통한 샘플 효율적인 딥 강화학습 프레임워크를 제안한다. 에피소드 간 연속적인 정책 전이를 가능하게 함으로써, 에이전트는 평균 오차가 단지 0.003 mm에 불과한 정밀한 축 방향 운동 제어를 달성하였으며, 시뮬레이션 및 실제 실험에서 전통적 방법에 비해 안정성과 성능이 크게 향상됨을 보였다.

ABSTRACT

Robotic catheterization is typically used for percutaneous coronary intervention procedures nowadays and it involves steering flexible endovascular tools to open up occlusion in the coronaries. In this study, a sample-efficient deep reinforcement learning with episodic policy transfer is, for the first time, used for motion control during robotic catheterization with fully adaptive PID tuning strategy. The reinforcement model aids the agent to continuously learn from its interactions in its environment and adaptively tune PID control gains for axial navigation of endovascular tool. The model was validated for axial motion control of a robotic system designed for intravascular catheterization. Simulation and experimental trials were done to validate the application of the model, and results obtained shows it could self-tune PID gains appropriately for motion control of a robotic catheter system. Performance comparison with conventional methods in average of 10 trials shows the agent tunes the gain better with error of 0.003 mm. Thus, the proposed model would offer more stable set-point motion control robotic catheterization.

연구 동기 및 목표

  • 로봇 카테터 제어를 위한 딥 강화학습에서의 샘플 비효율성 문제를 해결하기 위해.
  • 탄성 혈관 내 도구의 축 방향 주행 중 실시간으로 적응형 PID 이득 튜닝을 가능하게 하기 위해.
  • 로봇 심장 카테터화술 시스템에서의 운동 제어 안정성과 정확도를 향상시키기 위해.
  • 시뮬레이션 및 전용 로봇 플랫폼에서의 실험적 시험을 통해 제안된 방법을 검증하기 위해.
  • 기존의 PID 튜닝 방법에 비해 뛰어난 성능을 보여주기 위해.

제안 방법

  • 프레임워크는 딥 강화학습(DRL)을 활용하여 환경과의 상호작용을 통해 최적의 PID 이득을 학습하도록 에이전트를 설계한다.
  • 이전 에피소드에서의 지식을 전이함으로써 샘플 효율성을 향상시키고 수렴 속도를 가속화하기 위해 에피소드 기반 정책 전이를 구현한다.
  • 에이전트는 카테터의 축 방향 위치에서 실시간 피드백을 기반으로 PID 제어 파라미터(Kp, Ki, Kd)를 지속적으로 적응시킨다.
  • 위치 오차와 제어 노력에 대한 페널티를 부여하는 보상 함수를 설계하여, 안정적이고 정밀한 운동을 유도한다.
  • 시뮬레이션 및 물리적 환경에서의 축 방향 주행을 위해 로봇 카테터화술 시스템에 이 방법을 통합한다.
  • 학습 과정은 전형적인 DQN 기반 접근 방식에서와 같이 경험 재생과 타겟 네트워크를 활용하여 학습 안정성을 확보한다.

실험 결과

연구 질문

  • RQ1에피소드 기반 정책 전이가 로봇 카테터 제어를 위한 DRL에서 샘플 효율성을 크게 향상시킬 수 있는가?
  • RQ2에이전트는 실시간으로 PID 이득을 얼마나 잘 적응시켜 정밀한 축 방향 운동 제어를 유지할 수 있는가?
  • RQ3통제 정확도 측면에서 제안된 방법이 기존의 PID 튜닝 방법에 비해 어떤 성능 향상을 보이는가?
  • RQ4모델은 시뮬레이션과 실제 실험 시험 간에 얼마나 잘 일반화되는가?
  • RQ5동적인 혈관 환경에서 안정적인 설정값 제어를 달성하고 최소한의 추적 오차를 유지할 수 있는가?

주요 결과

  • 10회의 시험에서 제안된 방법은 평균 추적 오차가 단지 0.003 mm에 불과하여 축 방향 운동 제어의 높은 정밀도를 입증하였다.
  • 에이전트는 기존의 PID 튜닝 방법에 비해 뛰어난 성능을 보였으며, 위치 오차가 크게 감소하고 안정성이 향상됨을 확인하였다.
  • 에피소드 기반 정책 전이 덕분에 더 빠른 수렴과 더 나은 샘플 효율성이 달성되어 효과적인 학습을 위한 에피소드 수가 감소하였다.
  • 이 방법은 시뮬레이션 및 실제 실험 시험 모두에서 성공적으로 검증되었으며, 강건성과 실용적 적용 가능성의 신뢰성을 입증하였다.
  • 적응형 PID 튜닝 전략은 지속적인 온라인 이득 조정을 가능하게 하여 환경의 동적 변화에 대한 반응성을 향상시켰다.
  • 프레임워크는 안정적인 설정값 제어를 보여주었으며, 이는 안전하고 효과적인 경피적 관상동맥 우회 수술 절차에 필수적인 요소이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.