Skip to main content
QUICK REVIEW

[논문 리뷰] Path Design and Resource Management for NOMA enhanced Indoor Intelligent Robots

Ruikang Zhong, Xiao Liu|arXiv (Cornell University)|2020. 11. 23.
Indoor and Outdoor Localization Technologies인용 수 4
한 줄 요약

이 논문은 라디오 맵을 기반으로 훈련된 심층 전이 결정적 정책 기울기(DT-DPG) 알고리즘을 사용하여 경로 계획과 다운링크 전력 할당을 공동 최적화하는 NOMA 기반 실내 지능형 로봇(IR) 서비스 프레임워크를 제안한다. 라디오 맵은 ITU 준수 실내 채널 모델에서 유도된 것으로, 하드웨어가 필요 없는 효율적인 훈련을 가능하게 하여 훈련 시간을 약 30% 감소시키고, OMA 및 표준 DDPG 방법에 비해 신뢰성과 임무 효율성을 향상시킨다.

ABSTRACT

A communication enabled indoor intelligent robots (IRs) service framework is proposed, where non-orthogonal multiple access (NOMA) technique is adopted to enable highly reliable communications. In cooperation with the ultramodern indoor channel model recently proposed by the International Telecommunication Union (ITU), the Lego modeling method is proposed, which can deterministically describe the indoor layout and channel state in order to construct the radio map. The investigated radio map is invoked as a virtual environment to train the reinforcement learning agent, which can save training time and hardware costs. Build on the proposed communication model, motions of IRs who need to reach designated mission destinations and their corresponding down-link power allocation policy are jointly optimized to maximize the mission efficiency and communication reliability of IRs. In an effort to solve this optimization problem, a novel reinforcement learning approach named deep transfer deterministic policy gradient (DT-DPG) algorithm is proposed. Our simulation results demonstrate that 1) With the aid of NOMA techniques, the communication reliability of IRs is effectively improved; 2) The radio map is qualified to be a virtual training environment, and its statistical channel state information improves training efficiency by about 30%; 3) The proposed DT-DPG algorithm is superior to the conventional deep deterministic policy gradient (DDPG) algorithm in terms of optimization performance, training time, and anti-local optimum ability.

연구 동기 및 목표

  • 동적 경로 계획 중에 신뢰성 있고 저지연 통신을 유지하는 데 도전 과제를 해결하기 위해.
  • 비정규 다중접근(NOMA) 하에서 로봇 경로와 다운링크 전력 할당을 공동 최적화하여 임무 성공률과 통신 품질을 향상시키기 위해.
  • 통계적으로 유도된 라디오 맵을 가상 환경으로 사용하여 강화 학습 에이전트의 로봇 주행 훈련 비용과 시간을 감소시키기 위해.
  • 지역 최적해를 피하고 수렴 속도를 가속화하기 위해 전통적인 DDPG를 개선하기 위해.

제안 방법

  • ITU의 최신 실내 채널 모델 기반으로 실내 레이아웃과 통계적 채널 상태 정보를 결정적으로 표현하는 레고 모델링 방법을 사용하여 라디오 맵을 구축한다.
  • 라디오 맵은 강화 학습을 위한 가상 훈련 환경으로 기능하며, 실제 세계의 랜덤 페이딩을 통계적 채널 데이터로 대체하여 훈련의 안정성을 높인다.
  • 경로 계획과 NOMA 전력 할당을 공동 최적화하기 위해 새로운 심층 전이 결정적 정책 기울기(DT-DPG) 알고리즘을 제안하며, 임무 시간, QoS, 장애 회피를 고려한 보상 함수를 포함한다.
  • 전이 학습을 적용하여 간단한 작업(예: 목적지 도착)에서 사전 훈련한 후 전체 임무에 대해 미세 조정함으로써 수렴성과 강건성을 향상시킨다.
  • 보상 함수는 목적지 도착 기반 보상, QoS 위반에 대한 벌점, 전체 임무 시간 최소화를 위한 항목을 포함한다.
  • DT-DPG 에이전트는 재생 버퍼와 타겟 네트워크를 사용하여 훈련되며, 탐색과 이용의 균형을 이루기 위해 탐색 노이즈를 적용한다.

실험 결과

연구 질문

  • RQ1통계적 채널 상태 정보에서 유도된 라디오 맵이 실내 로봇 주행에서 강화 학습 에이전트 훈련을 위한 효과적인 가상 환경으로 기능할 수 있는가?
  • RQ2제안된 DT-DPG 알고리즘이 전통적인 DDPG에 비해 수렴 속도, 최적화 성능, 국소 최적해 회피 측면에서 어떻게 비교되는가?
  • RQ3실내 로봇 네트워크에서 OMA에 비해 NOMA가 통신 신뢰성과 임무 효율성 향상에 얼마나 기여하는가?
  • RQ4라디오 맵 사용이 RL 기반 로봇 제어의 훈련 효율성과 하드웨어 비용 절감에 어떤 영향을 미치는가?

주요 결과

  • 제안된 라디오 맵는 신경망 수렴 과정에서 랜덤 페이딩 간섭을 제거함으로써 실제 세계 훈련 대비 훈련 시간을 약 30% 감소시킨다.
  • 라디오 맵에서 훈련된 DT-DPG 알고리즘은 NOMA 기반에서 평균 임무 품질 지수(MQI) 929.0을 달성하며, 동일한 조건에서 DDPG는 목적지 도착 성공률가 20% 미만에 그친다.
  • 전이 학습 덕분에 DT-DPG 알고리즘은 국소 최적해를 더 효과적으로 피하며, 목적지 도착 성공률가 95% 이상을 기록하는 반면, DDPG는 20% 미만에 그친다.
  • 라디오 맵에서 훈련된 경우 NOMA는 OMA 대비 평균 MQI를 49.5점 향상시켜(929.0 대비 879.5) 더 뛰어난 사용자 공정성과 신뢰성을 입증한다.
  • 라디오 맵에서 훈련된 에이전트는 실제 세계 테스트에서 MQI = 919.0을 기록하여 실제 세계에서 훈련된 에이전트(MQI = 929.0)와 유사한 성능을 보이며, 가상 환경의 타당성을 확인한다.
  • DT-DPG의 다단계 수렴 과정은 전이 후 탐색 증가로 인해 일시적인 성능 저하를 보이다가 이후 뚜렷한 성능 향상을 보이며, 효과적인 지식 전이와 향상된 정책 학습을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.