Skip to main content
QUICK REVIEW

[论文解读] Path Design and Resource Management for NOMA enhanced Indoor Intelligent Robots

Ruikang Zhong, Xiao Liu|arXiv (Cornell University)|Nov 23, 2020
Indoor and Outdoor Localization Technologies被引用 4
一句话总结

本文提出了一种NOMA增强的室内智能机器人(IR)服务框架,通过在无线电地图上训练的深度迁移确定性策略梯度(DT-DPG)算法,联合优化路径规划与下行链路功率分配。该无线电地图基于符合ITU标准的室内信道模型构建,可实现高效、无硬件依赖的训练,将训练时间减少约30%,并相较于OMA和标准DDPG方法提升了可靠性与任务效率。

ABSTRACT

A communication enabled indoor intelligent robots (IRs) service framework is proposed, where non-orthogonal multiple access (NOMA) technique is adopted to enable highly reliable communications. In cooperation with the ultramodern indoor channel model recently proposed by the International Telecommunication Union (ITU), the Lego modeling method is proposed, which can deterministically describe the indoor layout and channel state in order to construct the radio map. The investigated radio map is invoked as a virtual environment to train the reinforcement learning agent, which can save training time and hardware costs. Build on the proposed communication model, motions of IRs who need to reach designated mission destinations and their corresponding down-link power allocation policy are jointly optimized to maximize the mission efficiency and communication reliability of IRs. In an effort to solve this optimization problem, a novel reinforcement learning approach named deep transfer deterministic policy gradient (DT-DPG) algorithm is proposed. Our simulation results demonstrate that 1) With the aid of NOMA techniques, the communication reliability of IRs is effectively improved; 2) The radio map is qualified to be a virtual training environment, and its statistical channel state information improves training efficiency by about 30%; 3) The proposed DT-DPG algorithm is superior to the conventional deep deterministic policy gradient (DDPG) algorithm in terms of optimization performance, training time, and anti-local optimum ability.

研究动机与目标

  • 为解决在动态路径规划过程中保持室内机器人可靠、低时延通信的挑战。
  • 在非正交多址接入(NOMA)下,联合优化机器人轨迹与下行链路功率分配,以提升任务成功率与通信质量。
  • 通过使用基于统计特性的无线电地图作为虚拟环境,降低强化学习智能体在机器人导航中的训练成本与时间。
  • 通过引入迁移学习改进传统DDPG,避免局部最优解并加速收敛。

提出的方法

  • 采用乐高建模方法构建无线电地图,基于ITU最新室内信道模型,确定性地表示室内布局与统计信道状态信息。
  • 无线电地图作为强化学习的虚拟训练环境,以统计信道数据替代真实世界中的随机衰落,从而稳定训练过程。
  • 提出一种新型深度迁移确定性策略梯度(DT-DPG)算法,联合优化路径规划与NOMA功率分配,其奖励函数综合考虑任务时间、服务质量(QoS)与中断避免。
  • 通过在简化任务(如目标抵达)上预训练,再在完整任务上微调,应用迁移学习,提升收敛速度与鲁棒性。
  • 奖励函数包括抵达目的地的基础奖励、QoS违规的惩罚项,以及最小化总任务时间的项。
  • DT-DPG智能体使用经验回放缓冲区与目标网络进行训练,通过探索噪声平衡利用与探索。

实验结果

研究问题

  • RQ1能否基于统计信道状态信息构建的无线电地图,作为训练强化学习智能体在室内机器人导航中的有效虚拟环境?
  • RQ2所提出的DT-DPG算法在收敛速度、优化性能及避免局部最优方面,相较于传统DDPG表现如何?
  • RQ3与OMA相比,NOMA在室内机器人网络中在多大程度上提升了通信可靠性与任务效率?
  • RQ4使用无线电地图对强化学习机器人控制的训练效率与硬件成本降低有何影响?

主要发现

  • 所提出的无线电地图通过消除神经网络收敛过程中的随机衰落干扰,使训练时间相比真实世界训练减少了约30%。
  • 在无线电地图上训练的DT-DPG算法在NOMA方案下实现了929.0的平均任务质量指数(MQI),显著优于DDPG算法,后者在相同约束下抵达目的地的成功率不足20%。
  • 由于迁移学习的引入,DT-DPG算法比标准DDPG更有效地避免局部最优解,在抵达目的地方面实现了超过95%的成功率,而DDPG则低于20%。
  • 在无线电地图上训练时,NOMA相比OMA平均提升了49.5点MQI(929.0 vs. 879.5),证明其在用户公平性与可靠性方面具有显著优势。
  • 无线电地图训练的智能体在真实世界测试中表现与真实世界训练智能体相当(MQI = 919.0 vs. 929.0),验证了虚拟环境的有效性。
  • DT-DPG的多阶段收敛过程显示:在知识迁移后因探索增加出现性能下降,随后实现显著性能提升,表明知识迁移有效且促进了策略学习的优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。