[论文解读] Hybrid Indoor Localization via Reinforcement Learning-based Information Fusion
本文提出了一种基于强化学习的信息融合框架 RL-IFF,该框架整合了蓝牙低能耗(BLE)到达角(AoA)、接收信号强度指示符(RSSI)以及基于惯性测量单元(IMU)的行人推算(PDR),实现混合室内定位。通过利用深度强化学习动态优化融合权重,RL-IFF 在多种室内环境和运动模式下均实现了卓越的定位精度与稳定性,其均方误差(MSE)表现优于独立系统及固定权重融合方法。
The paper is motivated by the importance of the Smart Cities (SC) concept for future management of global urbanization. Among all Internet of Things (IoT)-based communication technologies, Bluetooth Low Energy (BLE) plays a vital role in city-wide decision making and services. Extreme fluctuations of the Received Signal Strength Indicator (RSSI), however, prevent this technology from being a reliable solution with acceptable accuracy in the dynamic indoor tracking/localization approaches for ever-changing SC environments. The latest version of the BLE v.5.1 introduced a better possibility for tracking users by utilizing the direction finding approaches based on the Angle of Arrival (AoA), which is more reliable. There are still some fundamental issues remaining to be addressed. Existing works mainly focus on implementing stand-alone models overlooking potentials fusion strategies. The paper addresses this gap and proposes a novel Reinforcement Learning (RL)-based information fusion framework (RL-IFF) by coupling AoA with RSSI-based particle filtering and Inertial Measurement Unit (IMU)-based Pedestrian Dead Reckoning (PDR) frameworks. The proposed RL-IFF solution is evaluated through a comprehensive set of experiments illustrating superior performance compared to its counterparts.
研究动机与目标
- 解决独立室内定位系统因信号波动、噪声和环境敏感性带来的局限性。
- 克服传统固定权重或监督式融合方法的缺陷,后者灵活性差且需要大量标注数据。
- 开发一种实时、自适应的融合框架,能够在动态城市与智慧城市建设环境中,从历史数据中学习最优加权策略。
- 提升复杂、时变室内环境中定位的精度与可靠性,尤其适用于疫情传播追踪等关键应用场景。
- 评估所提出的基于强化学习的融合方法在多种环境与运动场景下的鲁棒性、可复现性与稳定性。
提出的方法
- 该框架集成了三种定位模态:基于 AoA 的 BLE、基于 RSSI 的粒子滤波与卡尔曼滤波结合(KF-PF),以及基于 IMU 的行人推算(PDR)。
- 通过训练深度强化学习智能体,根据实时环境反馈动态分配三类定位路径的最优融合权重。
- 强化学习智能体在马尔可夫决策过程(MDP)框架下运行,其中状态包含当前传感器读数与历史追踪性能,动作为 AoA、RSSI 和 PDR 的权重向量。
- 奖励函数设计用于最小化定位误差(MSE),以激励智能体学习随时间减少估计偏差的策略。
- 训练包含 1,000,000 个训练回合与 1,000 个测试回合,采用基于 DQN 的深度 Q 网络来近似连续状态-动作空间中的 Q 值函数。
- 系统在三个不同的室内环境中进行评估,涵盖四种运动模式:矩形、随机以及两种对角线轨迹,以确保在动态场景中的泛化能力。
实验结果
研究问题
- RQ1基于强化学习的融合框架是否能在室内环境中实现比固定权重与随机权重融合策略更高的定位精度与稳定性?
- RQ2所提出的 RL-IFF 框架在真实室内环境中如何适应不同的信号条件与运动模式?
- RQ3与单独的 AoA、RSSI 和 PDR 系统相比,基于强化学习的融合方法在多大程度上降低了定位误差(MSE)?
- RQ4RL-IFF 框架在多次训练与测试运行中是否表现出良好的可复现性与稳定性,尤其是在噪声大且动态变化的条件下?
- RQ5RL 智能体是否能够在无需标注数据或对环境动态特性先验知识的情况下,学习到最优融合权重?
主要发现
- 在所有三个测试环境中,RL-IFF 框架在所有运动场景下均实现了最低的均方误差(MSE),优于独立的 AoA、RSSI-PF 和 PDR 系统。
- 与随机权重调整和等权重平均相比,RL-IFF 框架的 MSE 显著降低,某些场景下降幅高达 60%。
- 该方法在 50 次重复运行中表现出高度稳定且方差小,如图 4 所示,表明其具有可靠的收敛性。
- RL 智能体成功学习了动态权重自适应机制,在视距条件下为 AoA 分配更高权重,而在信号中断期间则更倾向于依赖 PDR。
- 在具有挑战性的随机与对角线运动模式下,该框架仍保持优异性能,证明其在不可预测的人体运动中的鲁棒性。
- 结果证实,与传统或启发式融合方法相比,基于强化学习的融合在时变、真实世界室内定位任务中更具有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。