Skip to main content
QUICK REVIEW

[论文解读] Decentralized Learning for Channel Allocation in IoT Networks over Unlicensed Bandwidth as a Contextual Multi-player Multi-armed Bandit Game

Wenbo Wang, Amir Leshem|arXiv (Cornell University)|Mar 30, 2020
Advanced Bandit Algorithms Research参考文献 42被引用 18
一句话总结

该论文提出了一种去中心化的三阶段试错学习算法,用于非授权物联网网络中的信道分配,将问题建模为上下文相关的多玩家多臂老虎机博弈。该算法实现了次线性(多对数)遗憾,且在无需显式协调的情况下收敛至社会最优信道分配,仅依赖本地碰撞反馈和上下文感知学习,在动态、易受干扰的环境中实现了效率与可扩展性的平衡。

ABSTRACT

We study a decentralized channel allocation problem in an ad-hoc Internet of Things network underlaying on the spectrum licensed to a primary cellular network. In the considered network, the impoverished channel sensing/probing capability and computational resource on the IoT devices make them difficult to acquire the detailed Channel State Information (CSI) for the shared multiple channels. In practice, the unknown patterns of the primary users' transmission activities and the time-varying CSI (e.g., due to small-scale fading or device mobility) also cause stochastic changes in the channel quality. Decentralized IoT links are thus expected to learn channel conditions online based on partial observations, while acquiring no information about the channels that they are not operating on. They also have to reach an efficient, collision-free solution of channel allocation with limited coordination. Our study maps this problem into a contextual multi-player, multi-armed bandit game, and proposes a purely decentralized, three-stage policy learning algorithm through trial-and-error. Theoretical analyses shows that the proposed scheme guarantees the IoT links to jointly converge to the social optimal channel allocation with a sub-linear (i.e., polylogarithmic) regret with respect to the operational time. Simulations demonstrate that it strikes a good balance between efficiency and network scalability when compared with the other state-of-the-art decentralized bandit algorithms.

研究动机与目标

  • 为解决在感知和计算能力有限的授权蜂窝频段下,去中心化、高效的自组织物联网网络信道分配挑战。
  • 使物联网设备能够仅通过部分观测和本地反馈,在无全局协调或未知空闲信道信息的情况下,实时学习最优信道关联。
  • 在时变、易受干扰的环境中实现社会最优性能——最大化总网络吞吐量,同时最小化碰撞和信道切换。
  • 设计一种可扩展、轻量级的解决方案,适用于无基础设施、能量受限的物联网部署。

提出的方法

  • 将信道分配问题建模为上下文相关的多玩家多臂老虎机(MP-MAB)博弈,其中物联网设备为玩家,信道为臂,奖励取决于信道状态和主用户活动(上下文)。
  • 提出一种基于时隙的三阶段、分阶段策略学习框架:(1) 通过试错进行信道质量探索,(2) 形成中间非合作博弈以实现去中心化策略学习,(3) 以最小协调进行策略利用。
  • 利用接收设备的本地反馈检测跨链路碰撞,使设备能够推断信道质量并调整策略,而无需显式信令。
  • 采用上下文感知奖励模型,其中臂值(信道质量)受主用户存在及其活动状态的动态影响。
  • 应用基于扰动的学习阶段,以在不同上下文中探索策略,提升对时变干扰和衰落的适应能力。
  • 理论分析证明,该算法在时间跨度 T 内对 M 名玩家的遗憾边界为 O(M log^{1+δ}_2 T)(δ > 0),并收敛至社会最优。

实验结果

研究问题

  • RQ1一种完全去中心化、轻量级的算法是否能在无协调或全局信道状态信息的情况下,实现在非授权物联网网络中的社会最优信道分配?
  • RQ2当物联网设备因资源限制无法同时感知或估计所有信道时,如何实现实时学习最优信道关联?
  • RQ3主用户活动和时变信道条件对多信道物联网网络中去中心化学习算法性能有何影响?
  • RQ4与非上下文感知的 MP-MAB 算法相比,上下文感知学习在遗憾、碰撞和可扩展性方面如何提升性能?
  • RQ5随着物联网设备数量的增加,该算法是否能保持高效率和可扩展性,尤其是在缺乏基础设施的情况下?

主要发现

  • 仿真结果表明,该算法在所有对比算法(MC、SOC、GoT)中实现了最高的平均归一化速率总和,证明了其在长时间运行中具有更高的网络效率。
  • 尽管由于频繁的策略探索导致碰撞数量略高,但该算法收敛速度优于 GoT,后者因较长的策略学习阶段而遭受过多碰撞。
  • 与非上下文感知算法(MC、SOC)相比,该算法表现出更低的信道切换频率,表明其在不同上下文下的策略一致性更高,从而提升了稳定性和适应性。
  • 在大规模网络(最多30个节点)中,该算法性能优于 MC 和 SOC,尽管因延长的学习阶段导致碰撞略有增加,但整体表现仍具管理性。
  • 理论分析证实,遗憾随 O(M log^{1+δ}_2 T) 以次线性方式增长,证明了该算法在长期运行中的效率以及向社会最优收敛的能力。
  • 该算法在网络规模增大时表现出良好可扩展性,在大规模网络中显著优于 GoT,后者因学习阶段过长和辅助状态空间过大而导致性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。