[论文解读] Computer Vision Aided Beam Tracking in A Real-World Millimeter Wave Deployment
该论文提出了一种基于视觉辅助的毫米波波束跟踪框架,采用深度编码器-解码器模型,利用毫米波基站摄像头获取的视觉数据来预测未来最优波束,使波束训练开销减少超过99%,同时在真实世界数据集上实现了64.47%的top-1准确率和97.66%的归一化接收功率。
Millimeter-wave (mmWave) and terahertz (THz) communications require beamforming to acquire adequate receive signal-to-noise ratio (SNR). To find the optimal beam, current beam management solutions perform beam training over a large number of beams in pre-defined codebooks. The beam training overhead increases the access latency and can become infeasible for high-mobility applications. To reduce or even eliminate this beam training overhead, we propose to utilize the visual data, captured for example by cameras at the base stations, to guide the beam tracking/refining process. We propose a machine learning (ML) framework, based on an encoder-decoder architecture, that can predict the future beams using the previously obtained visual sensing information. Our proposed approach is evaluated on a large-scale real-world dataset, where it achieves an accuracy of $64.47\%$ (and a normalized receive power of $97.66\%$) in predicting the future beam. This is achieved while requiring less than $1\%$ of the beam training overhead of a corresponding baseline solution that uses a sequence of previous beams to predict the future one. This high performance and low overhead obtained on the real-world dataset demonstrate the potential of the proposed vision-aided beam tracking approach in real-world applications.
研究动机与目标
- 为减少毫米波/太赫兹系统中的波束训练开销,特别是针对V2X等高速移动应用。
- 通过利用视觉传感数据而非仅依赖先前的波束序列,实现实时波束预测。
- 开发一种机器学习框架,利用视觉输入预测未来波束,提升动态环境中波束跟踪的鲁棒性。
- 在包含共置视觉与毫米波波束数据的大规模真实世界数据集上评估所提出的视觉辅助波束跟踪方法。
- 证明在动态和易阻塞的场景中,视觉数据可优于传统的基于波束序列的预测方法。
提出的方法
- 采用深度编码器-解码器神经网络架构,将视觉输入(RGB图像)映射为预测的波束索引。
- 编码器处理来自摄像头的视觉数据,提取与波束方向相关的空间和环境特征。
- 解码器基于编码后的视觉表征生成波束预测,建模时间动态以实现未来波束跟踪。
- 使用真实世界的毫米波波束训练数据和来自DeepSense 6G数据集的对应视觉快照,对模型进行端到端训练。
- 通过top-k准确率和归一化接收功率评估波束预测性能,并与仅使用先前最优波束序列的基线方法进行对比。
- 波束训练开销量化为预测过程中在码本中扫描的波束数量,视觉辅助方法所需波束显著更少。

实验结果
研究问题
- RQ1来自毫米波基站摄像头的视觉传感数据是否能在真实世界的毫米波部署中有效降低波束训练开销?
- RQ2在准确率和接收功率方面,基于视觉的波束跟踪性能与基于先前最优波束序列的波束跟踪相比如何?
- RQ3与基于波束序列的方法相比,视觉数据在动态或非视 Line-of-Sight(NLoS)环境中在多大程度上提升了波束跟踪的鲁棒性?
- RQ4波束码本的大小在准确率和接收功率方面如何影响基于视觉的波束跟踪性能?
- RQ5所提出的视觉辅助框架能否在长时间内保持高性能而不会出现漂移,而基于波束序列的基线方法则不能?
主要发现
- 该视觉辅助波束跟踪方法在真实世界的毫米波数据集上预测未来波束时,实现了64.47%的top-1准确率和98.95%的top-5准确率。
- top-1预测波束的归一化接收功率达到97.66%,表明即使仅预测一个波束,链路质量依然很强。
- 视觉辅助方法的波束训练开销低于基线方法的1%,后者使用了八个先前最优波束。
- 在预测top-1波束时,视觉辅助方法完全消除了波束训练开销,此时训练成本为零。
- 性能提升在动态环境中尤为显著,因为视觉数据能够捕捉波束序列无法反映的环境变化。
- 当波束码本大小从16增加到64时,归一化接收功率提升了6%(从92.17%提升至97.66%),证明了过采样的优势。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。