Skip to main content
QUICK REVIEW

[论文解读] The LuViRA Dataset: Synchronized Vision, Radio, and Audio Sensors for Indoor Localization

Ilayda Yaman, Guoda Tian|arXiv (Cornell University)|Feb 10, 2023
Indoor and Outdoor Localization Technologies被引用 4
一句话总结

LuViRA数据集提供了室内环境中视觉、无线电和音频传感器的同步、高精度测量,支持厘米级室内定位的多模态传感器融合研究。该数据集包含88条轨迹,具有0.5毫米6DoF真实值,12个麦克风的音频数据,RGB/深度图像,IMU数据,以及大规模MIMO信道响应,所有数据均时间同步,适用于鲁棒算法的评估与开发。

ABSTRACT

We present a synchronized multisensory dataset for accurate and robust indoor localization: the Lund University Vision, Radio, and Audio (LuViRA) Dataset. The dataset includes color images, corresponding depth maps, inertial measurement unit (IMU) readings, channel response between a 5G massive multiple-input and multiple-output (MIMO) testbed and user equipment, audio recorded by 12 microphones, and accurate six degrees of freedom (6DOF) pose ground truth of 0.5 mm. We synchronize these sensors to ensure that all data is recorded simultaneously. A camera, speaker, and transmit antenna are placed on top of a slowly moving service robot, and 89 trajectories are recorded. Each trajectory includes 20 to 50 seconds of recorded sensor data and ground truth labels. Data from different sensors can be used separately or jointly to perform localization tasks, and data from the motion capture (mocap) system is used to verify the results obtained by the localization algorithms. The main aim of this dataset is to enable research on sensor fusion with the most commonly used sensors for localization tasks. Moreover, the full dataset or some parts of it can also be used for other research areas such as channel estimation, image classification, etc. Our dataset is available at: https://github.com/ilaydayaman/LuViRA_Dataset

研究动机与目标

  • 解决缺乏公开、同步的多模态传感器数据集(涵盖视觉、无线电和音频传感器)用于室内定位研究的问题。
  • 支持多模态定位算法的开发与评估,以提升定位精度、可靠性与能效。
  • 提供一个基准,用于融合摄像头、射频模块和麦克风的数据,以克服单一传感器的局限性。
  • 支持定位研究之外的应用,如信道估计、声源定位和图像分类。
  • 促进在智能工厂和自主服务机器人等动态室内环境中实现实时、厘米级定位。

提出的方法

  • 在动作捕捉工作室中部署配备摄像头、扬声器和发射天线的移动工业机器人(MIR200),记录88条同步轨迹。
  • 采集RGB图像、深度图、IMU读数、12个麦克风的音频数据,以及大规模MIMO信道状态信息(CSI),并结合动作捕捉系统提供的0.5毫米6DoF真实值。
  • 使用时间同步单元,将视觉、音频、无线电和惯性系统的全部传感器数据对齐,时间精度达到亚毫秒级。
  • 每条轨迹前后各记录1秒的数据,确保运动过程的完整时间覆盖。
  • 提供背景噪声记录,以支持基于音频的定位算法中的噪声抑制。
  • 对所有传感器系统进行校准,并在数据解释中考虑温度和电缆干扰等环境因素的影响。

实验结果

研究问题

  • RQ1融合视觉、无线电和音频传感器数据在动态室内环境中如何提升定位精度与鲁棒性?
  • RQ2在实时应用中,同步的多模态数据在多大程度上可降低定位延迟与功耗?
  • RQ3温度变化和移动障碍物等环境因素如何影响基于视觉、音频和无线电的定位系统性能?
  • RQ4电缆干扰和视距阻塞在实际部署中对无线电和视觉定位系统的影响如何?
  • RQ5LuViRA数据集能否作为训练和评估6G及低功耗定位系统中AI/ML模型的可靠基准?

主要发现

  • LuViRA数据集提供88条同步的室内轨迹,具有0.5毫米6DoF真实值,支持厘米级定位精度。
  • 视觉定位在光照良好、环境静态时极为准确,但在黑暗中会失效;而音频和无线电系统在低光照条件下仍能正常工作。
  • 在高噪声环境中,尤其是人员走动时,基于音频的定位性能显著下降,导致真实值出现帧丢失。
  • 基于无线电的定位受人员和电缆造成的遮挡影响,尤其在有人移动的动态轨迹中更为明显。
  • 数据集包含背景噪声记录,可用于支持基于音频的定位算法中的噪声抑制,提升在嘈杂环境中的鲁棒性。
  • 动作捕捉工作室内温度升高(最高达28 °C)可能影响无线电和音频信号传播,尤其对具有固定观测与传输方向的“网格”轨迹产生影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。