[论文解读] Privacy-Preserving Visual Localization with Event Cameras
本文提出了一种基于事件相机的隐私保护视觉定位系统,可在低光照和高速运动等挑战性条件下实现鲁棒的相机位姿估计。通过将事件转换为图像,并应用轻量级的传感器级与网络级隐私过滤,该方法在有效隐藏人脸细节和完整场景视图的同时,保持了定位精度,适用于实际的AR/VR及基于位置的服务。
We consider the problem of client-server localization, where edge device users communicate visual data with the service provider for locating oneself against a pre-built 3D map. This localization paradigm is a crucial component for location-based services in AR/VR or mobile applications, as it is not trivial to store large-scale 3D maps and process fast localization on resource-limited edge devices. Nevertheless, conventional client-server localization systems possess numerous challenges in computational efficiency, robustness, and privacy-preservation during data transmission. Our work aims to jointly solve these challenges with a localization pipeline based on event cameras. By using event cameras, our system consumes low energy and maintains small memory bandwidth. Then during localization, we propose applying event-to-image conversion and leverage mature image-based localization, which achieves robustness even in low-light or fast-moving scenes. To further enhance privacy protection, we introduce privacy protection techniques at two levels. Network level protection aims to hide the entire user's view in private scenes using a novel split inference approach, while sensor level protection aims to hide sensitive user details such as faces with light-weight filtering. Both methods involve small client-side computation and localization performance loss, while significantly mitigating the feeling of insecurity as revealed in our user study. We thus project our method to serve as a building block for practical location-based services using event cameras. Project page including the code is available through this link: https://82magnolia.github.io/event\_localization/.
研究动机与目标
- 解决客户端-服务器视觉定位中的隐私问题,即用户需向服务提供商共享视觉数据。
- 利用事件相机的高动态范围和高时间分辨率,在低光照和高速运动场景中实现鲁棒的视觉定位。
- 在传感器与网络两级开发轻量级隐私保护机制,以保护敏感视觉信息,同时不牺牲定位性能。
- 提供一种适用于AR/VR及私密环境实际部署的事件相机视觉定位实用化流程。
提出的方法
- 在服务提供商端执行事件到图像的转换,以利用强大的基于图像的定位方法,从而在事件与图像数据之间存在领域差异的情况下,仍能实现鲁棒的位姿估计。
- 通过一种轻量级过滤技术实现传感器级隐私保护,模糊人脸关键点而无需显式检测,同时保留对定位至关重要的特征。
- 提出一种网络级隐私机制,通过拆分神经网络推理过程,将中间特征保留在服务提供商端,防止从事件数据中重建图像。
- 采用双阶段推理流程,用户执行初始处理,服务提供商负责计算密集型步骤,通过混淆中间表示确保隐私。
- 利用事件相机数据(仅捕捉亮度变化)的固有特性,降低视觉保真度,从而限制敏感细节的暴露。
- 在新数据集(EvRooms 和 EvHumans)上进行训练与评估,以在包含移动人物、低光照和高速运动等多种条件下评估性能。
实验结果
研究问题
- RQ1在传统基于图像的方法失效的低光照和高速相机运动场景下,事件相机能否实现鲁棒的视觉定位?
- RQ2传感器级过滤在不降低定位精度的前提下,能在多大程度上隐藏人脸细节?
- RQ3网络级隐私机制能否在保持定位性能的同时,防止从事件数据中重建图像?
- RQ4用户在事件相机视觉定位系统中对人脸与场景级细节的隐私保护程度有何感知?
- RQ5在真实世界的事件相机场景中,隐私保护与定位精度之间存在怎样的性能权衡?
主要发现
- 所提出的事件相机定位流程在低光照和高速运动场景中表现出鲁棒性能,在这些条件下优于传统基于图像的方法。
- 传感器级隐私过滤在仅造成轻微性能下降的情况下,有效隐藏了人脸细节,该结论得到用户研究与定性结果的验证。
- 网络级隐私保护机制成功防止了从事件数据中重建图像,即使在针对性微调攻击下也表现出强抗隐私泄露能力。
- 用户研究表明,用户对隐私保护具有高度信心:大多数参与者表示在私密环境中,人脸细节被隐藏、完整场景视图被遮蔽时感到安全。
- 该方法仅造成不到5%的定位精度下降,同时实现了显著的隐私增益,因此适用于真实世界部署。
- 作者收集并部分发布了两个新数据集 EvRooms 和 EvHumans,以支持未来在挑战性条件下基于事件的视觉定位研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。