[论文解读] E3D: Event-Based 3D Shape Reconstruction
E3D 提出了一种新颖的方法,仅使用单目事件相机实现从事件相机数据到密集3D网格重建,通过事件到轮廓(E2S)网络联合姿态回归与可微分3D渲染,实现多视角一致性。该方法在高速运动条件下于ShapeNet物体重建任务中达到最先进性能,中位平移误差和旋转误差分别为0.40m和40.6°,证明了对运动模糊的鲁棒性。
3D shape reconstruction is a primary component of augmented/virtual reality. Despite being highly advanced, existing solutions based on RGB, RGB-D and Lidar sensors are power and data intensive, which introduces challenges for deployment in edge devices. We approach 3D reconstruction with an event camera, a sensor with significantly lower power, latency and data expense while enabling high dynamic range. While previous event-based 3D reconstruction methods are primarily based on stereo vision, we cast the problem as multi-view shape from silhouette using a monocular event camera. The output from a moving event camera is a sparse point set of space-time gradients, largely sketching scene/object edges and contours. We first introduce an event-to-silhouette (E2S) neural network module to transform a stack of event frames to the corresponding silhouettes, with additional neural branches for camera pose regression. Second, we introduce E3D, which employs a 3D differentiable renderer (PyTorch3D) to enforce cross-view 3D mesh consistency and fine-tune the E2S and pose network. Lastly, we introduce a 3D-to-events simulation pipeline and apply it to publicly available object datasets and generate synthetic event/silhouette training pairs for supervised learning.
研究动机与目标
- 实现仅从事件相机数据进行密集3D网格重建,无需3D监督或RGB数据。
- 通过利用轮廓先验解决现有立体和基于特征的事件相机3D方法的局限性,实现多视角形状重建。
- 开发一种合成数据流水线,用于生成事件-轮廓对,以实现针对特定物体任务的监督训练。
- 提升对运动模糊和高速运动的鲁棒性,这是传统帧基传感器的常见挑战。
- 建立一个联合预测轮廓和绝对相机姿态的端到端学习框架,从事件流中进行。
提出的方法
- 引入事件到轮廓(E2S)神经网络,将事件帧堆栈转换为2D轮廓,辅以用于绝对相机姿态回归的分支。
- 使用3D可微分渲染器(PyTorch3D)通过在多个视角下优化网格以匹配预测轮廓,实现跨视角3D网格一致性。
- 提出一种新颖的3D到事件的仿真流水线,为公开的ShapeNet数据集上的监督训练生成合成事件与轮廓对。
- 采用多视角优化策略,通过网格重建损失优化轮廓和网格预测,提升空间一致性。
- 利用可微分渲染损失对网络进行微调,最小化各视角下渲染轮廓与预测轮廓之间的差异。
- 该方法仅依赖事件数据,避免对RGB、深度或LiDAR的依赖,专为低功耗边缘部署设计。
实验结果
研究问题
- RQ1仅使用轮廓先验和可微分渲染,能否从事件相机中实现密集3D网格重建?
- RQ2从事件流中联合预测轮廓和绝对相机姿态,如何提升3D重建精度?
- RQ3所提出的3D到事件的仿真流水线在多大程度上能实现有效的监督训练,用于事件相机3D重建?
- RQ4与基于帧的RGB方法相比,该方法在高速运动和运动模糊条件下的表现如何?
- RQ5可微分网格优化对减少轮廓预测中的噪声和伪影有何影响?
主要发现
- 在ShapeNet数据集上,该方法在高速运动条件下实现了0.40m的中位平移误差和40.6°的中位旋转误差,优于同类基于图像的方法。
- E3D方法对运动模糊表现出鲁棒性,即使在帧基传感器因模糊失效时仍能保持场景内容。
- 微调后的模型相比输入轮廓,提升了网格轮廓IoU,表明多视角优化显著提升了重建质量。
- 基线模型的分割平均IoU为0.37,网格平均IoU为0.32;微调后分别提升至0.36和0.30,表明可微分渲染损失具有显著优势。
- 尽管轮廓预测质量较高,但轮廓中仍存在噪声和棋盘状伪影,尽管跨视角优化在一定程度上缓解了其影响。
- 姿态预测模块仍是薄弱环节,其角度误差高于平移误差,提示未来工作需引入如重投影误差等几何损失。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。