[论文解读] Attentional Separation-and-Aggregation Network for Self-supervised Depth-Pose Learning in Dynamic Scenes
该论文提出了一种注意力分离与聚合网络(ASANet),用于在动态场景中进行自监督单目深度和自身运动估计,利用注意力机制分离静态与动态场景特征。该方法引入一种自动选择机制,对静态区域应用自身运动,对运动物体应用运动场,从而在KITTI数据集上实现最先进性能,且计算开销极低。
Learning depth and ego-motion from unlabeled videos via self-supervision from epipolar projection can improve the robustness and accuracy of the 3D perception and localization of vision-based robots. However, the rigid projection computed by ego-motion cannot represent all scene points, such as points on moving objects, leading to false guidance in these regions. To address this problem, we propose an Attentional Separation-and-Aggregation Network (ASANet), which can learn to distinguish and extract the scene's static and dynamic characteristics via the attention mechanism. We further propose a novel MotionNet with an ASANet as the encoder, followed by two separate decoders, to estimate the camera's ego-motion and the scene's dynamic motion field. Then, we introduce an auto-selecting approach to detect the moving objects for dynamic-aware learning automatically. Empirical experiments demonstrate that our method can achieve the state-of-the-art performance on the KITTI benchmark.
研究动机与目标
- 解决运动物体干扰自监督单目视频中深度与自身运动估计的问题。
- 在不依赖外部标注或预训练分割模型的前提下,实现动态感知学习。
- 开发一种轻量化、端到端的系统,实现纯自监督下的深度、自身运动与运动场联合估计。
- 在KITTI数据集上实现最先进性能,同时参数量低且推理速度达到实时
提出的方法
- ASANet通过在每一层使用软注意力机制分解,采用共享权重的两条特征路径分别处理静态与动态特征。
- 随后通过路径间特征聚合,利用迭代的分离与聚合操作优化表示。
- MotionNet架构将ASANet作为编码器,并使用两个解码器分别估计自身运动与动态运动场。
- 一种自动选择机制可动态识别运动物体,并为不同区域应用适当的变换(自身运动或运动场)以构建监督信号。
- 该方法利用对极一致性损失和几何一致性正则化(L_ge)提升监督质量。
- 训练采用多阶段调度策略,逐步优化动态感知特征学习。
实验结果
研究问题
- RQ1无外部监督下,基于注意力的网络能否有效分离单目视频中的静态与动态场景成分?
- RQ2在存在任意运动物体的情况下,如何提升自监督深度与自身运动估计的性能?
- RQ3自动选择机制能否在训练过程中动态为不同场景区域分配适当的变换(自身运动 vs. 运动场)?
- RQ4所提方法是否在计算成本低于现有方法的前提下,实现最先进性能?
主要发现
- 所提方法在KITTI基准上达到最先进性能,在深度估计与视觉里程计任务中均优于Monodepth2与PackNet-SfM。
- 采用ResNet-18主干网络时,该方法在KITTI上实现0.112的绝对相对误差(Abs Rel)、0.867的平方相对误差(Sq Rel)和0.882的δ1.25,优于基线Monodepth2。
- 与基线相比,加入ASANet与自动选择机制后,Abs Rel降低0.003,δ1.25提升0.005。
- 模型保持50 fps的实时推理速度,显著快于ORB-SLAM2,且与其它单阶段端到端方法相当。
- 仅使用14.84M参数(ResNet-18)即实现优越性能,参数量不足PackNet-SfM(D=4时为78.49M)的一半。
- 即使在更深的ResNet-50主干网络下,自动选择机制仍持续提升性能,将Abs Rel从0.109降低至0.108。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。