Skip to main content
QUICK REVIEW

[论文解读] SENSE: a Shared Encoder Network for Scene-flow Estimation

Huaizu Jiang, Deqing Sun|arXiv (Cornell University)|Oct 27, 2019
Advanced Vision and Imaging参考文献 63被引用 7
一句话总结

SENSE 提出了一种共享编码器网络,用于整体场景光流估计,将光流、立体匹配视差、遮挡和语义分割统一到一个紧凑的模型中。通过在任务间共享特征,并利用蒸馏和自监督损失,SENSE 在仅使用 880 万个参数和 1.5GB GPU 内存的情况下,在光流基准测试中实现了最先进性能——在速度和效率方面显著优于更大模型,同时能有效处理部分标注的真实世界数据。

ABSTRACT

We introduce a compact network for holistic scene flow estimation, called SENSE, which shares common encoder features among four closely-related tasks: optical flow estimation, disparity estimation from stereo, occlusion estimation, and semantic segmentation. Our key insight is that sharing features makes the network more compact, induces better feature representations, and can better exploit interactions among these tasks to handle partially labeled data. With a shared encoder, we can flexibly add decoders for different tasks during training. This modular design leads to a compact and efficient model at inference time. Exploiting the interactions among these tasks allows us to introduce distillation and self-supervised losses in addition to supervised losses, which can better handle partially labeled real-world data. SENSE achieves state-of-the-art results on several optical flow benchmarks and runs as fast as networks specifically designed for optical flow. It also compares favorably against the state of the art on stereo and scene flow, while consuming much less memory.

研究动机与目标

  • 为解决真实世界场景光流估计中数据稀缺的问题,即遮挡和分割等关键任务的真值标注稀疏或缺失。
  • 通过在四个密切相关任务(光流、立体视差、遮挡和语义分割)之间共享公共编码器,提升特征表示能力和模型效率。
  • 通过引入蒸馏和自监督损失项,利用任务间相互作用,实现在部分标注真实世界数据上的有效训练。
  • 在光流、视差和场景光流基准测试中实现最先进性能,同时保持低推理成本和内存占用。

提出的方法

  • 在四个任务——光流、立体视差、遮挡和语义分割之间使用共享编码器,通过多任务训练实现参数效率和更优的特征学习。
  • 在共享编码器上附加任务特定的解码器,支持各任务的灵活训练和推理。
  • 对标注数据有限的任务(如分割和遮挡)应用蒸馏损失,利用预训练模型从辅助数据集中迁移知识。
  • 自监督损失强制一致性:在形变图像中对应像素应具有相似外观(光度损失)和语义类别(语义一致性损失),尤其在天空等无标注区域。
  • 模型通过监督损失、蒸馏损失和自监督损失的组合进行训练,即使在真值稀疏的情况下也能实现鲁棒性能。
  • 架构针对推理效率进行优化,在 KITTI 图像上实现光流推理时间 0.03 秒,完整场景光流推理时间 0.15 秒。

实验结果

研究问题

  • RQ1在多个相关视觉任务之间共享公共编码器,是否能提升场景光流估计中的特征表示能力和模型效率?
  • RQ2如何有效结合蒸馏和自监督损失,以提升在部分标注真实世界数据上的性能?
  • RQ3统一网络能否在光流、视差和场景光流任务上实现最先进性能,同时显著小于且快于现有模型?
  • RQ4光流、视差、遮挡和分割等任务之间的相互作用,在缺乏真值标注区域中在多大程度上提升了模型鲁棒性?

主要发现

  • SENSE 在 KITTI 2015 上实现了最先进光流性能,当四个任务联合训练时,F1-occ 错误率降至 11.19%。
  • 当所有任务联合使用时,SENSE 将视差误差(D1-occ)降低至 2.59%,优于独立训练的模型。
  • 当所有任务联合训练时,语义分割的 mIoU 达到 48.25%,表明多任务学习显著提升了分割精度。
  • SENSE 仅使用 880 万个参数实现光流任务,完整场景光流模型为 1340 万个参数,GPU 内存占用仅 1.5GB——相比 FlowNet3(7.4GB)小 20 倍,且显著优于 PSMNet(4.2GB)的效率。
  • 在 KITTI 图像上,SENSE 的光流推理时间为 0.03 秒,完整场景光流为 0.15 秒,与专用光流网络速度相当。
  • 消融实验表明,结合蒸馏和自监督损失可获得最佳性能,其中自监督损失在减少无真值区域(如天空)的伪影方面尤为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。