[论文解读] Object Recognition from Short Videos for Robotic Perception
本文提出一种卷积长短期记忆(LSTM)网络,通过利用短视频片段(最多5帧)中的运动线索,提升机器人目标识别性能。通过用卷积操作替代标准LSTM中的全连接门,该模型更有效地捕捉局部运动依赖关系,在Washington RGBD Object和Scenes数据集上均达到最先进准确率,优于静态图像基线方法和先前的视频方法。
Deep neural networks have become the primary learning technique for object recognition. Videos, unlike still images, are temporally coherent which makes the application of deep networks non-trivial. Here, we investigate how motion can aid object recognition in short videos. Our approach is based on Long Short-Term Memory (LSTM) deep networks. Unlike previous applications of LSTMs, we implement each gate as a convolution. We show that convolutional-based LSTM models are capable of learning motion dependencies and are able to improve the recognition accuracy when more frames in a sequence are available. We evaluate our approach on the Washington RGBD Object dataset and on the Washington RGBD Scenes dataset. Our approach outperforms deep nets applied to still images and sets a new state-of-the-art in this domain.
研究动机与目标
- 通过利用短视频片段中的时间运动线索,而非仅依赖静态图像,提升机器人感知能力。
- 设计一种循环神经网络架构,有效建模视频帧中的局部运动形变,以提升目标识别性能。
- 开发一种计算效率高的模型,适用于实时机器人和移动应用,尤其在短视频片段(如2–5帧)的约束条件下。
- 在多样化的数据集上展示模型的泛化能力和鲁棒性,包括存在目标可见性变化和视角变换的情况。
提出的方法
- 该方法采用完全卷积的LSTM架构,其中每个LSTM门(输入门、遗忘门、输出门)均使用卷积操作实现,而非全连接层。
- 该卷积设计使模型能够学习相邻帧之间的空间局部化运动模式,比标准LSTM更有效地捕捉局部运动形变。
- 采用双向LSTM结构,训练时为单向,推理时为双向,以增强特征表示和识别准确率。
- 模型在短视频片段上端到端训练,使用Washington RGBD数据集的帧裁剪图像,无需实例分割掩码。
- 通过使用ImageNet预训练的卷积滤波器进行权重初始化,以提升在小样本数据集上的收敛速度和性能。
- 推理过程经过优化,基线CNN模型每帧耗时0.1秒,运动模型每两帧序列耗时0.87秒(单GPU环境下)。
实验结果
研究问题
- RQ1从极短视频片段(2–5帧)中提取的运动信息是否能显著提升机器人感知中的目标识别准确率?
- RQ2完全卷积的LSTM架构是否在建模运动用于识别任务方面优于标准全连接LSTM或静态CNN?
- RQ3当序列中帧数更多时,模型的泛化性能如何,尤其是在帧间距较远时?
- RQ4在帧数有限的实际机器人和移动场景中,模型能否保持高性能和高效率?
主要发现
- 所提出的卷积LSTM模型在Washington RGBD Object和Scenes数据集上均达到最先进性能,优于静态图像基线方法和先前的视频方法。
- 随着序列中帧数的增加,识别准确率持续提升,当帧间距为1–3帧时增益最大,表明运动线索被最优利用。
- 当帧间距为5帧或10帧时,准确率略有下降,原因可能是目标遮挡或消失,凸显了帧间接近度在实际应用中的重要性。
- 模型在单GPU上每两帧序列耗时0.87秒,适用于实时机器人感知系统。
- 采用单向训练与双向推理的策略取得最佳性能,证明了时间上下文建模的有效性。
- 模型在不同数据集间具有良好的泛化能力,在无需架构修改的情况下,对广角视角和自然场景视频均取得优异结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。