[论文解读] Situational Fusion of Visual Representation for Visual Navigation
本文提出了一种基于动作级别的融合框架,通过结合来自多种视觉任务(如3D几何、语义和深度)的多样化视觉表征,提升视觉导航中的零样本泛化能力。通过利用Taskonomy中的任务亲和性来正则化表征选择,该方法在未见环境中的鲁棒性和性能优于ImageNet预训练基线模型和特征级融合方法。
A complex visual navigation task puts an agent in different situations which call for a diverse range of visual perception abilities. For example, to "go to the nearest chair", the agent might need to identify a chair in a living room using semantics, follow along a hallway using vanishing point cues, and avoid obstacles using depth. Therefore, utilizing the appropriate visual perception abilities based on a situational understanding of the visual environment can empower these navigation models in unseen visual environments. We propose to train an agent to fuse a large set of visual representations that correspond to diverse visual perception abilities. To fully utilize each representation, we develop an action-level representation fusion scheme, which predicts an action candidate from each representation and adaptively consolidate these action candidates into the final action. Furthermore, we employ a data-driven inter-task affinity regularization to reduce redundancies and improve generalization. Our approach leads to a significantly improved performance in novel environments over ImageNet-pretrained baseline and other fusion methods.
研究动机与目标
- 在具有多样化视觉外观和布局的未见环境中,提升视觉导航智能体的零样本泛化能力。
- 通过引入多样化视觉任务中的结构化先验,解决端到端强化学习智能体在训练环境中过拟合的局限性。
- 开发一种基于情境上下文自适应融合视觉表征的融合机制,而非依赖单一黑箱策略。
- 利用Taskonomy中的数据驱动任务间亲和性,减少视觉表征间的冗余,以提升泛化能力和鲁棒性。
- 通过动作级融合提升模型对表征噪声和子系统故障的鲁棒性。
提出的方法
- 为来自多样化视觉任务(如语义分割、深度估计、消失点检测)的每种视觉表征训练一个动作预测器。
- 通过学习自适应权重,在动作级别融合所有表征的预测结果,将动作候选组合为最终动作。
- 使用Taskonomy的亲和性矩阵对任务间亲和性进行正则化,以惩罚冗余表征的选择,鼓励互补表征的使用。
- 采用多分支网络架构,其中每个分支处理一种不同的视觉表征,并输出一个候选动作。
- 使用深度强化学习联合端到端训练整个系统,结合模仿奖励和内在奖励以优化导航成功率。
- 进行消融实验,评估在表征丢失情况下的鲁棒性,包括输入缺失或损坏的情形。
实验结果
研究问题
- RQ1融合来自多样化视觉任务的视觉表征是否能提升视觉导航中的零样本泛化能力?
- RQ2动作级融合在应对表征失效和噪声时是否比特征级融合更具鲁棒性?
- RQ3任务间亲和性正则化是否能减少视觉表征间的冗余并提升策略泛化能力?
- RQ4哪些类型的视觉表征(如3D几何、语义、低级线索)对导航成功贡献最大?
- RQ5当部分或表征输入受损时,该融合模型表现如何?
主要发现
- 结合任务间亲和性正则化的动作级融合模型在未见的Gibson环境中取得了显著更高的成功率,优于ImageNet预训练基线模型和特征级融合方法。
- 欧氏距离和表面法线估计表征作为单一表征表现最佳,凸显了3D几何线索在导航中的重要性。
- 语义分割及其他语义表征排名靠前,证实了对象级理解在目标定位中的价值。
- 动作级融合展现出更优的鲁棒性:即使50%的表征被损坏或丢失,模型仍保持有意义的性能,优于特征级融合。
- 模型在表征输入存在噪声或缺失时仍保持强劲表现,表明其对子系统故障具有抗性。
- 任务间亲和性正则化促使选择了更具互补性的表征,减少了冗余并提升了泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。