[论文解读] Virtual-to-Real: Learning to Control in Visual Semantic Segmentation
本文提出一种模块化架构,通过语义图像分割作为元表征,在仿真环境中解耦视觉感知与控制策略学习,以弥合现实差距。通过分别训练感知与强化学习策略,并将分割表征迁移至真实机器人任务,该方法在障碍物避让和目标追踪任务中实现了更优性能,具备更快的学习速度和强大的零样本迁移能力,且无需领域随机化或微调。
Collecting training data from the physical world is usually time-consuming and even dangerous for fragile robots, and thus, recent advances in robot learning advocate the use of simulators as the training platform. Unfortunately, the reality gap between synthetic and real visual data prohibits direct migration of the models trained in virtual worlds to the real world. This paper proposes a modular architecture for tackling the virtual-to-real problem. The proposed architecture separates the learning model into a perception module and a control policy module, and uses semantic image segmentation as the meta representation for relating these two modules. The perception module translates the perceived RGB image to semantic image segmentation. The control policy module is implemented as a deep reinforcement learning agent, which performs actions based on the translated image segmentation. Our architecture is evaluated in an obstacle avoidance task and a target following task. Experimental results show that our architecture significantly outperforms all of the baseline methods in both virtual and real environments, and demonstrates a faster learning curve than them. We also present a detailed analysis for a variety of variant configurations, and validate the transferability of our modular architecture.
研究动机与目标
- 为解决视觉机器人控制中的现实差距问题,即在模拟器中训练的策略无法泛化至真实环境。
- 减少对昂贵真实世界数据收集和物理机器人中危险试错学习的依赖。
- 实现在无需领域随机化或微调的情况下,高效地将策略从虚拟环境零样本迁移至真实环境。
- 在处理多样化、未见过的环境及动态目标切换时,展示出鲁棒性与灵活性。
提出的方法
- 该架构将系统划分为一个感知模块,将RGB图像转换为语义分割图,以及一个通过深度强化学习训练的控制策略模块,以这些分割图为输入。
- 感知模块在公开数据集(如ADE20K)或合成数据上进行预训练,并独立于策略模块运行。
- 控制策略模块使用基于A3C的深度强化学习智能体,基于语义分割输入进行决策,而非原始像素。
- 该方法避免使用领域随机化,且在训练过程中不依赖真实世界数据,而是依赖语义元表征在不同领域间实现泛化。
- 采用帧堆叠技术以保留时间相关性,提升策略稳定性与导航过程中的目标追踪能力。
- 系统在两项任务中进行评估:在杂乱走廊中的障碍物避让任务,以及具有动态目标切换的目标追踪任务。
实验结果
研究问题
- RQ1是否可通过使用语义分割作为元表征的模块化架构,实现基于视觉的控制策略从仿真到真实世界的高效零样本迁移?
- RQ2与基线方法(包括领域随机化和端到端训练)相比,该方法在学习速度和真实世界性能方面表现如何?
- RQ3该控制策略在未见过的环境和物体形状(包括动态目标切换)中,其泛化能力达到何种程度?
- RQ4该方法对分割质量变化和标签复杂度(如非简化类别标签)的鲁棒性如何?
主要发现
- 在真实世界目标追踪任务中,该方法取得了90%的成功率,模拟环境中平均奖励为0.925,显著优于基线方法。
- 在障碍物避让任务中,使用简化标签时,该方法在真实世界中的碰撞率降低至0.7,低于基线模型的碰撞率。
- 即使使用非简化类别标签(27类),该模型仍表现出稳健性能,碰撞率(0.7)低于使用简化标签训练的模型(0.9),表明其具备更优的上下文理解能力。
- 该方法在未见过的室内外环境中表现出强泛化能力,真实世界部署无需微调。
- 由于帧堆叠保留了时间相关性,该模型在急转弯中仍能保持目标追踪,而基线智能体则容易丢失目标或选择回避。
- 该架构成功实现了视觉引导,支持目标的动态切换(如从人切换到椅子),真实世界评估中成功率达80%,模拟环境中达90%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。