[论文解读] Visuo-Tactile Transformers for Manipulation
本文提出视觉-触觉变换器(Visuo-Tactile Transformers, VTT),一种多模态表征学习框架,通过跨模态注意力机制将视觉变换器(Vision Transformer)扩展至联合处理视觉与触觉反馈。VTT 学习空间感知的潜在热力图,显著提升了仿真环境与真实世界机器人操作任务中的样本效率与性能表现,在仿真与真实世界的方块推动任务中均优于基线方法。
Learning representations in the joint domain of vision and touch can improve manipulation dexterity, robustness, and sample-complexity by exploiting mutual information and complementary cues. Here, we present Visuo-Tactile Transformers (VTTs), a novel multimodal representation learning approach suited for model-based reinforcement learning and planning. Our approach extends the Visual Transformer \cite{dosovitskiy2021image} to handle visuo-tactile feedback. Specifically, VTT uses tactile feedback together with self and cross-modal attention to build latent heatmap representations that focus attention on important task features in the visual domain. We demonstrate the efficacy of VTT for representation learning with a comparative evaluation against baselines on four simulated robot tasks and one real world block pushing task. We conduct an ablation study over the components of VTT to highlight the importance of cross-modality in representation learning.
研究动机与目标
- 通过联合学习视觉与触觉反馈中的紧凑且信息丰富的潜在表征,提升机器人操作性能。
- 解决基于向量的潜在表征在捕捉空间细节与局部任务相关特征方面的局限性。
- 通过引入跨模态注意力机制,提升基于模型的强化学习中的样本效率与策略性能。
- 通过基于触觉信号引导的、空间感知的注意力机制,实现更鲁棒与稳定的策略学习。
提出的方法
- 将视觉变换器(ViT)架构扩展,通过模态特定的分块与嵌入方式引入触觉反馈。
- 在视觉与触觉模态内部使用自注意力机制,并在两者之间引入跨模态注意力机制,构建空间分布式的潜在表征。
- 引入可学习的接触、对齐与位置嵌入,以增强多模态推理能力与特征对齐效果。
- 应用压缩头模块降低潜在向量的维度,以优化效率与性能。
- 通过在视觉与触觉输入上施加预测损失与重建损失,结合任务特定奖励,监督表征学习过程。
- 采用多头注意力机制,并结合空间定位的注意力图,根据触觉反馈动态突出视觉中的相关区域。
实验结果
研究问题
- RQ1视觉与触觉之间的跨模态注意力是否能提升机器人操作任务的表征质量?
- RQ2在多模态潜在空间中引入空间感知注意力,如何影响强化学习中的样本效率与任务性能?
- RQ3将触觉反馈整合进视觉变换器架构,是否相比基于向量的融合方法,能带来更好的泛化性与鲁棒性?
- RQ4接触损失与对齐损失在学习有效视觉-触觉表征过程中起到何种作用?
- RQ5VTT 在具有丰富接触交互的真实世界机器人操作任务中,其泛化能力如何?
主要发现
- 在仿真任务中,VTT 在成功率达到更高水平的同时,收敛速度也快于拼接与专家产品(Product of Experts, PoE)融合的基线方法。
- 在真实世界的方块推动任务中,VTT 实现了更高的成功率,并展现出优于基线方法的样本效率。
- 消融实验表明,若移除接触或对齐损失,性能显著下降,证实了二者在学习有效多模态表征中的关键作用。
- 最优潜在向量压缩因子被确定为 c=12,实现了表征能力与学习效率之间的最佳平衡。
- 注意力热力图显示,VTT 能够动态聚焦于机器人、物体与目标区域,尤其在接触阶段表现明显,证明了其受触觉反馈引导的有效空间定位能力。
- 即使物体在视觉视野中远离机器人,模型仍能成功定位任务相关特征,表明其具备稳健的空间推理能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。