Skip to main content
QUICK REVIEW

[论文解读] Coarse-to-fine Q-attention with Tree Expansion

Stephen James, Pieter Abbeel|arXiv (Cornell University)|Apr 26, 2022
Advanced Neural Network Applications被引用 4
一句话总结

本文提出Q-attention with Tree Expansion(QTE),作为粗粒度到细粒度Q-attention的扩展,通过树扩展将细粒度层的值估计反向传播至粗粒度层,缓解了‘粗粒度模糊性’。通过在层次化层级上累积top-k值估计,QTE在视觉上相似或较小的物体任务中实现了更优的决策能力,相较于标准Q-attention,在模拟和真实世界机器人操作任务中显著提升了样本效率和成功率。

ABSTRACT

Coarse-to-fine Q-attention enables sample-efficient robot manipulation by discretizing the translation space in a coarse-to-fine manner, where the resolution gradually increases at each layer in the hierarchy. Although effective, Q-attention suffers from "coarse ambiguity" - when voxelization is significantly coarse, it is not feasible to distinguish similar-looking objects without first inspecting at a finer resolution. To combat this, we propose to envision Q-attention as a tree that can be expanded and used to accumulate value estimates across the top-k voxels at each Q-attention depth. When our extension, Q-attention with Tree Expansion (QTE), replaces standard Q-attention in the Attention-driven Robot Manipulation (ARM) system, we are able to accomplish a larger set of tasks; especially on those that suffer from "coarse ambiguity". In addition to evaluating our approach across 12 RLBench tasks, we also show that the improved performance is visible in a real-world task involving small objects.

研究动机与目标

  • 解决粗粒度到细粒度Q-attention中的‘粗粒度模糊性’问题,即在低分辨率体素化时,外观相似或较小的物体无法被区分。
  • 提升视觉基、稀疏奖励强化学习在机器人操作任务中的样本效率和决策准确性。
  • 通过在动作选择前使顶层注意力能够访问更细粒度层的信息,扩展C2F-ARM框架。
  • 在涉及小物体或外观相似物体的挑战性RLBench任务上评估该方法,特别是标准Q-attention失效的任务。

提出的方法

  • QTE引入一种树结构,其中每个节点代表某一分辨率层级上的一个体素,其子节点表示以父层top-k最高值体素为中心的更高分辨率体素。
  • 在每一层,当前层的top-k值估计被用于扩展树结构,并将值估计向上游传播,从而利用细粒度信息丰富粗粒度决策。
  • 树扩展在动作选择和Q值目标计算过程中均被应用,使智能体能够基于累积的细粒度值估计做出更明智的决策。
  • 该方法作为C2F-ARM+QTE集成到C2F-ARM系统中,保持原始架构不变,同时通过层次化值累积增强注意力机制。
  • 树扩展的广度K控制每一层考虑的top候选数量,更高的K可提升模糊性解决能力,但会增加计算开销。
  • 该方法受蒙特卡洛树搜索启发,但针对空间而非时间搜索进行适配,实现了跨分辨率层级的值传播。

实验结果

研究问题

  • RQ1通过树扩展进行层次化值传播,能否减少视觉基机器人操作中的‘粗粒度模糊性’?
  • RQ2展开的top-k候选数量(K)如何影响在视觉模糊或小物体任务中的性能表现?
  • RQ3在动作选择和Q值目标计算中同时应用树扩展,是否比单独应用时性能更优?
  • RQ4与标准Q-attention相比,QTE能否提升在真实世界任务中对小物体或外观相似物体的泛化能力和成功率?
  • RQ5当结合QTE时,提升RGB-D分辨率在需要精细视觉区分的任务中能带来多大性能增益?

主要发现

  • 在12个RLBench任务中,C2F-ARM+QTE的平均成功率均高于C2F-ARM,尤其在小物体或外观相似物体任务中表现突出。
  • 在‘lift_numbered_block’任务中,QTE显著提升了性能,但仍有部分失败案例,原因在于即使在256×256分辨率下数字可读性仍较差。
  • 在uFactory xArm 7的真实世界测试中,C2F-ARM+QTE在小物体抓取任务中实现6/6成功,而标准C2F-ARM仅实现2/6成功。
  • 消融实验表明,在动作选择和Q值目标计算中均使用树扩展时性能最佳,且随着K增大,成功率持续提升。
  • 仅在动作选择中应用树扩展仍表现良好,表明该策略在性能与计算成本之间提供了可行的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。