[论文解读] Exploratory Grasping: Asymptotically Optimal Algorithms for Grasping Challenging Polyhedral Objects
本文提出了一种新颖的在线学习问题——探索性抓取(Exploratory Grasping),其中机器人通过依次尝试抓取、成功后释放或失败后倾倒,来发现未知多面体物体上的可靠抓取策略。该研究提出BORGES算法,一种受多臂赌博机启发的算法,能够高效探索稳定物体姿态下的抓取策略,在1000至8000个时间步内实现接近最优的性能,并在仅200次尝试下,将真实世界中的抓取成功率相比Dex-Net基线提升45%。
There has been significant recent work on data-driven algorithms for learning general-purpose grasping policies. However, these policies can consistently fail to grasp challenging objects which are significantly out of the distribution of objects in the training data or which have very few high quality grasps. Motivated by such objects, we propose a novel problem setting, Exploratory Grasping, for efficiently discovering reliable grasps on an unknown polyhedral object via sequential grasping, releasing, and toppling. We formalize Exploratory Grasping as a Markov Decision Process, study the theoretical complexity of Exploratory Grasping in the context of reinforcement learning and present an efficient bandit-style algorithm, Bandits for Online Rapid Grasp Exploration Strategy (BORGES), which leverages the structure of the problem to efficiently discover high performing grasps for each object stable pose. BORGES can be used to complement any general-purpose grasping algorithm with any grasp modality (parallel-jaw, suction, multi-fingered, etc) to learn policies for objects in which they exhibit persistent failures. Simulation experiments suggest that BORGES can significantly outperform both general-purpose grasping pipelines and two other online learning algorithms and achieves performance within 5% of the optimal policy within 1000 and 8000 timesteps on average across 46 challenging objects from the Dex-Net adversarial and EGAD! object datasets, respectively. Initial physical experiments suggest that BORGES can improve grasp success rate by 45% over a Dex-Net baseline with just 200 grasp attempts in the real world. See https://tinyurl.com/exp-grasping for supplementary material and videos.
研究动机与目标
- 解决通用抓取策略在具有稀疏抓取点或对抗性几何结构的挑战性多面体物体上持续失败的问题。
- 形式化一种新的问题设定——探索性抓取(Exploratory Grasping),即机器人通过顺序交互学习鲁棒抓取策略,根据抓取结果选择释放或倾倒物体。
- 开发一种与模态无关的在线学习算法,能够高效发现未知物体所有稳定姿态下的高性能抓取策略。
- 为该结构化马尔可夫决策过程(MDP)设定下的在线抓取探索提供理论性能边界和无遗憾保证。
- 通过仿真和真实世界实验,实证验证所提方法在性能上优于通用抓取流水线及其他在线学习基线方法。
提出的方法
- 将探索性抓取形式化为马尔可夫决策过程(MDP),其中状态表示未知多面体物体的稳定姿态,动作是抓取尝试,并通过成功/失败反馈获得奖励。
- 设计BORGES算法,一种类似赌博机的算法,利用MDP结构优先探索每种姿态下的高回报抓取,最小化在低回报转移上的时间浪费。
- 采用Thompson采样并结合伯努利分布奖励,实现探索与利用之间的平衡,从而在每种姿态下快速收敛至高质量抓取策略。
- 在抓取失败后引入倾倒作为状态转移机制,使机器人能够采样新的稳定姿态,从而探索完整的姿态空间。
- 为每种稳定姿态维护独立策略,利用最优策略在每个状态下均为贪婪策略的特性,避免在不同姿态间进行冗余探索。
- 可与任意抓取模态(如平行颚、真空吸附、多指抓取)集成,并可将通用抓取策略作为先验,从而提升其在困难情况下的性能。
实验结果
研究问题
- RQ1机器人能否仅通过顺序交互和反馈,在极少数或完全没有高质量抓取点的挑战性多面体物体上,高效发现高质量抓取?
- RQ2MDP的结构——由稳定姿态和抓取结果定义——如何影响在线抓取学习算法的样本效率?
- RQ3受赌博机启发的算法是否能在收敛速度和最终性能上超越通用抓取策略及标准强化学习基线方法,特别是在困难物体上?
- RQ4与非自适应策略(如Dex-Net)相比,BORGES在不同稳定姿态下是否显著降低了抓取成功率的方差?
- RQ5该算法在真实世界环境中表现如何?是否能在有限尝试次数内实现接近最优的抓取成功率?
主要发现
- 在Dex-Net对抗性数据集和EGAD!数据集中的46个挑战性物体上,BORGES在平均1000个时间步内即达到最优策略性能的95%以内。
- 在仿真中,BORGES显著优于通用抓取流水线及其他两种在线学习算法,尤其在先前方法假设不成立时表现更优。
- 在两个挑战性物体的真实实验中,BORGES在夹具和管道上的抓取成功率分别达到0.89和0.87,而Dex-Net基线在200次尝试后仅为0.49和0.37。
- BORGES与Dex-Net之间的性能差距主要源于Dex-Net无法根据反馈自适应调整——其性能高度波动,而BORGES则迅速稳定并收敛。
- 敏感性分析表明,除非最小抓取质量(ε)或最不可能的稳定姿态概率(λ₁)极低,BORGES均能快速收敛,表明其在现实条件下的鲁棒性。
- BORGES通过利用MDP结构,特别是为每种姿态维护独立策略并避免探索低回报转移,显著优于表格型强化学习方法(如UCRL2和Thompson采样)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。