[論文レビュー] Learning Neuro-Symbolic Skills for Bilevel Planning
本論文では、示範から記号的演算子、ニューラル部分目標サンプラー、および部分目標に条件づけられた方策を同時に学習する神経記号的スキルを用いた二段階計画を提案する。これらのコンponentsをモジュラーなスキルに統合することで、連続的かつ高次元のロボット工学的環境において、効率的で一般化可能なタスクと運動計画が可能となり、4つのドメインで6つのベースラインを上回り、未学習のタスクで90–98%のタスク成功率を達成した。
Decision-making is challenging in robotics environments with continuous object-centric states, continuous actions, long horizons, and sparse feedback. Hierarchical approaches, such as task and motion planning (TAMP), address these challenges by decomposing decision-making into two or more levels of abstraction. In a setting where demonstrations and symbolic predicates are given, prior work has shown how to learn symbolic operators and neural samplers for TAMP with manually designed parameterized policies. Our main contribution is a method for learning parameterized polices in combination with operators and samplers. These components are packaged into modular neuro-symbolic skills and sequenced together with search-then-sample TAMP to solve new tasks. In experiments in four robotics domains, we show that our approach -- bilevel planning with neuro-symbolic skills -- can solve a wide range of tasks with varying initial states, goals, and objects, outperforming six baselines and ablations. Video: https://youtu.be/PbFZP8rPuGg Code: https://tinyurl.com/skill-learning
研究の動機と目的
- スパムなフィードバックと高次元の行動空間を伴う、長ホライズンで連続状態のロボティクス意思決定の課題に対処すること。
- タスクと運動計画における記号的抽象化の限界を克服し、同じ記号的効果を満たす複数の部分目標に到達可能なスキルを可能にすること。
- 同じ記号的目標を達成する複数のスキルシーケンスを計画可能にすること、特に記号的抽象化が不完全であっても可能にすること。
- 事前にスキル数を知ることなく、示範からパラメータ化された方策、演算子、サンプラーを同時に学習すること。
- 記号とスキルがお互いに学習可能な自己改善ループを可能にすること。
提案手法
- 神経記号的スキルは、記号的演算子、ニューラル部分目標に条件づけられた方策、およびニューラル部分目標サンプラーから構成され、モジュラーで学習可能なユニットを形成する。
- 部分目標サンプラーは、記号的効果と整合する環境状態を生成し、同じ記号的結果に対して複数の実現可能な部分目標が必要なことを解決する。
- 方策はサンプルされた部分目標に条件づけられ、それへの到達を実行することで、多様な初期状態にわたる一般化を可能にする。
- 二段階計画は、記号的演算子の上位レベルのAI計画ループと、実行可能性のテストのための下位レベルのサンプリングループから成り、必要に応じて代替シーケンスにフォールバック可能である。
- スキルは1000件の示範から、事前にスキル数を知ることなく、模倣学習を用いてエンドツーエンドで訓練する。
- フレームワークは、手動で設計されたものと学習された述語の両方から学習可能であり、記号とスキルの発見の好循環を可能にする。
実験結果
リサーチクエスチョン
- RQ1神経記号的スキルは、示範から学習可能であり、連続的ロボティクス環境における多様な初期状態と目標にわたる一般化を可能にするか?
- RQ2記号的抽象化が不完全な場合でも、同じ記号的効果を満たす複数の環境状態(部分目標)に到達可能なスキルはどのように設計できるか?
- RQ3学習された神経記号的スキルを用いた二段階計画は、連続的行動と状態、スパムな報酬を伴う長ホライズンの設定で、ベースラインを上回る性能を示せるか?
- RQ4自動的に発見された述語からスキルを学習可能であり、記号とスキルの共創による自己改善システムが実現可能か?
- RQ5学習されたサンプラーと方策は、手動で設計されたものと比較して、計画の効率性と成功確率にどのように影響するか?
主な発見
- Cover、Doors、Stick Button、Coffeeの環境において、提案手法(BPNS)はそれぞれ90.40%、98.00%、98.00%、98.00%のタスク成功率を達成し、標準偏差は2%未満であった。
- 手動で設計されたスキルを含む6つのベースラインおよびアブレーションと比較して、未学習の初期状態と目標にわたる一般化性能が優れていた。
- 平均して、Cover環境における学習済みスキルを用いた計画では53.68のノード生成を要するのに対し、オラクルスキルでは320.32のノード生成が必要であった。これは、探索効率の向上を示している。
- ウォールクロック計画時間は、学習済みスキルでは(例:Coffeeで53.68秒)オラクルスキル(Coffeeで67.25秒)よりも長くなったが、主にニューラルネットワークの推論オーバーヘッドによるものであった。
- 手動で設計されたものではなく、学習された述語から訓練した場合でも、99.20%の成功率を達成しており、エンドツーエンドでの記号とスキル学習の有効性を示している。
- 述語の発見が主なボトルネックであった(平均4898秒)、一方でスキル学習は速かった(372秒)。これは、スケーラビリティの観点で記号発見が重要なパスであることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。