[論文レビュー] Learning Insertion Primitives with Discrete-Continuous Hybrid Action Space for Robotic Assembly Tasks
本稿では、強化学習を用いてロボット挿入プリミティブを学習するためのハイブリッド離散連続行動空間を提案する。プリミティブの種別(並進、回転、挿入)と連続的パラメータ(速度、接触力しきい値)を同時に最適化する。Twin-Smoothed Multi-pass DQN(TS-MP-DQN)という手法により、Q値の過大評価を低減し、シミュレーションから実世界への転送で93.3%を超える高い成功率を達成。未学習のタイトクリアランスや複雑形状のアセンブリに対しても一般化し、ベースラインを上回る性能を発揮する。
This paper introduces a discrete-continuous action space to learn insertion primitives for robotic assembly tasks. Primitive is a sequence of elementary actions with certain exit conditions, such as "pushing down the peg until contact". Since the primitive is an abstraction of robot control commands and encodes human prior knowledge, it reduces the exploration difficulty and yields better learning efficiency. In this paper, we learn robot assembly skills via primitives. Specifically, we formulate insertion primitives as parameterized actions: hybrid actions consisting of discrete primitive types and continuous primitive parameters. Compared with the previous work using a set of discretized parameters for each primitive, the agent in our method can freely choose primitive parameters from a continuous space, which is more flexible and efficient. To learn these insertion primitives, we propose Twin-Smoothed Multi-pass Deep Q-Network (TS-MP-DQN), an advanced version of MP-DQN with twin Q-network to reduce the Q-value over-estimation. Extensive experiments are conducted in the simulation and real world for validation. From experiment results, our approach achieves higher success rates than three baselines: MP-DQN with parameterized actions, primitives with discrete parameters, and continuous velocity control. Furthermore, learned primitives are robust to sim-to-real transfer and can generalize to challenging assembly tasks such as tight round peg-hole and complex shaped electric connectors with promising success rates. Experiment videos are available at https://msc.berkeley.edu/research/insertion-primitives.html.
研究の動機と目的
- 従来の低レベル制御行動空間では、探索の難易度が高く、サンプル効率が低いというロボットアセンブリタスクの課題に対処すること。
- パラメトリックな挿入プリミティブを通じて人間の事前知識を組み込むことで、シミュレーションから実世界への転送における一般化性とロバスト性を向上させること。
- 従来のプリミティブベース手法における離散的パラメータ選択の制限を克服し、より高い柔軟性とパフォーマンスを実現する連続的パラメータ学習を可能にすること。
- Q値の過大評価を低減する安定的かつ効率的な深層強化学習アルゴリズムを、パラメトリックな行動に対して開発すること。
提案手法
- 挿入プリミティブを、離散的プリミティブ種別(並進、回転、挿入)と連続的パラメータ(速度ベクトル、接触力しきい値)を組み合わせたハイブリッド行動として定式化する。
- プリミティブパラメータの連続的パラメータ空間を設計し、固定された離散的選択ではなく、無限に近い可能な設定を可能にする。
- TS-MP-DQNを提案。MP-DQNの拡張版で、二重Qネットワークを用いてQ値の過大評価を低減し、ポリシーの滑らかさ正則化を導入して訓練の安定性を向上させる。
- 実世界の実験ではインピーダンス制御を用い、機械的柔軟性を提供することで、シミュレーションから実世界への転送におけるロバスト性を向上させる。
- シミュレーションで、挿入への進行度に基づく密度の高い報酬形状を用い、接触力が終端条件として設定される。
- シミュレーションで訓練されたポリシーを、微調整なしに直接実ロボットにデプロイすることで、ゼロショットのシミュレーションから実世界への転送を実現する。
実験結果
リサーチクエスチョン
- RQ1低レベル制御または離散的パラメータを持つプリミティブと比較して、ハイブリッド離散連続行動空間は、ロボット挿入タスクにおける学習効率と成功率を向上させるか?
- RQ2挿入プリミティブにおける連続的パラメータ学習は、未学習のピッグホール幾何形状やタイトクリアランスへの一般化にどのように影響するか?
- RQ3提案されたTS-MP-DQNアルゴリズムは、標準的なMP-DQNと比較して、Q値の過大評価をどの程度低減し、ポリシーの安定性を向上させるか?
- RQ4シミュレーションで訓練されたポリシーは、微調整なしに実ロボットに成功裏に転送可能か、特に複雑または高クリアランスタスクにおいては?
主な発見
- 提案手法は、3つのピッグホールタスクにおいて、シミュレーションから実世界への転送で93.3%を超える成功率を達成し、MP-DQNにパラメトリックな行動を適用したバージョンや連続的スピード制御を含むすべてのベースラインを上回った。
- タイトな丸型ピッグホール(0.05 mmクリアランス)や複雑な電気コネクタなど、未学習の挑戦的タスクに対しても、再訓練なしに成功裏に一般化され、有望な成功率を達成した。
- TS-MP-DQNは、三角形および五角形のピッグホールタスクにおいて、標準的なMP-DQNを上回り、より優れた学習の安定性とパフォーマンスを示した。
- 連続的プリミティブパラメータの使用は、離散的パラメータベースラインと比較して顕著に高い成功率と効率性をもたらした。後者はハイパーパrameterの選択に敏感で、カバー範囲も限られていた。
- 実世界での離散的パラメータベースラインの性能は、先行研究で報告された値よりも低かった。これは、ポーズの不確実性が増加したためであり、連続的パラメータ化の優位性を示している。
- シミュレーションで学習したポリシーは、ドメインランダム化を最小限に抑えながらも、実ロボットに直接転送可能であり、強力なロバスト性と一般化能力を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。