[論文レビュー] Learning Visual Robotic Control Efficiently with Contrastive Pre-training and Data Augmentation
CoDER は、対照的事前学習、オンラインデータ拡張、および少数のデモを組み合わせることで、データ効率的な視覚的ロボット強化学習を可能にする。10個のデモのみで実ロボットデータを学習し、実際に30分間の訓練時間で、到達、スイッチの切り替え、引き出しの開閉といったスパarsely-rewardedな操作タスクを達成する。
Recent advances in unsupervised representation learning significantly improved the sample efficiency of training Reinforcement Learning policies in simulated environments. However, similar gains have not yet been seen for real-robot reinforcement learning. In this work, we focus on enabling data-efficient real-robot learning from pixels. We present Contrastive Pre-training and Data Augmentation for Efficient Robotic Learning (CoDER), a method that utilizes data augmentation and unsupervised learning to achieve sample-efficient training of real-robot arm policies from sparse rewards. While contrastive pre-training, data augmentation, demonstrations, and reinforcement learning are alone insufficient for efficient learning, our main contribution is showing that the combination of these disparate techniques results in a simple yet data-efficient method. We show that, given only 10 demonstrations, a single robotic arm can learn sparse-reward manipulation policies from pixels, such as reaching, picking, moving, pulling a large object, flipping a switch, and opening a drawer in just 30 minutes of mean real-world training time. We include videos and code on the project website: https://sites.google.com/view/efficient-robotic-manipulation/home
研究の動機と目的
- ピクセル観測からの実ロボット強化学習におけるデータ非効率性という重要な課題に取り組む。
- 標準的なRLとアシスト学習の限界を乗り越えるために、自己教師あり表現学習と効率的な探索を組み合わせる。
- シミュレーション、モーションキャプチャ、密度の高い報酬に依存せずに、実ロボットハードウェア上でサンプル効率の良いポリシー学習を可能にする。
- 対照的事前学習、データ拡張、および少数のデモの相乗効果が、実世界環境における高速で信頼性の高いポリシー学習を可能にすることを示す。
提案手法
- 10個のエキスパートデモを収集し、リプレイバッファに格納して学習の初期化を行う。
- デモデータ上でインスタンスレベルの対照的学習を用いて畳み込みエンコーダーを事前学習し、視点不変な視覚的表現を学習する。
- オンライン相互作用と初期デモからの拡張観測を用いて、オフポリシーの深層強化学習(SAC)でポリシーをファインチューニングする。
- 強化学習の訓練中に観測値に対して確率的データ拡張(例:クロップ、色のジャイタ)を適用し、ロバストネスと表現学習を向上させる。
- エンジニアリングされた報酬や事前状態情報に依存を最小限に抑えるために、スパarsely-rewardedな信号を用いてポリシーをエンドツーエンドで実世界で訓練する。
- 事前学習済みエンコーダーを活用して、意味的に意味のある視覚的特徴でポリシーネットワークを初期化することで、サンプル効率を向上させる。

実験結果
リサーチクエスチョン
- RQ1対照的事前学習とデータ拡張は、実ロボット視覚的強化学習におけるサンプル効率を顕著に向上させるか?
- RQ2自己教師あり表現学習と組み合わせた少数のデモ(例:10個)が、どの程度効率的なポリシー学習を可能にするか?
- RQ3事前学習、データ拡張、およびオフポリシーRLの組み合わせが、実世界のロボット操作において個々の要素を上回る性能を発揮するか?
- RQ4このフレームワークは、最小限の人的介入で多様なスパarsely-rewardedな操作タスクにどの程度効果的に適用できるか?
- RQ5この手法は、シミュレーションや密度の高い監視なしに、実世界の視覚的変化や複雑な操作タスクに一般化可能か?
主な発見
- CoDER は、到達、押す、大きな物体を引く、スイッチを切り替える、引き出しを開けるといった6つの多様な操作タスクについて、10個のデモのみで成功したポリシーを学習する。
- 各タスクについて15分から50分の合計実世界訓練時間で信頼性の高い性能を達成し、標準的なRLと比較して顕著にサンプル複雑性を低減する。
- 対照的事前学習、データ拡張、およびデモの組み合わせにより、各要素が個別に実ロボットタスクで失敗する中で、効率的な学習が可能になる。
- CoDER は、密度の高い報酬、Sim2Real移行、またはモーションキャプチャに依存する手法と同等のデータ効率性を達成するが、それらの要素を必要としない。
- オブジェクトの形状や位置の小さな変動には一般化可能であるが、照明や背景の変化といった大きな視覚ドメインシフトでは性能が低下する。
- この手法は軽量であり、2台のRGBカメラ、1台のGPU、最小限の設定で標準的なロボットハードウェアにデプロイ可能で、深度センサーや複雑なインfrastrucureを必要としない。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。