[論文レビュー] On Bringing Robots Home
本論文では、DIYの「スティック」ツールを用いて5分間の人の模倣によるデモのみで、家庭用ロボットが新しいタスクを学習できる低コストで汎用性の高いロボットシステムDobb·Eを紹介する。22軒のニューヨーク市住宅で収集した13時間分のデータセットをもとに、ホーム事前学習表現(HPR)を用いて訓練されたDobb·Eは、109の家庭内タスクにおいて81%の成功率を達成した。また、コード、モデル、ハードウェア設計をすべて公開することで、家庭用ロボット研究の加速を図った。
Throughout history, we have successfully integrated various machines into our homes. Dishwashers, laundry machines, stand mixers, and robot vacuums are a few recent examples. However, these machines excel at performing only a single task effectively. The concept of a "generalist machine" in homes - a domestic assistant that can adapt and learn from our needs, all while remaining cost-effective - has long been a goal in robotics that has been steadily pursued for decades. In this work, we initiate a large-scale effort towards this goal by introducing Dobb-E, an affordable yet versatile general-purpose system for learning robotic manipulation within household settings. Dobb-E can learn a new task with only five minutes of a user showing it how to do it, thanks to a demonstration collection tool ("The Stick") we built out of cheap parts and iPhones. We use the Stick to collect 13 hours of data in 22 homes of New York City, and train Home Pretrained Representations (HPR). Then, in a novel home environment, with five minutes of demonstrations and fifteen minutes of adapting the HPR model, we show that Dobb-E can reliably solve the task on the Stretch, a mobile robot readily available on the market. Across roughly 30 days of experimentation in homes of New York City and surrounding areas, we test our system in 10 homes, with a total of 109 tasks in different environments, and finally achieve a success rate of 81%. Beyond success percentages, our experiments reveal a plethora of unique challenges absent or ignored in lab robotics. These range from effects of strong shadows, to variable demonstration quality by non-expert users. With the hope of accelerating research on home robots, and eventually seeing robot butlers in every home, we open-source Dobb-E software stack and models, our data, and our hardware designs at https://dobb-e.com
研究の動機と目的
- 実際の家庭で多様な家庭内タスクを学習できる低コストで汎用性の高いロボットシステムの開発。
- 研究室環境でのロボット性能と実際の家庭での展開とのギャップを埋めるために、制御不能で多様な家庭環境でデータを収集すること。
- 最小限の人のデモによる模倣学習を通じて、迅速なタスク学習を可能にし、ユーザーの快適性と安全性を向上させること。
- ハードウェア、ソフトウェア、データセット、事前学習モデルをオープンソース化することで、家庭用ロボット分野におけるスケーラブルなフレームワークを確立すること。
- 制御された研究室環境では見過ごされがちな、実世界の課題(例:照明の変動、センサの制限)を特定・文書化すること。
提案手法
- 『スティック』は、リーチャー・グラッパー、3Dプリント部品、およびiPhoneから構成される低コストのデモツールであり、専門知識のないユーザーが生じる家庭でもタスクデモを記録可能である。
- 22軒のニューヨーク市住宅で13時間分の人間のデモデータを収集し、216の環境にまたがる5,620件のデモを含む『ニューヨークの家(HoNY)』データセットを構築した。
- ホーム事前学習表現(HPR)は、HoNYデータセットのRGBおよび深度映像データを用いて自己教師型学習(SSL)により訓練され、強固な視覚的および空間的表現を学習する。
- 新しいタスクに対しては、HPRモデルを24件のデモ(5分間のデータ)を用いて微調整することで、新しい環境への迅速な適応を可能にする。
- システムは市販のHello Robot Stretchロボットに実装されており、iPhoneの同期マウントを介してスティックから直接データをロボットに転送している。
- ハードウェア、データ収集、事前学習、デプロイメントを統合した包括的なパイプラインを構築し、再現性と協働を促進するために、すべてのコンponentsをオープンソース化した。

実験結果
リサーチクエスチョン
- RQ1低コストで汎用性の高いロボットは、実際の家庭で5分間の人のデモのみで多様な家庭内タスクを学習できるか?
- RQ2大規模かつ現実世界の家庭データセットで事前学習することで、ロボット操作におけるゼロショットおよびフェイシュット一般化性能がどのように向上するか?
- RQ3照明の変動、センサのノイズ、ハードウェア制限などの主な現実世界の障害要因は何か?これらは非構造的な家庭環境でのパフォーマンスを阻害する要因となるか?
- RQ4デモの実施者の熟練度やデータ品質が、実際の家庭でのタスク実行成功率にどの程度影響を及えるか?
- RQ5オープンソースのハードウェア、ソフトウェア、データセットは、家庭用ロボット分野の研究をどの程度加速させ、参入障壁を低下させるか?
主な発見
- Dobb·Eは10軒の実際の家庭で109の家庭内タスクを実行し、81%の成功率を達成した。タスクごとに平均24件のデモを用い、微調整に15分間を要した。
- ドメイン適応なしに新しい環境やタスクに一般化に成功し、ホーム事前学習表現(HPR)の有効性を示した。
- 照明の変動や強い影が主な障害要因と特定され、失敗の15%が直接的に照明不良に起因していた。
- 専門知識のないユーザーによるデモは品質にばらつきがあり、22%のタスクで明確でないまたは一貫性のない行動のため、再収集が必要となった。
- 特にごちゃついたまたは複雑なシーンでは、深度認識やオクルージョン処理のセンサ制限が18%の失敗に寄与し、影響を及えた。
- ハードウェア設計、コード、データセット(RGBおよび深度を含む77 GB)、事前学習モデルを含むスタック全体をオープンソース化することで、完全な再現性とコミュニティによる拡張が可能になった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。