Skip to main content
QUICK REVIEW

[論文レビュー] All You Need is LUV: Unsupervised Collection of Labeled Images using Invisible UV Fluorescent Indicators

Brijen Thananjeyan, Justin Kerr|arXiv (Cornell University)|Mar 9, 2022
Robot Manipulation and Learning被引用数 5
ひとこと要約

本論文では、目に見えないUV蛍光マークとペアの可視/UV撮影を用いて、人間によるラベル付けなしで現実世界のラベル付き画像を収集する低コストで非教師ありの手法LUVを紹介する。UV反射性ペイントと自動カラーストリッピングを活用することで、LUVは人間によるラベル付けに比べて180~2,500倍の高速なデータ収集を実現し、セマンティックセグメンテーションマスクとキーポイントを生成する。これらのラベルは、ペイントされていない物体に対しても高い精度で一般化でき、タオルのたたみやニードルの姿勢推定を含むロボット操作タスクで検証された。

ABSTRACT

Large-scale semantic image annotation is a significant challenge for learning-based perception systems in robotics. Current approaches often rely on human labelers, which can be expensive, or simulation data, which can visually or physically differ from real data. This paper proposes Labels from UltraViolet (LUV), a novel framework that enables rapid, labeled data collection in real manipulation environments without human labeling. LUV uses transparent, ultraviolet-fluorescent paint with programmable ultraviolet LEDs to collect paired images of a scene in standard lighting and UV lighting to autonomously extract segmentation masks and keypoints via color segmentation. We apply LUV to a suite of diverse robot perception tasks to evaluate its labeling quality, flexibility, and data collection rate. Results suggest that LUV is 180-2500 times faster than a human labeler across the tasks. We show that LUV provides labels consistent with human annotations on unpainted test images. The networks trained on these labels are used to smooth and fold crumpled towels with 83% success rate and achieve 1.7mm position error with respect to human labels on a surgical needle pose estimation task. The low cost of LUV makes it ideal as a lightweight replacement for human labeling systems, with the one-time setup costs at $300 equivalent to the cost of collecting around 200 semantic segmentation labels on Amazon Mechanical Turk. Code, datasets, visualizations, and supplementary material can be found at https://sites.google.com/berkeley.edu/luv

研究の動機と目的

  • ロボットビジョンタスクにおける人間によるアノテーションデータセットの高コストと非効率性を解消すること。
  • 現実世界でのデータ収集を人間の監視なしに可能にすることで、シミュレーションから現実への一般化ギャップを克服すること。
  • 現実の操作環境で正確なセマンティックセグメンテーションマスクとキーポイントアノテーションを収集するためのスケーラブルで低コストなフレームワークの開発。
  • 変形しやすい物体の操作や手術用ツールのセグメンテーションなど、視覚的に困難な複雑なタスクにおける迅速かつ繰り返し可能なデータ収集を可能にすること。
  • LUVによって生成されたラベルが、ペイントされていない現実世界のテスト画像に対しても、人間によるラベル付けのベースラインに近い性能を示す一般化の良さを実証すること。

提案手法

  • 物体やキーポイントを透明でUV蛍光性のペイントでマークし、通常の照明下ではほとんど見えない状態にする。
  • 可視光照明下と紫外線(UV)照明下の両方で画像を撮影し、ペアの画像を取得する。
  • UV画像に対してカラーベースのセグメンテーションを適用し、正確なセグメンテーションマスクとキーポイント位置を自動抽出する。
  • UV画像から自動抽出されたラベルを用いてディープラーニングベースのセグメンテーションネットワークを学習させ、通常の可視光画像に対してマスクを予測する。
  • UV LEDと標準のRGBカメラといった市販部品を活用することで、300ドル程度の低コストで再現可能なシステムを構築する。
  • 非反射性で透明なUVペイントを用いることで、通常の照明下での物体の視覚的外観に影響を与えないようにし、ラベル付けの一貫性を確保する。

実験結果

リサーチクエスチョン

  • RQ1UV蛍光マークを用いることで、人間の干渉を最小限に抑え、完全に非教師ありの現実世界でのセマンティックセグメンテーションのデータ収集が可能になるか?
  • RQ2LUVによって生成されたラベルの品質は、交差率(IoU)と下流タスクのパフォーマンスの観点から、人間によるラベル付けと比べてどの程度か?
  • RQ3LUVラベルで学習したモデルが、複雑な操作タスクにおけるペイントされていない現実世界のテスト画像にどの程度一般化できるか?
  • RQ4LUVのデータ収集速度は、多様なロボットビジョンタスクにおいて人間によるラベル付けと比べてどの程度速いか?
  • RQ5LUVラベルは、サブミリメートルの精度を要求する高精度タスク、例えば3次元ニードルの姿勢推定をサポートできるか?

主な発見

  • LUVは、人間によるラベル付けに比べてデータ収集時間を180~2,511倍短縮し、全ケーブルデータセットのラベル付けに87秒で完了したのに対し、手作業では約60時間かかった。
  • LUVによって生成されたマスクと人間によるラベル付けのマスクとの間の平均交差率(IoU)は、トレーニング画像で0.683であり、良好なラベルの一貫性を示している。
  • ペイントされていないテスト画像では、LUVラベルで学習したモデルが、ケーブルで0.755、ニードルで0.666の平均IoUを達成し、現実世界のペイントされていない物体への強い一般化能力を示している。
  • タオルのたたみタスクでは、LUVラベルからのコーナー検出を用いて83%の成功率を達成し、実際のロボット制御における実用性を示している。
  • 手術用ニードルの姿勢推定において、LUVベースの予測と人間によるラベル付けの姿勢との平均位置誤差は1.7mm、回転誤差は8.8°であり、微細なタスクにおいて高い精度を示している。
  • LUVシステムにより、3,640枚のラベル付きファブリック画像、486枚のケーブル画像、1,364枚のニードル画像を収集し、すべてのデータセットを再現可能性およびさらなる研究のため公開した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。