Skip to main content
QUICK REVIEW

[論文レビュー] ILabel: Interactive Neural Scene Labelling

Shuaifeng Zhi, Edgar Sucar|arXiv (Cornell University)|Nov 29, 2021
Robotics and Sensor-Based Localization参考文献 35被引用数 18
ひとこと要約

iLabel は、超希少なユーザーのクリックからの幾何学的形状、色彩、意味的情報を統合的に表現するニューラルフィールドを用いて、事前学習データを一切必要とせず、インタラクティブでリアルタイムな3Dシーンラベリングを実現する。わずか数十回のクリックで事前学習モデルを上回る高い意味的ラベリング精度を達成し、Replica などの低データ環境でも最先端の手法を凌駆する。また、オープンセットラベリングと不確実性を考慮した手動クリックを最小限に抑えたアノテーションをサポートする。

ABSTRACT

Joint representation of geometry, colour and semantics using a 3D neural field enables accurate dense labelling from ultra-sparse interactions as a user reconstructs a scene in real-time using a handheld RGB-D sensor. Our iLabel system requires no training data, yet can densely label scenes more accurately than standard methods trained on large, expensively labelled image datasets. Furthermore, it works in an 'open set' manner, with semantic classes defined on the fly by the user. ILabel's underlying model is a multilayer perceptron (MLP) trained from scratch in real-time to learn a joint neural scene representation. The scene model is updated and visualised in real-time, allowing the user to focus interactions to achieve efficient labelling. A room or similar scene can be accurately labelled into 10+ semantic categories with only a few tens of clicks. Quantitative labelling accuracy scales powerfully with the number of clicks, and rapidly surpasses standard pre-trained semantic segmentation methods. We also demonstrate a hierarchical labelling variant.

研究の動機と目的

  • 最小限の人的介入で、特に低データ環境や未知の環境においても正確で高密度な3D意味的ラベリングを可能にすること。
  • 大規模で事前にアノテートされたデータセットに依存しないように、ユーザーが提供するクリックのみでリアルタイムにスクラッチから訓練するニューラルフィールドを構築すること。
  • スキャン中にユーザーが即座に新しいカテゴリを定義できる、オープンセット意味的ラベリングをサポートすること。
  • リアルタイムの視覚フィードバックと予測のインタラクティブな修正を可能にすることで、ユーザーの作業効率を向上させること。
  • 不確実性を考慮したピクセル選択によるハンドフリーなラベリングの探索により、手動クリックの負担を軽減すること。

提案手法

  • スクラッチから訓練されたマルチレイヤーパーセプトロン(MLP)を用いて、リアルタイムのニューラルフィールド SLAM システムにより、幾何学的形状、外観、意味的情報を統合的に表現する3D表現を構築する。
  • キーフレーム画像へのスパarsityなユーザーのクリックを統合して意味的予測を監視し、ニューラルフィールドのインダクティブバイアスを介してシーン全体に予測を伝搬する。
  • リアルタイムでの予測レンダリングを実装し、ユーザーのフィードバックを組み込むインタラクションを可能にし、誤りの修正や新しいクラスの追加を可能にする。
  • 意味的出力を二分木の枝構造として解釈することで、階層的なラベリング戦略を採用し、構造的な分類を実現する。
  • クリックなしで不確実性サンプリングを用いて、ユーザーのアノテーション対象となる不確実なピクセルを選択する自動クエリ生成モードを実装する。
  • 空間的連続性を持つビュー基準のニューラル表現を活用し、幾何的およびテクスチャ的領域にわたる一般化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1事前学習された大規模データセットに依存せずに、超希少なユーザーインタラクションからのニューラルフィールド表現が高密度な意味的ラベリングを可能にするか?
  • RQ2リアルタイムでインタラクティブなシステムにおいて、ユーザーのクリック数が増加するに従い、事前学習モデルと比較してラベリング精度がどのように変化するか?
  • RQ3スキャン中にユーザーが新しいカテゴリを定義できる、オープンセット意味的ラベリングをサポートできるか?
  • RQ4不確実性を考慮した自動クエリ生成は、正確性を維持しつつ、手動クリックの入力量をどれほど削減できるか?
  • RQ5ニューラルフィールドのインダクティブバイアスは、複雑な現実世界のシーンにおいても、頑健かつ正確な意味的伝搬を可能にするか?

主な発見

  • Replica データセット(微調整用に7つのシーンしか存在しない低データ環境)において、iLabel はわずか20回のクリックで最先端の事前学習済みRGB-Dセグメンテーションモデル(SA-Gate)を上回る性能を達成した。
  • ScanNet データセットでは、iLabel は約50回のクリックで事前学習ベースラインと同等の精度に達し、120回のクリックで20%以上優れた精度を示した。
  • 自動クエリ生成モードは、手動クリックと同等の性能を達成したが、約240回のクリックを要した。これは、直接的なユーザーインタラクションの効率性を示している。
  • ランダムピクセルサンプリングは、不確実性を考慮した選択に比べて、特にラベルが増えるにつれて劣った性能を示し、知的なサンプリングの重要性を裏付けた。
  • 統合的ニューラルフィールド表現のおかげで、類似するインタラクティブシステムである SemanticPaint よりもより正確で包括的なセグメンテーションを生成した。
  • 140回のクリックで、複雑な現実世界の環境においても、正確な全ルーム意味的メッシュラベリングを実現し、スケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。