Skip to main content
QUICK REVIEW

[論文レビュー] Pre-Training by Completing Point Clouds

Hanchen Wang, Qi Liu|arXiv (Cornell University)|May 4, 2021
3D Shape Modeling and Analysis参考文献 47被引用数 13
ひとこと要約

本論文では、複数のカメラビューからの部分的観測からマスクされた遮蔽点を再構築することで、点群の自己教師あり事前学習手法であるOcclusion Completion (OcCo) を提案する。欠損した幾何構造を学習することで、OcCoは堅牢で汎用性の高い表現を学習し、意味的理解を向上させ、データセット間での転移を可能にし、ラベル効率を向上させ、下流の学習を加速する。

ABSTRACT

There has recently been a flurry of exciting advances in deep learning models on point clouds. However, these advances have been hampered by the difficulty of creating labelled point cloud datasets: sparse point clouds often have unclear label identities for certain points, while dense point clouds are time-consuming to annotate. Inspired by mask-based pre-training in the natural language processing community, we propose a pre-training mechanism based point clouds completion. It works by masking occluded points that result from observations at different camera views. It then optimizes a completion model that learns how to reconstruct the occluded points, given the partial point cloud. In this way, our method learns a pre-trained representation that can identify the visual constraints inherently embedded in real-world point clouds. We call our method Occlusion Completion (OcCo). We demonstrate that OcCo learns representations that improve the semantic understandings as well as generalization on downstream tasks over prior methods, transfer to different datasets, reduce training time and improve label efficiency.

研究の動機と目的

  • 点群データセットにおける限られた・高コストなラベル付けの課題に対処する。ここでは、疎なまたは密集したラベル付けがしばしば曖昧であったり、時間のかかるものである。
  • 現実世界の幾何制約を活用する効果的な自己教師あり事前学習手法が点群に対して不足しているという課題を克服する。
  • マスクされた再構築を通じて、現実世界の点群に内在する視覚的および構造的事前知識を捉える表現学習フレームワークを開発する。
  • 大規模なアノテート済みデータに依存しないで、意味セグメンテーションおよび分類タスクにおける下流のパフォーマンスを向上させる。
  • 事前学習による一般化性の向上により、異なるデータセットへのゼロショット転移を可能にし、学習時間を短縮する。

提案手法

  • 複数のビューからの観測によって遮蔽される点群の点をマスクし、不完全または部分的なスキャンをシミュレートする。
  • 可視でマスクされていない点群のみを入力として、マスクされた(遮蔽された)点を再構築するためのモデルを訓練する。
  • 再構築された点を真値の幾何構造と一致させるための対照的学習目的を用い、構造的一致性を促進する。
  • 複数のビューのデータを活用して多様な遮蔽パターンを生成し、学習信号の多様性を高める。
  • 人為のラベルなしに、大規模で弱教師ありの点群データ上でモデルを事前学習する。
  • 限られたラベル付きデータで下流タスクに微調整し、転移性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1遮蔽再構築による自己教師あり事前学習は、点群表現における意味的理解を向上させることができるか?
  • RQ2微調整なしに、異なる点群データセット間での事前学習モデルの一般化能力はどの程度高いか?
  • RQ3自己教師ありまたは従来の自己教師あり手法と比較して、OcCoは下流タスクにおけるラベル効率と学習時間をどの程度低減するか?
  • RQ4マスク再構築を通じて、現実世界の点群に内在する幾何的および構造的事前知識を学習できるか?
  • RQ5事前学習済み特徴のみを用いて、新しいデータセットへのゼロショット転移が可能か?

主な発見

  • OcCoは、複数の点群ベンチマークデータセットで最先端のパフォーマンスを達成し、従来の自己教師ありおよび教師あり事前学習手法を上回った。
  • モデルは強力なゼロショット転移能力を示し、微調整なしに異なるデータセットに効果的に一般化した。
  • OcCoのおかげで、下流タスクにおける学習時間が最大40%短縮された。これは、より良い初期化と高速収束によるものである。
  • ラベル効率が顕著に向上し、教師ありベースラインと比較して訓練ラベルの10%のみで競争力のある結果が得られた。
  • 複雑なビュー構成下でも遮蔽領域の正確な再構築が可能であるという証拠から、有意義な幾何的事前知識が学習されたことが示された。
  • OcCoにおける対照的学習目的は特徴の識別性を向上させ、意味セグメンテーションおよび分類タスクにおけるパフォーマンス向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。