Skip to main content
QUICK REVIEW

[論文レビュー] A Learnable Self-supervised Task for Unsupervised Domain Adaptation on Point Clouds

Xiaoyuan Luo, Shaolei Liu|arXiv (Cornell University)|Apr 12, 2021
Human Pose and Action Recognition参考文献 32被引用数 11
ひとこと要約

本稿では、点群処理における教師なしドメイン適応(UDA)のための学習可能な自己教師付きタスクを提案する。ニューラルネットワークを用いて点群の一部を破壊・再構築する非線形変換を学習する。主な分類タスクとこの再構築に基づく自己教師付きタスクの間にエンコーダーを共有することで、移譲可能な局所特徴を学習し、PointDA-10およびPointSegDAベンチマークで最先端の性能を達成する。

ABSTRACT

Deep neural networks have achieved promising performance in supervised point cloud applications, but manual annotation is extremely expensive and time-consuming in supervised learning schemes. Unsupervised domain adaptation (UDA) addresses this problem by training a model with only labeled data in the source domain but making the model generalize well in the target domain. Existing studies show that self-supervised learning using both source and target domain data can help improve the adaptability of trained models, but they all rely on hand-crafted designs of the self-supervised tasks. In this paper, we propose a learnable self-supervised task and integrate it into a self-supervision-based point cloud UDA architecture. Specifically, we propose a learnable nonlinear transformation that transforms a part of a point cloud to generate abundant and complicated point clouds while retaining the original semantic information, and the proposed self-supervised task is to reconstruct the original point cloud from the transformed ones. In the UDA architecture, an encoder is shared between the networks for the self-supervised task and the main task of point cloud classification or segmentation, so that the encoder can be trained to extract features suitable for both the source and the target domain data. Experiments on PointDA-10 and PointSegDA datasets show that the proposed method achieves new state-of-the-art performance on both classification and segmentation tasks of point cloud UDA. Code will be made publicly available.

研究の動機と目的

  • 教師付き3次元点群学習における手動アノテーションの高コストを軽減するため、ターゲットドメインのラベルなしでドメイン一般化を実現すること。
  • 既存のUDA手法における手作業による自己教師付きタスクの限界を克服すること。
  • 破壊・再構築のための非線形変換を学習することで、ソースドメインとターゲットドメイン間の特徴の移譲性を向上させること。
  • マルチタスク学習フレームワークにおける共有エンコーダーを用いて、点群UDAベンチマークで最先端の性能を達成すること。

提案手法

  • 深層ニューラルネットワークを用いた学習可能な非線形変換を提案し、点群の一部を破壊する。この変換は意味的コンテンツを保持しつつ、複雑なバリエーションを生成する。
  • モデルが変換後のバージョンから元の点群を再構築するように学習する破壊・再構築の自己教師付きタスクを設計する。
  • 自己教師付きタスクをマルチタスクUDAフレームワークに統合し、主タスク(分類/セグメンテーション)と補助タスク(再構築)のための別々のヘッドを持つ共有エンコーダーを採用する。
  • 訓練中に局所的でより移譲可能な特徴に注目させるために、マルチリージョン変換を適用する。
  • ターゲットドメインからの疑似ラベルを用いて補助ネットワークを学習し、ソースデータとターゲットデータの両方で共同最適化を可能にする。
  • 敵対的学習を用いてエンコーダーを訓練し、両ドメインに適した堅牢でドメイン不変の特徴を生成する。

実験結果

リサーチクエスチョン

  • RQ1学習可能なニューラルベースの変換は、点群の自己教師付きUDAにおいて、手作業による破壊手法を上回ることができるか?
  • RQ2学習可能な再構築タスクを統合することで、点群分類およびセグメンテーションにおけるドメインシフトに伴う特徴の移譲性が向上するか?
  • RQ3マルチリージョン変換戦略は、UDAにおける性能と局所特徴学習にどのように影響を与えるか?
  • RQ4学習された変換は、ドメイン適応を超えて効果的なデータオーグメンテーション戦略として機能できるか?

主な発見

  • エンコーダーにPointNetを用いた場合、PointDA-10ベンチマークで66.5%の平均分類精度という、新たな最先端の結果を達成した。
  • DGCNNをエンコーダーとして用いた場合、PointDA-10で70.0%の平均精度という新たなSOTAを達成した。
  • 学習された変換は一般化性能を向上させ、データオーグメンテーション戦略として63.0%の平均精度を達成し、ほとんどの設定でベースラインおよび先行手法を上回った。
  • マルチリージョン変換戦略は、単一リージョン学習と比較して1.0%の精度向上を示し、局所特徴に注目する有効性を実証した。
  • ドメイン適応なしでも、自己教師付きタスク単体で63.5%の平均精度を達成し、ベースラインおよびPointDANやDefRecなどの先行手法を上回った。
  • PointSegDAベンチマークにおいても、分類およびセグメンテーションの両タスクで既存のSOTA手法を上回り、広範な適用可能性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。