[論文レビュー] In-Field 3D Wheat Head Instance Segmentation From TLS Point Clouds Using Deep Learning Without Manual Labels
2段階のパイプラインがゼロショット2Dファウンデーションを用いてTLS点群から3D小麦穂インスタンスを提案し、疑似ラベルで訓練された3Dパンオプティック風ネットワークを用いて、手動アノテーションなしで競合的な3D小麦穂セグメンテーションを実現する。
3D instance segmentation for laser scanning (LiDAR) point clouds remains a challenge in many remote sensing-related domains. Successful solutions typically rely on supervised deep learning and manual annotations, and consequently focus on objects that can be well delineated through visual inspection and manual labeling of point clouds. However, for tasks with more complex and cluttered scenes, such as in-field plant phenotyping in agriculture, such approaches are often infeasible. In this study, we tackle the task of in-field wheat head instance segmentation directly from terrestrial laser scanning (TLS) point clouds. To address the problem and circumvent the need for manual annotations, we propose a novel two-stage pipeline. To obtain the initial 3D instance proposals, the first stage uses 3D-to-2D multi-view projections, the Grounded SAM pipeline for zero-shot 2D object-centric segmentation, and multi-view label fusion. The second stage uses these initial proposals as noisy pseudo-labels to train a supervised 3D panoptic-style segmentation neural network. Our results demonstrate the feasibility of the proposed approach and show performance improvementsrelative to Wheat3DGS, a recent alternative solution for in-field wheat head instance segmentation without manual 3D annotations based on multi-view RGB images and 3D Gaussian Splatting, showcasing TLS as a competitive sensing alternative. Moreover, the results show that both stages of the proposed pipeline can deliver usable 3D instance segmentation without manual annotations, indicating promising, low-effort transferability to other comparable TLS-based point cloud segmentation tasks.
研究の動機と目的
- TLS点群における複雑な畑内小麦穂の3Dインスタンスセグメンテーションを手動3Dアノテーションなしで課題として解決する。
- マルチビュー投影を介して2Dファウンデーションモデルを活用し、初期提案を生成(Stage-I)し、疑似ラベルで訓練した3Dパンオプティック風ネットワークで洗練する(Stage-II)。
- TLSベースのセグメンテーションをWheat3DGSと比較し、TLSデータへのゼロショット移行性を評価する。
- 二段階学習が混雑した樹冠シーンで実用的な3Dインスタンスセグメンテーションを得られることを示す。
提案手法
- Stage-I: レーダー厳密化されたTLS点群をマルチビュー投影により2Dレンジ画像と強度画像へ変換する。Grounded-SAMをテキストプロンプト付きで適用し2Dインスタンスマスクを生成し、マスクを3Dへ投影する。マスク提案をグラフベースのクラスタリング(kNN + IoUプルーニング、三角形ベースの重み付け)と高度に連結されたサブグラフで統合し、3Dインスタンス提案を作成する。
- Stage-II: Stage-Iの出力から得られた疑似ラベルを用いてMinkowski-Engineバックボーンを用いる3Dパンオプティック風ネットワークを訓練し、意味論、インスタンスクラスタリング、識別埋め込みヘッドを備える。Stage-Iのラベルを統合クエリ点群へ転送し、訓練前にラベル補正を行う。球体レベルの予測を単一のシーン結果へ統合する。
- Stage間のインターフェース: merged点群 Pt と query点群 Pq を作成する。Stage-Iラベルをdp以内の最近傍補間でPtへ転送する。重み付き投票とインスタンスごとの投票でラベルを補正し Ptq を訓練・評価用に形成する。
- 評価は遮蔽のために道具としてスパースな地上真実アノテーション(小麦穂1つにつき1点の3D点)を用い、指標はTP/FP/FN、精度、リコール、F1、カウント誤差(CE)、相対カウント誤差(RCE)を含む。
- このパイプラインは大規模LiDARデータのパンオプティックセグメンテーションの既存手法を踏襲し、TLSデータへ適用し、初期提案にはゼロショット2Dファウンデーションモデルを使用する。

実験結果
リサーチクエスチョン
- RQ1ゼロショットの2Dファウンデーションモデル(Grounded SAM)は、手動の3DアノテーションなしでTLS点群から有用な3D小麦穂提案を生成できるか?
- RQ2Stage-IIのStage-I疑似ラベルを訓練した3Dパンオプティック風ネットワークは、混雑した畑内TLSデータで3D小麦穂インスタンスセグメンテーションを改善するか?
- RQ3TLSベースのパイプラインは畑内小麦穂インスタンスセグメンテーションのWheat3DGS画像ベースのベースラインとどう比較されるか?
- RQ4Stage-IとStage-IIは補完的で、両方の出力を統合すると検出とカウント性能は向上するか?
主な発見
- TLSベースのパイプラインは、特定の指標でWheat3DGS画像ベースのベースラインを上回り、ホールドアウトテストプロットでF1スコアが高い。
- Stage-IIはStage-Iより全指標で測定可能な改善を提供し、Stage-IとStage-IIを組み合わせたI+IIは再現率とF1で最も良い成績を示した。
- Stage-IとStage-IIは異なる頭部サブセットを検出しており、あるインスタンスは一方のステージで検出され他方で見逃されることがあり、相補的な強みを示唆する。
- 密集したクラスタでは過小セグメンテーションが顕著な失敗モードであり、Stage-IIは分布外の頭部に対して苦戦するため、強化された拡張とポスト処理の改善の機会がある。
- 著者らはTLSデータに対する実用的なゼロショット3Dインスタンスセグメンテーション手法を実証し、他のTLSベースのセグメンテーションタスクへの移植可能性を示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。