[논문 리뷰] In-Field 3D Wheat Head Instance Segmentation From TLS Point Clouds Using Deep Learning Without Manual Labels
두 단계 파이프라인은 TLS 포인트 클라우드에서 3D 밀 머리 인스턴스를 제로샷 2D 기초 모델로 제안한 다음, 가짜 라벨로 학습된 3D 팬토픽 스타일 네트워크를 훈련시켜 수작업 주석 없이 경쟁력 있는 3D 밀 머리 분할을 달성한다.
3D instance segmentation for laser scanning (LiDAR) point clouds remains a challenge in many remote sensing-related domains. Successful solutions typically rely on supervised deep learning and manual annotations, and consequently focus on objects that can be well delineated through visual inspection and manual labeling of point clouds. However, for tasks with more complex and cluttered scenes, such as in-field plant phenotyping in agriculture, such approaches are often infeasible. In this study, we tackle the task of in-field wheat head instance segmentation directly from terrestrial laser scanning (TLS) point clouds. To address the problem and circumvent the need for manual annotations, we propose a novel two-stage pipeline. To obtain the initial 3D instance proposals, the first stage uses 3D-to-2D multi-view projections, the Grounded SAM pipeline for zero-shot 2D object-centric segmentation, and multi-view label fusion. The second stage uses these initial proposals as noisy pseudo-labels to train a supervised 3D panoptic-style segmentation neural network. Our results demonstrate the feasibility of the proposed approach and show performance improvementsrelative to Wheat3DGS, a recent alternative solution for in-field wheat head instance segmentation without manual 3D annotations based on multi-view RGB images and 3D Gaussian Splatting, showcasing TLS as a competitive sensing alternative. Moreover, the results show that both stages of the proposed pipeline can deliver usable 3D instance segmentation without manual annotations, indicating promising, low-effort transferability to other comparable TLS-based point cloud segmentation tasks.
연구 동기 및 목표
- TLS 포인트 클라우드에서의 복잡한 현장 밀 머리의 3D 인스턴스 분할 문제를 수작업 3D 주석 없이 해결한다.
- 다중 시점 투영을 통한 2D 기초 모델을 활용하여 초기 3D 제안(Stage-I)을 생성하고, 가짜 라벨로 학습된 3D 팬토픽 스타일 네트워크(Stage-II)로 정교화한다.
- TLS 기반 분할과 Wheat3DGS를 비교하고 TLS 데이터에 대한 제로샷 전이 가능성을 평가한다.
- 혼잡한 덩굴성 식생 환경에서 두 단계 학습이 유용한 3D 인스턴스 분할을 달성할 수 있음을 입증한다.
제안 방법
- Stage-I: 다중 시점 프로젝션을 통해 스캔당 TLS 포인트 클라우드를 2D 거리 및 강도 이미지로 변환하고; 텍스트 프롬프트를 사용하여 Grounded-SAM으로 2D 인스턴스 마스크를 생성한다; 마스크를 3D로 다시 투영하고; 제안들을 그래프 기반 클러스터링(kNN + IoU 가지치기, 삼각형 기반 가중치) 및 Highly Connected Sub-graphs를 활용해 3D 인스턴스 제안을 산출한다.
- Stage-II: Stage-I 출력으로부터 얻은 가짜 라벨로 3D 팬토픽 스타일 네트워크를 학습시키되 Minkowski-Engine 백본을 사용하고 의미론, 인스턴스 클러스터링, 구분 임베딩(heads)를 포함한 헤드를 적용한다; Stage-I 라벨을 합치기 위한 질의 포인트 클라우드로 전이하고 학습 전에 라벨 정제를 수행하며; 구면 수준 예측을 하나의 장면 결과로 병합한다.
- Interface between stages: Pt라는 합병 포인트 클라우드와 Pq라는 질의 포인트를 생성하고; Stage-I 라벨을 dp 거리 내 가장 가까운 이웃 보간으로 Pt로 전이시킨 뒤; 가중치 투표와 인스턴스별 투표로 라벨을 정제하여 Ptq를 만들어 학습 및 평가에 사용한다.
- Evaluation은 가려짐으로 인해 현장 3D 포인트 당 하나의 간접적인 지상 진실 주석(희소한 3D 주석)을 사용하며; 지표로는 TP/FP/FN, 정밀도, 재현율, F1, 계산 오차(CE), 상대 계산 오차(RCE)를 사용한다.
- 이 파이프라인은 대규모 LiDAR 데이터의 팬토픽 분할에 대한 기존 방법을 TLS 데이터에 맞춰 조정하고, 초기 제안을 위해 제로샷 2D 기초 모델을 활용한다.

실험 결과
연구 질문
- RQ1제로샷 2D 기초 모델(Grounded SAM)이 수작업 3D 주석 없이 TLS 포인트 클라우드에서 usable한 3D 밀 머리 제안을 생성할 수 있는가?
- RQ2Stage-II의 3D 팬토픽 스타일 네트워크가 Stage-I 가짜 라벨로 TLS 현장 데이터의 3D 밀 머리 인스턴스 분할을 개선하는가?
- RQ3TLS 기반 파이프라인이 현장 밀 머리 인스턴스 분할에서 Wheat3DGS 이미지 기반 기준선과 비교했을 때 어떤 차이가 있는가?
- RQ4Stage-I와 Stage-II가 상호 보완적인가, 그리고 두 출력의 합치기가 탐지 및 수 카운트 성능을 향상시키는가?
주요 결과
- TLS 기반 파이프라인은 선택된 메트릭에서 Wheat3DGS 이미지 기반 기준선보다 우수한 성능을 보이며, 보류된 테스트 플롯에서 F1 스코어가 더 높다.
- Stage-II는 모든 보고된 메트릭에서 Stage-I에 비해 측정 가능한 개선을 제공하며, Stage-I과 Stage-II(I+II)를 결합한 변형들 중 재현율과 F1이 최적으로 나타난다.
- Stage-I과 Stage-II는 서로 다른 하위 집합의 머리를 탐지하며, 한 단계에서 탐지되고 다른 단계에서 놓치는 경우가 있어 서로의 보완적 강점을 시사한다.
- 밀도 높은 클러스터에서 분할 미완성이 주요 실패 모드이고, Stage-II는 분포 외(head)에서는 성능이 저하될 수 있어 향상된 증강 및 후처리의 기회가 있음을 시사한다.
- 저자들은 TLS 데이터에 대해 제로샷 3D 인스턴스 분할이 가능하다는 실질적인 접근법을 제시하며, 다른 TLS 기반 분할 작업으로의 전이 가능성을 강조한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.