Skip to main content
QUICK REVIEW

[논문 리뷰] Image Segmentation for Fruit Detection and Yield Estimation in Apple Orchards

Suchet Bargoti, James Underwood|arXiv (Cornell University)|2016. 10. 25.
Smart Agriculture and AI참고 문헌 39인용 수 5
한 줄 요약

이 논문은 단안 UGV 촬영 영상에서 사과 농장의 과일 탐지 및 수확량 추정을 위한 딥러닝 기반 영상 분할 프레임워크를 제시한다. 다중 척도 MLP 및 CNN 아키텍처에 메타데이터(예: 카메라 위치, 태양 각도)를 통합함으로써 픽셀 단위의 분할 성능과 과일 수 세기 정확도를 향상시켰으며, 추정된 수확량과 실제 수확량 간의 상관계수 제곱값이 r² = 0.826에 도달하였다.

ABSTRACT

Ground vehicles equipped with monocular vision systems are a valuable source of high resolution image data for precision agriculture applications in orchards. This paper presents an image processing framework for fruit detection and counting using orchard image data. A general purpose image segmentation approach is used, including two feature learning algorithms; multi-scale Multi-Layered Perceptrons (MLP) and Convolutional Neural Networks (CNN). These networks were extended by including contextual information about how the image data was captured (metadata), which correlates with some of the appearance variations and/or class distributions observed in the data. The pixel-wise fruit segmentation output is processed using the Watershed Segmentation (WS) and Circular Hough Transform (CHT) algorithms to detect and count individual fruits. Experiments were conducted in a commercial apple orchard near Melbourne, Australia. The results show an improvement in fruit segmentation performance with the inclusion of metadata on the previously benchmarked MLP network. We extend this work with CNNs, bringing agrovision closer to the state-of-the-art in computer vision, where although metadata had negligible influence, the best pixel-wise F1-score of $0.791$ was achieved. The WS algorithm produced the best apple detection and counting results, with a detection F1-score of $0.858$. As a final step, image fruit counts were accumulated over multiple rows at the orchard and compared against the post-harvest fruit counts that were obtained from a grading and counting machine. The count estimates using CNN and WS resulted in the best performance for this dataset, with a squared correlation coefficient of $r^2=0.826$.

연구 동기 및 목표

  • 상업용 사과 농장에서 지상 기반 단안 시각 기반 자동 영상 처리 파이프라인 개발을 목적으로 한다.
  • 일반적인 딥러닝 모델(ms-MLP 및 CNN)을 사용하여 엔드 투 엔드 영상 분할을 위한 수작업 특징 추출에 의존도를 줄인다.
  • 카메라 경로, 태양 위치 등 맥락적 메타데이터를 학습 과정에 통합함으로써 분할 및 탐지 성능을 향상시킨다.
  • 실제 수확 후 등급 분류 기계에서 확보한 기준값과 비교하여 프레임워크의 정확도를 평가함으로써 신뢰할 수 있는 수확량 맵핑을 가능하게 한다.

제안 방법

  • 농장 환경 영상에서 과일의 픽셀 단위 분할을 위해 다중 척도 다층 퍼셉트론(ms-MLP)과 컨볼루션 신경망(CNN)을 활용하였다.
  • ms-MLP 및 CNN 모델의 입력 특징에 픽셀 위치, 로우 번호, 카메라 대비 태양 위치 등의 메타데이터를 통합하여 외관 변화를 모델링하였다.
  • 과일 개별 탐지 및 수세기 위해 분할 출력 결과를 워터셰드 분할(WS) 및 원형 허프 변환(CHT)으로 후처리하였다.
  • 실제 수확 후 등급 분류 기계에서 확보한 수확량과 이미지 기반 수량을 교정하여 수확량 추정 정확도를 평가하였다.
  • 자연 조명 하에서 촬영된 0.5ha 크기의 사과 농장 데이터셋을 사용하여 모델을 훈련시켰으며, 다양한 조명 조건과 가림 현상이 있는 빨간색,粉록-초록색, 초록색 등 다양한 품종을 포함하였다.
  • 전이 학습 원칙을 적용한 사전 학습된 CNN을 사용하여 메타데이터 의존도가 낮아도 최신 기술 수준의 분할 성능를 달성하였다.

실험 결과

연구 질문

  • RQ1딥러닝 모델에 메타데이터를 통합함으로써 실세계 농장 영상에서 과일 픽셀 단위 분할 성능을 향상시킬 수 있는가?
  • RQ2메타데이터 통합이 ms-MLP와 CNN 아키텍처 간 과일 분할 작업에서 성능에 미치는 영향은 어떠한가?
  • RQ3워터셰드 분할(WS)과 원형 허프 변환(CHT) 중 어느 후처리 알고리즘이 더 정확한 개별 과일 탐지 및 수세기 성능을 보이는가?
  • RQ4이 프레임워크를 사용할 경우 이미지 기반 수량과 실제 수확 후 수량 간 상관관계는 어느 정도이며, 수확량 추정의 가능 정확도는 얼마인가?

주요 결과

  • 메타데이터 통합은 ms-MLP 네트워크의 분할 성능 향상에 기여하였으며, 이는 메타데이터가 더 적은 학습 예제로도 단순 모델이 보다 잘 일반화되도록 돕는다는 것을 시사한다.
  • CNN 모델은 0.791의 최고 픽셀 단위 분할 F1 스코어를 기록하였으며, 메타데이터의 영향은 미미하여 CNN이 메타데이터 안내 없이도 복잡한 시각 패턴을 내재적으로 포착할 수 있음을 시사한다.
  • 워터셰드 분할(WS)이 원형 허프 변환(CHT)보다 과일 탐지 성능에서 뛰어나, 탐지 F1 스코어 0.858을 기록하였다.
  • CNN 기반 분할과 WS 기반 탐지의 조합이 가장 뛰어난 수확량 추정 성능을 보였으며, 이미지 기반 수량과 실제 수확 후 수량 간 상관계수 제곱값이 r² = 0.826에 도달하였다.
  • 1232×1616 해상도 이미지당 예측 시간이 약 7초로 측정되어 로봇 플랫폼에 실시간 구동 가능성을 보였다.
  • 이 프레임워크는 추가적인 데이터 수집 없이도 정확하고 비파괴적이며 확장 가능한 수확량 맵핑을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.