Skip to main content
QUICK REVIEW

[논문 리뷰] Dataset and Performance Comparison of Deep Learning Architectures for Plum Detection and Robotic Harvesting

Jasper Brown, Salah Sukkarieh|arXiv (Cornell University)|2021. 05. 09.
Smart Agriculture and AI참고 문헌 29인용 수 4
한 줄 요약

이 논문은 일상적인 로봇 살구 수확 과정에서 일광 및 야간 조건 하에 수집한 두 가지 새로운 RGB-D 데이터셋을 소개하며, 네 가지 딥러닝 객체 검출기(RetinaNet, Faster R-CNN, YOLOv3, CenterNet)를 벤치마킹한다. 전이 학습은 소규모 데이터셋에서 필수적임을 발견하였고, 일부 모델에서 야간 검출 성능이 일광 조건보다 더 높았으며, RGBD 융합은 유의미한 성능 향상이 없었고, 데이터 증강이 깊이 통합보다 더 효과적임을 확인하였다.

ABSTRACT

Many automated operations in agriculture, such as weeding and plant counting, require robust and accurate object detectors. Robotic fruit harvesting is one of these, and is an important technology to address the increasing labour shortages and uncertainty suffered by tree crop growers. An eye-in-hand sensing setup is commonly used in harvesting systems and provides benefits to sensing accuracy and flexibility. However, as the hand and camera move from viewing the entire trellis to picking a specific fruit, large changes in lighting, colour, obscuration and exposure occur. Object detection algorithms used in harvesting should be robust to these challenges, but few datasets for assessing this currently exist. In this work, two new datasets are gathered during day and night operation of an actual robotic plum harvesting system. A range of current generation deep learning object detectors are benchmarked against these. Additionally, two methods for fusing depth and image information are tested for their impact on detector performance. Significant differences between day and night accuracy of different detectors is found, transfer learning is identified as essential in all cases, and depth information fusion is assessed as only marginally effective. The dataset and benchmark models are made available online.

연구 동기 및 목표

  • 변동하는 조도 및 가림 조건에서 로봇 과일 수확 작업에 적용 가능한 현실적인 응용 중심의 데이터셋이 부족한 문제를 해결하기 위해.
  • 실제 일상적인 일광 및 야간 수확 조건에서 최신 딥러닝 객체 검출기(RetinaNet, Faster R-CNN, YOLOv3, CenterNet)의 성능을 평가하기 위해.
  • 초기 융합 및 후기 융합 전략을 사용한 RGB 및 깊이 데이터 융합이 검출 성능에 미치는 영향을 평가하기 위해.
  • 소규모 农업 데이터셋에서 검출기 정확도를 향상시키기 위해 전이 학습과 데이터 증강의 역할을 평가하기 위해.
  • 향후 농업 로봇 기술 및 과일 검출 분야의 연구를 지원하기 위해 공개된 데이터셋과 훈련된 모델를 제공하기 위해.

제안 방법

  • Intel Realsense D435 카메라를 사용하여 눈-핸드 로봇 살구 수확 시스템에서 700장의 레이블이 부여된 RGB-D 이미지(일광 350장, 야간 350장)를 수집하였다.
  • 일광 및 야간 데이터셋에서 네 가지 딥러닝 객체 검출 아키텍처(RetinaNet, Faster R-CNN, YOLOv3, CenterNet)를 훈련 및 평가하였다.
  • 두 가지 RGBD 융합 전략을 구현: 초기 융합(깊이 및 RGB를 4채널 입력으로 병합) 및 후기 융합(병렬된 RGB 및 깊이 백본에서 추출한 특징을 병합).
  • 소규모 데이터셋에서의 성능 향상을 위해 ImageNet 사전 훈련 가중치를 사용한 전이 학습과 데이터 증강(임의의 자르기, 색상 왜곡)을 적용하였다.
  • 모든 모델 및 구성에서 검출 성능 평가를 위해 0.5 IOU 임계값에서의 평균 정밀도(mAP)를 사용하였다.
  • 백본 아키텍처, 전이 학습, 융합 전략이 검출 정확도에 미치는 영향을 분리하여 분석하기 위해 분석 실험을 수행하였다.

실험 결과

연구 질문

  • RQ1최신 딥러닝 객체 검출기는 일광 및 야간 조건에서 실제 로봇 살구 수확 데이터에서 어떻게 성능을 발휘하는가?
  • RQ2소규모 농업 데이터셋에서 훈련할 경우 전이 학습이 검출기 성능에 어떤 영향을 미치는가?
  • RQ3RGB 및 깊이 데이터의 초기 융합 또는 후기 융합이 로봇 수확 환경에서의 객체 검출 정확도를 향상시키는가?
  • RQ4야간 조건에서 시야가 제한되고 가려진 과일이 많음에도 불구하고, 일광 및 야간 데이터셋 간 성능 차이가 모델에 따라 크게 달라지는 이유는 무엇인가?
  • RQ5이 커스터마이징된 데이터셋에서 모델의 성능은 COCO 벤치마크에서 보고된 성능과 비교해 볼 때 어떻게 다를까?

주요 결과

  • 모든 모델에서 전이 학습이 필수적이었으며, 소규모 데이터셋에서 성능 향상에 크게 기여하였고, 아키텍처 선택보다 더 큰 영향을 미쳤다.
  • Faster R-CNN은 야간 데이터셋에서 가장 높은 평균 정밀도를 기록하여(mAP 0.78), YOLOv3 및 RetinaNet과 같은 더 현대적이고 빠른 네트워크보다 뛰어난 성능을 보였다.
  • RetinaNet은 ResNet-101 백본을 사용하고 데이터 증강 및 전이 학습을 적용했을 때 일광 데이터셋에서 가장 높은 mAP(0.82)를 기록하였다.
  • RGB 및 깊이 특징의 후기 융합은 RGB 전용 기준보다 약간의 성능 향상을 보였지만, 초기 융합은 성능을 떨어뜨렸다.
  • 데이터 증강은 깊이 융합보다 더 큰 성능 향상을 가져왔으며, 깊이 정보를 추가하는 것보다 RGB 데이터셋을 확장하는 것이 더 효과적임을 시사한다.
  • CenterNet는 COCO에서 높은 mAP를 기록했음에도 불구하고, 두 데이터셋 모두에서 성능이 열악하여 COCO 성능이 농업 검출 작업에 대한 신뢰할 수 있는 예측 지표가 아니라는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.