Skip to main content
QUICK REVIEW

[논문 리뷰] Presenting an extensive lab- and field-image dataset of crops and weeds for computer vision tasks in agriculture

Michael A. Beck, Chenyi Liu|arXiv (Cornell University)|2021. 08. 12.
Smart Agriculture and AI참고 문헌 29인용 수 9
한 줄 요약

이 논문은 식물 종류로 레이블이 지정되고 식물 연령, 생장 단계 및 환경 조건 등의 메타데이터로 풍부하게 보완된, 120만 장이 넘는 실험실에서 재배된 식물 이미지와 54만 장의 현장에서 재배된 식물 이미지를 포함하는 두 가지 대규모 공개 데이터셋을 제시한다. 이 데이터셋들은 농업 분야의 컴퓨터 비전 연구를 지원하며, 1만 4천 장의 오픈 액세스 서브샘플을 통해 종 분류 및 잡초-작물 구분을 위한 빠른 모델 프로토타이핑을 가능하게 한다.

ABSTRACT

We present two large datasets of labelled plant-images that are suited towards the training of machine learning and computer vision models. The first dataset encompasses as the day of writing over 1.2 million images of indoor-grown crops and weeds common to the Canadian Prairies and many US states. The second dataset consists of over 540,000 images of plants imaged in farmland. All indoor plant images are labelled by species and we provide rich etadata on the level of individual images. This comprehensive database allows to filter the datasets under user-defined specifications such as for example the crop-type or the age of the plant. Furthermore, the indoor dataset contains images of plants taken from a wide variety of angles, including profile shots, top-down shots, and angled perspectives. The images taken from plants in fields are all from a top-down perspective and contain usually multiple plants per image. For these images metadata is also available. In this paper we describe both datasets' characteristics with respect to plant variety, plant age, and number of images. We further introduce an open-access sample of the indoor-dataset that contains 1,000 images of each species covered in our dataset. These, in total 14,000 images, had been selected, such that they form a representative sample with respect to plant age and ndividual plants per species. This sample serves as a quick entry point for new users to the dataset, allowing them to explore the data on a small scale and find the parameters of data most useful for their application without having to deal with hundreds of thousands of individual images.

연구 동기 및 목표

  • 기계 학습 모델 훈련을 위한 대규모, 고품질, 레이블이 부여된 식물 이미지 데이터의 부족이라는 디지털 농업의 핵심적 제약을 해결한다.
  • 캐나다 프라이어리 및 북미 북부 주들에서 흔히 볼 수 있는 작물과 잡초의 종합적이고 메타데이터가 풍부한 데이터셋을 제공하여 정밀 농업 연구를 지원한다.
  • 실제 세계의 다양한 식물 외형을 반영한 실제 데이터를 사용하여 종 분류, 잡초 탐지 및 식물 형질 분석을 위한 컴퓨터 비전 모델의 훈련과 평가를 가능하게 한다.
  • 작물과 잡초의 종과 연령 분포를 유지하는 1만 4천 장의 서브샘플을 통해 빠른 프로토타이핑을 촉진한다.
  • 최상의 데이터 공유 관행을 따르며, 메타데이터와 데이터시트를 포함한 오픈 액세스 원칙에 따라 데이터를 배포함으로써 장기적인 데이터 접근성과 재현 가능성을 확보한다.

제안 방법

  • 일관된 조명 조건에서 제어된 실험실 환경에서 로봇 시스템을 사용한 자동 이미지 촬영을 통해 다각도(상단, 프로파일, 기울임)에서 식물을 촬영한다.
  • 트랙터에 장착된 스테레오 카메라를 통해 현장 이미지를 수집하고, 현장 주행 중 상단 시점의 비디오를 녹화한 후, 프레임 추출을 통해 현장 데이터 서브셋을 구성한다.
  • 개별 식물 주위에 경계 상자(Bounding box)를 자동으로 생성하는 알고리즘을 사용하여 전체 프레임 촬영에서 단일 식물 이미지를 잘라내는 것을 가능하게 한다.
  • 실험실 데이터에서 각 종별 1,000장의 이미지를 선택하기 위한 계층적 표본 추출 전략을 구현하여 식물 연령과 개인 식물 다양성의 비율을 보장한다.
  • 식물 종류, 연령(일수), 생장 단계 및 환경 조건(예: 온도, 습도, 카메라 높이) 등의 메타데이터 수집을 실험실 및 현장 데이터셋 모두에 적용한다.
  • CyVerse 및 EMILI 데이터 포털의 단계적 배포를 통해 데이터 관리하며, 전체 데이터셋과 서브샘플은 오픈 액세스 라이선스 하에 제공되며, 투명성을 높이기 위해 데이터시트가 함께 제공된다.

실험 결과

연구 질문

  • RQ1농업 분야의 컴퓨터 비전을 지원하기 위해, 대규모, 다양성 있고 잘 레이블이 부여된 식물 이미지 데이터셋을 체계적으로 수집하고 구조화하는 방법은 무엇인가?
  • RQ2120만 장이 넘는 전체 데이터셋의 연령 및 종 분포를 얼마나 정확히 반영할 수 있는가? 1만 4천 장의 대표적 서브샘플의 성능은 어떠한가?
  • RQ3실험실 및 현장에서 재배된 식물 이미지의 주요 특성은 종 다양성, 이미지 수 및 메타데이터의 풍부함 측면에서 무엇인가?
  • RQ4오픈 액세스 데이터 공유와 메타데이터 표준화가 디지털 농업 연구의 재현 가능성과 혁신을 어떻게 향상시킬 수 있는가?
  • RQ5농업 적용 분야에서 식물 이미지 데이터셋에 익숙하지 않은 연구자들에게는 어떤 실질적 이점이 있는가?

주요 결과

  • 실험실 데이터는 실내에서 재배된 14종의 작물 및 잡초에 대해 120만 장 이상의 이미지를 포함하며, 다양한 각도에서 촬영되었고, 식물 연령 및 개별 식물 식별 정보 등의 메타데이터로 풍부하게 보완되었다.
  • 현장 데이터는 2019년과 2020년 재배 시즌 동안 실지 농장에서 촬영한 상단 시점의 54만 장의 이미지로 구성되어 있으며, 기상 조건 및 카메라 높이 등의 추가 메타데이터를 포함한다.
  • 1만 4천 장의 서브샘플은 전체 실험실 데이터셋의 연령 분포와 개인 식물 표현을 유지하고 있으며, 각 종별 1,000장의 이미지를 선택하여 균형 잡힌 커버리지가 이루어졌다.
  • 이 서브샘플은 https://doi.org/10.25739/rwcw-ex45를 통해 CyVerse 데이터 스토어를 통해 DOI로 제공되어 모델 훈련 및 평가에 즉각적인 접근이 가능하다.
  • 전체 데이터셋은 http://emilicanada.com/ (디지털 농업 자산 지도)의 EMILI 데이터 포털에 호스팅되어 있으며, 지속적인 데이터 수집과 함께 3차원 포인트 클라우드 및 고스펙트럼 영상으로의 확장이 진행 중이다.
  • 데이터셋은 데이터시트와 함께 배포되었으며, 최상의 데이터 공유 관행을 따르며 디지털 농업 연구의 투명성, 재현 가능성 및 활용도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.