Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing fish abundance from underwater video using deep neural networks

Ranju Mandal, Rod M. Connolly|arXiv (Cornell University)|2018. 07. 16.
Water Quality Monitoring Technologies참고 문헌 7인용 수 10
한 줄 요약

이 논문은 VGG-16, ResNet-50, Inception-V3의 세 가지 사전 훈련된 분류 네트워크에서의 전이 학습을 활용한 Faster R-CNN 기반의 엔드 투 엔드 딥 러닝 시스템을 제안하여 수중 비디오 스트림에서 어류 종을 자동으로 탐지하고 분류한다. 새로 정제된 50종의 어류 및 절지동물 종에 대한 데이터셋에서 이 방법은 평균 정밀도(mAP) 82.4%를 달성하여 이전의 최고 성능 방법들을 크게 뛰어넘었다.

ABSTRACT

Uses of underwater videos to assess diversity and abundance of fish are being rapidly adopted by marine biologists. Manual processing of videos for quantification by human analysts is time and labour intensive. Automatic processing of videos can be employed to achieve the objectives in a cost and time-efficient way. The aim is to build an accurate and reliable fish detection and recognition system, which is important for an autonomous robotic platform. However, there are many challenges involved in this task (e.g. complex background, deformation, low resolution and light propagation). Recent advancement in the deep neural network has led to the development of object detection and recognition in real time scenarios. An end-to-end deep learning-based architecture is introduced which outperformed the state of the art methods and first of its kind on fish assessment task. A Region Proposal Network (RPN) introduced by an object detector termed as Faster R-CNN was combined with three classification networks for detection and recognition of fish species obtained from Remote Underwater Video Stations (RUVS). An accuracy of 82.4% (mAP) obtained from the experiments are much higher than previously proposed methods.

연구 동기 및 목표

  • 수중 비디오 영상에서 수작업 기반의 어류 개체수 평가 과정을 자동화하기 위해.
  • 오염, 변동하는 조명, 복잡한 배경, 척도/자세 변화와 같은 수중 객체 탐지 과제를 해결하기 위해.
  • 제약 조건이 없는 환경에서 다양한 해양 종을 실시간으로 탐지하고 식별할 수 있는 강력한 엔드 투 엔드 시스템을 개발하기 위해.
  • PASCAL VOC 형식으로 애너테이션된 50종의 어류 및 절지동물 종을 포함한 표준화된 공개 가능한 데이터셋을 구축하고 배포하기 위해.
  • 어류 개체수 모니터링에서 정확도와 확장성 측면에서 기존의 반자동 또는 수작업 특징 기반 접근법을 뛰어넘기 위해.

제안 방법

  • 엔드 투 엔드 Faster R-CNN 아키텍처를 사용하여 영역 제안 네트워크(RPN)와 세 가지 다른 백본 분류 네트워크(VGG-16, ResNet-50, Inception-V3)를 조합한다.
  • 사전 훈련된 분류 네트워크를 커스텀 수중 어류 데이터셋에 대해 미세 조정하여 특징 추출 성능을 향상시킨다.
  • 시스템은 영상 프레임을 처리하여 객체 경계 상자와 각 탐지 영역을 사전 정의된 종 클래스로 분류한다.
  • 오스트레일리아 퀸즐랜드 남동부 지역의 여러 해변과 염전 지역에서 촬영한 50종의 해양 종 데이터셋을 수집하고, Vatic 비디오 애너테이션 툴을 사용해 애너테이션을 수행했다.
  • 모델 훈련 및 평가에는 주로 평균 정밀도(mAP)를 메트릭으로 사용하였으며, 성능은 90,000 반복 동안 추적되었다.
  • 오류 분석을 통해 잘못된 양성과 잘못된 음성 사례를 분석하였으며, 주요 실패 원인으로는 오염과 배경 무늬의 유사성이 밝혀졌다.

실험 결과

연구 질문

  • RQ1딥 러닝 기반의 시스템이 제약 조건이 없는 수중 비디오 스트림에서 어류 종을 높은 정확도로 탐지하고 분류할 수 있는가?
  • RQ2수중 어류 탐지 및 분류 맥락에서 다양한 백본 네트워크(VGG-16, ResNet-50, Inception-V3)의 성능는 어떻게 비교되는가?
  • RQ3제한된 도메인 특화 수중 어류 데이터셋에서 사전 훈련된 모델에서의 전이 학습이 탐지 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4실제 수중 환경에서 자동 어류 탐지의 주요 실패 원인은 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ5완전 자동화된 시스템이 정확도와 확장성 측면에서 기존의 반자동 또는 수작업 특징 기반 접근법을 뛰어넘을 수 있는가?

주요 결과

  • 제안된 시스템은 테스트 데이터셋에서 평균 정밀도(mAP) 82.4%를 달성하여 이전의 방법들보다 뚜렷이 뛰어났으며, Spampinato 등이 보고한 10종 데이터셋에서의 54%보다 높았다.
  • VGG-16는 70,000 번째 반복에서 가장 높은 mAP 0.72를 기록했고, 최종 모델은 세 네트워크 모두에서 90,000 번째 반복 후 82.4% mAP에 도달했다.
  • 시스템은 배경이 혼잡한 복잡한 수중 환경에서도 다중 방향성 및 다중 척도 어류 종을 성공적으로 탐지하고 분류했다.
  • 거짓 음성은 주로 어류 군집에서의 높은 오염으로 인해 발생했고, 거짓 양성은 어류 패턴과 유사한 배경 무늬로 인한 것이 주요 원인이다.
  • PASCAL VOC 형식으로 애너테이션된 50종의 데이터셋은 공개 가능하며, 향후 수중 종 모니터링 연구에 있어 중요한 기여를 한다.
  • 엔드 투 엔드 딥 러닝 파이프라인은 실시간 자동 어류 개체수 평가를 가능하게 하여 전문가의 노동과 수작업 영상 분석에 대한 의존도를 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.