Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Counting and Identification of Train Wagons Based on Computer Vision and Deep Learning

Rayson Laroca, Alessander Cidral Boslooper|arXiv (Cornell University)|2020. 10. 30.
Vehicle License Plate Recognition인용 수 4
한 줄 요약

이 논문은 고가의 RFID 시스템을 능가하면서도 저비용으로 작동하는 딥러닝 기반 컴퓨터 비전 시스템을 제안한다. 이 시스템은 풀 HD 영상에서 기차 빌딩의 자동 카운팅과 식별을 수행하며, 100%의 카운팅 정확도와 99.7%의 인식률을 달성했고, 손상된 코드 11.6%를 자동으로 거부한다. 이는 저성능 하드웨어에서도 효율적으로 작동한다.

ABSTRACT

In this work, we present a robust and efficient solution for counting and identifying train wagons using computer vision and deep learning. The proposed solution is cost-effective and can easily replace solutions based on radiofrequency identification (RFID), which are known to have high installation and maintenance costs. According to our experiments, our two-stage methodology achieves impressive results on real-world scenarios, i.e., 100% accuracy in the counting stage and 99.7% recognition rate in the identification one. Moreover, the system is able to automatically reject some of the train wagons successfully counted, as they have damaged identification codes. The results achieved were surprising considering that the proposed system requires low processing power (i.e., it can run in low-end setups) and that we used a relatively small number of images to train our Convolutional Neural Network (CNN) for character recognition. The proposed method is registered, under number BR512020000808-9, with the National Institute of Industrial Property (Brazil).

연구 동기 및 목표

  • 설치 및 유지보수 비용을 줄이는 데 목적이 있는 RFID 기반 빌딩 추적 시스템의 저비용 대체 방안을 개발하기 위해.
  • 변동하는 조도, 폰트 스타일, 손상된 코드, 카메라 각도 등으로 인해 자동 빌딩 카운팅 및 식별에 발생하는 과제를 해결하기 위해.
  • 먼지, 부식, 파동진 표면에 투사된 저해상도 텍스트와 같은 실제 환경 조건에 강건한 시스템을 구축하기 위해.
  • 정확도를 희생시키지 않은 채 계산 요구 사항을 최소화하여 저성능 하드웨어에도 배포 가능하게 하기 위해.
  • OCR 출력 길이와 코딩 표준을 기반으로 손상되거나 읽을 수 없는 식별 코드가 있는 빌딩을 자동으로 탐지하고 제외하여 시스템 신뢰성을 향상시키기 위해.

제안 방법

  • 두 단계의 방법론: 첫 번째로, YOLOv4-tiny를 활용한 객체 검출을 통해 풀 HD 영상 프레임에서 빌딩 영역을 국소화한다.
  • 두 번째로, 알파뉴meric 빌딩 코드의 엔드 투 엔드 스트리트 텍스트 인식을 위한 맞춤형 컨볼루션 신경망(CNN)을 사용한다.
  • 상대적으로 작은 14,935장의 이미지 데이터셋에서 효과적으로 학습하기 위해 데이터 증강과 전이 학습을 활용한다.
  • OCR 출력 길이와 코딩 표준을 기반으로 손상되거나 읽을 수 없는 코드가 있는 빌딩을 식별하고 제외하는 거부 메커니즘을 도입한다.
  • 다중 카메라 환경에서 정확도를 향상시키기 위해 히우리스틱 규칙을 사용해 여러 카메라의 결과를 융합한다.
  • 고성능 GPU에서 16 FPS로 처리되어 저비용 임베디드 하드웨어에 실시간 배포가 가능함을 입증한다.

실험 결과

연구 질문

  • RQ1실제 외부 환경 조건에서 기계적 비전 시스템이 기차 빌딩에 대해 100%의 카운팅 정확도를 달성할 수 있는가?
  • RQ2변동하는 조도, 폰트, 코드 손상 조건 하에서 빌딩 식별에 대해 어떤 정확도를 달성할 수 있는가?
  • RQ3제한된 데이터셋에서 학습된 딥러닝 모델이 실제 빌딩 코드의 다양성에 얼마나 잘 일반화되는가?
  • RQ4손상되거나 읽을 수 없는 식별 코드가 있는 빌딩의 자동 거부는 얼마나 효과적인가?
  • RQ5다중 카메라 융합은 복잡한 상황에서 정확도 향상에 얼마나 기여하는가?

주요 결과

  • 모든 평가 영상에서 시스템은 100%의 카운팅 정확도를 달성하여 기차 편성 내 모든 빌딩을 정확히 식별하고 추적했다.
  • 변동하는 폰트 스타일, 색상, 부분적 가림이 있더라도 읽을 수 있는 빌딩 코드의 인식률은 99.7%에 도달했다.
  • 손상되거나 읽을 수 없는 식별 코드로 인해 시스템은 11.6%의 빌딩을 자동으로 거부하여 데이터 품질을 향상시켰다.
  • 고성능 GPU에서 16 프레임/초로 처리되어 저비용 임베디드 하드웨어에 실시간 배포가 가능함을 입증했다.
  • 다중 카메라 설정을 통해 히우리스틱 융합을 통해 두 측면의 결과를 융합함으로써 정확도 오류를 8에서 2로 감소시켰다.
  • 파동진 빌딩 표면으로 인한 저해상도, 노이즈가 많은 또는 기울어진 텍스트 투사 조건에서도 시스템이 여전히 강건함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.