Skip to main content
QUICK REVIEW

[논문 리뷰] Embedded CNN based vehicle classification and counting in non-laned road traffic

Mayank Chauhan, Arshdeep Singh|arXiv (Cornell University)|2019. 01. 18.
Advanced Neural Network Applications참고 문헌 12인용 수 8
한 줄 요약

이 논문은 델리-엔씨R와 같은 비차선, 이질적인 교통 환경에서 차량 분류 및 세는 데 사용할 수 있는 임베디드 CNN 기반 시스템을 제안한다. 5,562개의 영상 프레임으로 구성된 고유하게 애너테이션 처리된 데이터셋을 사용하여, 전이 학습 및 피니팅을 통해 훈련된 모델은 최대 75%의 평균 정밀도(mAP)를 달성한다. 임베디드 구현체는 실시간 배포에 적합한 낮은 지연 시간과 에너지 효율성을 보이며, 저접속 지역에서도 실용적으로 활용 가능하다.

ABSTRACT

Classifying and counting vehicles in road traffic has numerous applications in the transportation engineering domain. However, the wide variety of vehicles (two-wheelers, three-wheelers, cars, buses, trucks etc.) plying on roads of developing regions without any lane discipline, makes vehicle classification and counting a hard problem to automate. In this paper, we use state of the art Convolutional Neural Network (CNN) based object detection models and train them for multiple vehicle classes using data from Delhi roads. We get upto 75% MAP on an 80-20 train-test split using 5562 video frames from four different locations. As robust network connectivity is scarce in developing regions for continuous video transmissions from the road to cloud servers, we also evaluate the latency, energy and hardware cost of embedded implementations of our CNN model based inferences.

연구 동기 및 목표

  • 델리-엔씨R와 같은 개발 중인 지역에서 흔한 비차선, 이질적인 교통 환경에서 자동 차량 수세기 및 분류 문제를 해결하기 위해.
  • 서유럽 교통 데이터셋(예: PASCAL VOC, KITTI)에 맞춰 미리 훈련된 CNN 모델의 성능이 열 劣한 것을 해결하기 위해 도메인 특화 애너테이션 처리된 데이터셋을 구축하기 위해.
  • 자원 제약 환경에서 저지연, 저에너지 추론을 위한 임베디드 플랫폼에 훈련된 CNN 모델을 배포할 수 있는지 타당성을 평가하기 위해.
  • 도로변 카메라를 활용한 정확하고 확장 가능한 교통 모니터링을 통해 데이터 기반 도시 정책 결정을 지원하기 위해.
  • 정보통신 기술(ICT)과 개발 간 격차를 해소하기 위해 도시 인프라 계획을 위한 확장 가능하고 저비용의 교통 모니터링 시스템을 제공하기 위해.

제안 방법

  • 도로변 및 차량 내부 카메라를 사용하여 델리-엔씨R의 네 곳의 위치(교차로 및 고속도로 포함)에서 영상 데이터를 수집하였으며, 피시어 렌즈와 일반 렌즈를 사용하였다.
  • 8종의 차량 클래스(이륜차, 삼륜차, 승용차, 버스, 트럭 포함)에 대해 총 5,562프레임에 32,088개의 객체를 수작업으로 애너테이션 처리하고, 바운딩 박스를 설정하였다.
  • ImageNet 기반 전이 학습을 활용하여 사전 훈련된 CNN 객체 검출 모델(예: Faster R-CNN 또는 YOLO 변종)을 훈련한 후, 고유한 데이터셋을 활용한 도메인 특화 피니팅을 수행하였다.
  • 80-20 훈련-테스트 분할을 사용하여 모델 성능을 평가하였으며, 주요 평가 지표로 평균 정밀도(mAP)를 사용하였다.
  • 임베디드 플랫폼(예: NVIDIA Jetson, Coral TPU)에서 추론 지연 시간, 에너지 소비량, 하드웨어 비용을 측정하여 실시간 배포 가능성 여부를 평가하였다.
  • 다양한 카메라 각도, 렌즈 종류, 시점(전면, 측면, 후면)을 고려한 교차 카메라 평가를 수행하여 모델의 일반화 능력을 테스트하였다.

실험 결과

연구 질문

  • RQ1델리-엔씨R와 같은 비차선, 이질적인 교통 환경에서 다양한 차량 유형을 분류하고 세는 데 CNN 기반 객체 검출 모델이 높은 정확도를 달성할 수 있는가?
  • RQ2서유럽 교통 데이터셋(PASCAL VOC, KITTI)에 훈련된 모델이 인도의 비차선 교통 환경에 적용되었을 때 성능이 어떻게 저하되는가? 그 원인은 무엇인가?
  • RQ3델리-엔씨R에서 수집한 고유한 애너테이션 처리된 데이터셋은 서유럽 데이터셋에서의 전이 학습 대비 모델 성능 향상에 어느 정도 기여하는가?
  • RQ4이러한 모델을 도로변 교통 모니터링에 적합한 임베디드 시스템에 배포할 경우 지연 시간, 에너지 소비량, 하드웨어 비용은 각각 얼마인가?
  • RQ5실제 도시 환경에서 다양한 카메라 설치 방식, 렌즈 종류, 시점에서 모델의 일반화 능력은 어느 정도인가?

주요 결과

  • 제안된 모델은 고유하게 애너테이션 처리된 델리-엔씨R 데이터셋을 사용하여 80-20 훈련-테스트 분할에서 최대 75%의 평균 정밀도(mAP)를 달성하였다.
  • 서유럽 교통 데이터셋(PASCAL VOC 및 KITTI)에 훈련된 사전 훈련된 모델은 델리 교통 환경에서 빈도가 매우 낮은 성능을 보였으며, 각각 0.58% 및 0.01%의 mAP를 기록하였다.
  • 성능 저하의 원인은 자동 리크샤, 전기 리크샤 등의 차량 유형 차이, 차선 미준수로 인한 가림 현상, 비정규적인 교차로 기하학적 구조, 카메라 시점의 차이(운전자 vs. 도로변) 등이 있었다.
  • 총 5,562프레임, 32,088개의 애너테이션을 포함한 고유한 애너테이션 처리된 데이터셋은 목표 도메인에서 높은 정확도를 달성하는 데 필수적이었다.
  • 훈련된 모델의 임베디드 구현체는 실용적인 지연 시간과 에너지 효율성을 보이며, 저접속 지역에서 실시간 배포가 가능함을 입증하였다.
  • 교차 카메라 평가 결과, 한 카메라 유형에서 훈련된 모델은 중간 정도의 일반화 능력을 보였지만, 렌즈 종류와 시점에 따라 성능이 다소 변동함을 확인하였으며, 이는 다양한 훈련 데이터가 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.