Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Learning Based Automatic Video Annotation Tool for Self-Driving Car

M. Nagarajan, K. Ganesan|arXiv (Cornell University)|2019. 04. 19.
Video Surveillance and Tracking Methods참고 문헌 14인용 수 9
한 줄 요약

이 논문은 자율주행 차량을 위한 딥러닝 기반 자동 영상 주석 도구를 제안하며, 객체 검출에 YOLO와 RetinaNet을, 분류에 ResNet-50와 VGG-19를, 차선 검출에 LaneNet을, 객체 추적에 DeepSort를 통합한다. 이 도구는 인간 주석과 비교해 83%의 정확도를 달성했으며, GPU 기반으로 530프레임 영상 처리 시 인간 주석 대비 1200배 빠르게 처리되어 주석 시간을 크게 단축하면서도 높은 정밀도를 유지한다.

ABSTRACT

In a self-driving car, objection detection, object classification, lane detection and object tracking are considered to be the crucial modules. In recent times, using the real time video one wants to narrate the scene captured by the camera fitted in our vehicle. To effectively implement this task, deep learning techniques and automatic video annotation tools are widely used. In the present paper, we compare the various techniques that are available for each module and choose the best algorithm among them by using appropriate metrics. For object detection, YOLO and Retinanet-50 are considered and the best one is chosen based on mean Average Precision (mAP). For object classification, we consider VGG-19 and Resnet-50 and select the best algorithm based on low error rate and good accuracy. For lane detection, Udacity's 'Finding Lane Line' and deep learning based LaneNet algorithms are compared and the best one that can accurately identify the given lane is chosen for implementation. As far as object tracking is concerned, we compare Udacity's 'Object Detection and Tracking' algorithm and deep learning based Deep Sort algorithm. Based on the accuracy of tracking the same object in many frames and predicting the movement of objects, the best algorithm is chosen. Our automatic video annotation tool is found to be 83% accurate when compared with a human annotator. We considered a video with 530 frames each of resolution 1035 x 1800 pixels. At an average each frame had about 15 objects. Our annotation tool consumed 43 minutes in a CPU based system and 2.58 minutes in a mid-level GPU based system to process all four modules. But the same video took nearly 3060 minutes for one human annotator to narrate the scene in the given video. Thus we claim that our proposed automatic video annotation tool is reasonably fast (about 1200 times in a GPU system) and accurate.

연구 동기 및 목표

  • 수동 레이블링에 의존하지 않고 자율주행 차량을 위한 자동 영상 주석 시스템을 개발하기 위해.
  • 객체 검출, 분류, 차선 검출, 객체 추적에 최적의 딥러닝 모델을 비교 및 선정하기 위해.
  • 정확도 및 처리 시간 측면에서 인간 주석과 비교해 제안된 도구의 성능을 평가하기 위해.
  • 엔드 투 엔드 딥러닝 파이프라인을 통해 영상 데이터로부터 실시간 시나리오 서술을 가능하게 하기 위해.

제안 방법

  • 시스템은 객체 검출에 YOLO와 RetinaNet-50를 사용하며, 평균 평균 정확도(mAP) 기반으로 최고 성능 모델을 선정한다.
  • 객체 분류에 대해 VGG-19와 ResNet-50를 정확도 및 오류율 기반으로 평가하여 최적의 모델을 선정한다.
  • 차선 검출은 Udacity의 'Finding Lane Line'과 딥러닝 기반 LaneNet을 사용하며, 더 높은 정확도를 보인 후자를 선택한다.
  • 객체 추적은 Udacity의 추적 알고리즘과 DeepSort를 비교하며, 추적 일관성과 운동 예측 정확도 기반으로 DeepSort를 선정한다.
  • 최종 주석 파이프라인은 최고 성능을 보인 모델들을 통합하여 일련의 영상 프레임을 처리하는 유일한 도구로 구성된다.
  • 성능 평가는 인간 주석 기반 참값을 기준으로 530프레임 영상(1035×1800 px)에 대해 평가되었으며, 프레임당 약 15개의 객체가 포함되어 있었다.

실험 결과

연구 질문

  • RQ1자율주행 차량 영상 스트림에서 객체 검출에 가장 높은 평균 평균 정확도(mAP)를 제공하는 딥러닝 모델은 무엇인가?
  • RQ2객체 인식 작업에서 오류율이 가장 낮고 정확도가 가장 높은 분류 네트워크는 VGG-19인지, ResNet-50인지?
  • RQ3딥러닝 기반의 LaneNet은 전통적 방법인 Udacity의 'Finding Lane Line'에 비해 차선 검출 정확도에서 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4Udacity의 알고리즘과 DeepSort 중 어느 추적 알고리즘이 객체 정체성을 더 잘 유지하고 프레임 간 운동을 더 정확히 예측하는가?
  • RQ5자동화된 도구는 처리 시간을 줄이며 인간 수준의 주석 정확도에 얼마나 가까이 도달할 수 있는가?

주요 결과

  • 제안된 자동 영상 주석 도구는 인간 주석 기반 참값과 비교해 83%의 정확도를 달성했다.
  • GPU 기반 시스템에서 도구는 전체 530프레임 영상을 2.58분 만에 처리했으며, 인간 주석자가 소요한 3060분 대비 1200배 빠른 처리 속도를 기록했다.
  • CPU 기반 시스템은 동일한 영상을 처리하는 데 43분이 소요되어 하드웨어 의존도가 높음을 시사한다.
  • 객체 검출에 대해 YOLO와 RetinaNet-50를 평가하였으며, mAP 기반으로 최고 성능 모델을 선정하였지만, 요약에서는 명확한 승자 이름은 기재되지 않았다.
  • 저오류율과 높은 정확도를 보이며 ResNet-50가 VGG-19를 능가하는 분류 성능을 보였다.
  • LaneNet은 Udacity의 'Finding Lane Line' 알고리즘에 비해 더 뛰어난 차선 검출 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.