Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Deep Learning for Steering Autonomous Vehicles Considering Temporal Dependencies

Hesham M. Eraqi, Mohamed Moustafa|arXiv (Cornell University)|2017. 10. 10.
Autonomous Vehicle Technology and Safety참고 문헌 20인용 수 70
한 줄 요약

본 논문은 Convolutional Long Short-Term Memory (C-LSTM) 모델을 제안하여 시각적 및 시간적 운전 신호를 엔드 투 엔드로 학습하고, 핸들을 사인형 분류 작업으로 프레이밍한다; comma.ai 데이터세트에서 35% RMSE 개선 및 87% 안정성을 달성한다.

ABSTRACT

Steering a car through traffic is a complex task that is difficult to cast into algorithms. Therefore, researchers turn to training artificial neural networks from front-facing camera data stream along with the associated steering angles. Nevertheless, most existing solutions consider only the visual camera frames as input, thus ignoring the temporal relationship between frames. In this work, we propose a Convolutional Long Short-Term Memory Recurrent Neural Network (C-LSTM), that is end-to-end trainable, to learn both visual and dynamic temporal dependencies of driving. Additionally, We introduce posing the steering angle regression problem as classification while imposing a spatial relationship between the output layer neurons. Such method is based on learning a sinusoidal function that encodes steering angles. To train and validate our proposed methods, we used the publicly available Comma.ai dataset. Our solution improved steering root mean square error by 35% over recent methods, and led to a more stable steering by 87%.

연구 동기 및 목표

  • 앞面 카메라 데이터로부터 핸들링을 엔드-투-엔드 학습 태스크로 동기화한다.
  • C-LSTM 아키텍처를 통해 프레임 간 시간 의존성을 통합한다.
  • 출력 토폴로지를 활용하기 위해 핸들 각도를 사인을 이용한 파형으로 표현한다.
  • 사인형 분류와 LSTM이 직접 회귀 및 기존 분류기보다 정확도와 안정성을 향상시킴을 보인다.

제안 방법

  • ImageNet에서 사전 학습된 CNN을 이용해 프레임 레벨 특징을 추출한다.
  • 일련의 LSTM 계층을 이용해 CNN 특징의 시퀀스를 처리하여 시간적 다이내믹스를 모델링한다.
  • 출력 뉴런 N개에 걸쳐 핸들 각도를 사인 웨이브로 인코딩하여 공간적 상관관계를 강제한다.
  • 프레임 X_{t-w}...X_t로부터 핸들 각도 Y_t를 학습하기 위해 슬라이딩 윈도우를 사용하여 엔드-투-엔드로 학습한다.
  • 배치 시 배포 시 최소자승법으로 네트워크 출력에 사인을 맞추어 핸들 각도를 디코딩한다.

실험 결과

연구 질문

  • RQ1C-LSTM을 통해 시간 의존성을 통합하면 모노큘러 비디오에서 핸들 예측이 향상되는가?
  • RQ2핸들 각도를 공간적으로 상관된 출력의 사인형 분류로 인코딩하는 것이 직접 회귀 및 표준 분류 접근법보다 성능이 우수한가?
  • RQ3슬라이딩 윈도우 길이와 네트워크 깊이가 예측 정확도와 안정성에 미치는 영향은 무엇인가?

주요 결과

  • C-LSTM은 CNN 기반 회귀 대비 16.01°의 RMSE(백색도 9.7°/시간 단위)로 향상시키며, CNN 기반 회귀는 17.77° RMSE 및 39.1의 백색도를 보인다.
  • 사인파 피팅을 통한 사인형 분류는 RMSE 14.93° 및 백색도 8.2°를 달성하여 직접 회귀 및 전통적 분류보다 우수하다.
  • 대체 최첨단 방법과 비교할 때 제안된 방법은 comma.ai 데이터세트에서 핸들 RMSE를 35% 감소시키고 안정성을 87% 향상시킨다.
  • 평가 표에서 사인파-피팅과 C-LSTM 조합의 분류가 기본 회귀 및 표준 분류 접근법을 능가한다.
  • 회귀를 상관 출력을 갖는 사인파로 인코딩하는 것이 엔드-투-엔드 주행 성능을 향상시킬 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.