[논문 리뷰] Self-Driving Car Steering Angle Prediction: Let Transformer Be a Car Again
이 논문은 자율주행 차량의 조향 각도 예측을 위한 새로운 Transformer 기반 아키텍처를 제안하며, 광학 흐름 특징과 다중 작업 학습을 통합한다. Udacity Self-Driving Car Challenge 2 데이터셋에서 사전 RMSE 0.0577과 공개 RMSE 0.0588을 기록하여 기준 모델을 초월하고 경쟁 대회에서 3~4위를 기록하였다.
Self-driving vehicles are expected to be a massive economic influence over the coming decades. Udacity https://www.udacity.com/ has been working on a completely open-source self driving car. Thus, it regularly organizes various competitions, one of which was dedicated to steering angle prediction task. In this work, we perform an extensive study on this particular task by exploring the Udacity Self-driving Car Challenge 2. We provide insights on the previous teams' solutions. Moreover, we propose our new architecture that is inspired by some of the teams. We report our performance and compare it with multiple baseline architectures as well as other teams' solutions. We make our work available on GitHub and hope it is useful for the Udacity community and brings insights for future works https://github.com/chingisooinar/AI_self-driving-car
연구 동기 및 목표
- 자율주행 차량의 조향 각도 예측을 위한 기존 딥러닝 모델을 향상시키기 위해.
- 표준 모델이 어려워하는 극단적 조향 각도를 예측하는 데 도전하기 위해.
- 주행 작업의 시퀀스 모델링에서 어텐션 메커니즘과 광학 흐름 특징의 효과성을 탐색하기 위해.
- 다양한 기상 조건, 조명 및 도로 유형을 포함한 다양한 주행 조건에서 잘 일반화되는 모델을 개발하기 위해.
- Udacity Self-Driving Car Challenge 2 데이터셋에서 기존 기준 모델 및 이전 대회 솔루션을 초월하기 위해.
제안 방법
- RGB 이미지의 특징을 추출하기 위해 ResNet-18 기반의 특징 추출기와 함께 비전 트랜스포머(ViT) 백본을 채택하였다.
- 연속된 RGB 프레임에서 유도된 광학 흐름 이미지를 처리하기 위한 별도의 브랜치를 도입하였다.
- 조향 각도와 차량 속도 예측을 동시에 수행하는 다중 작업 학습을 구현하였다.
- 일반화를 향상시키고 과적합을 줄이기 위해 레이블 스무딩을 0.35의 요소로 적용하였다.
- 조향 각도 및 속도 예측 헤드 모두에 대해 평균 제곱오차(MSE) 손실을 사용하여 모델을 훈련시켰다.
- 시간적 의존성을 포착하기 위해 데이터 증강 및 시퀀스 모델링을 적용하였다.
실험 결과
연구 질문
- RQ1Transformer 기반 아키텍처가 CNN-LSTM 및 ResNet 기반 모델보다 조향 각도 예측 성능에서 뛰어나게 되는가?
- RQ2광학 흐름 특징을 통합함으로써 극단적 조향 각도 예측 성능이 어떻게 향상되는가?
- RQ3속도 예측과 함께 다중 작업 학습을 수행할 경우 주요 조향 각도 회귀 작업에 얼마나 기여하는가?
- RQ4제안된 모델의 어텐션 시각화 결과는 표준 트랜스포머와 비교해 더 다이나믹하고 맥락 인식형 어텐션을 반영하는가?
- RQ5레이블 스무딩 및 아키텍처 수정이 미리 보지 못한 테스트 데이터에 대한 일반화 능력을 얼마나 향상시키는가?
주요 결과
- 제안된 Transformer 모델은 사전 RMSE 0.0577과 공개 RMSE 0.0588을 기록하여 DAVE2, ResNet50, CNN-LSTM 등 모든 기준 모델을 초월하였다.
- 광학 흐름 및 속도 예측 브랜치를 통합한 모델은 극단적 조향 각도에서 표준 모델 대비 오차를 감소시켰다.
- 제거 실험 결과, 광학 흐름 브랜치와 속도 예측 헤드 모두 성능 향상에 기여하며, 전체 모델은 단순한 Transformer보다 사전 데이터에서 RMSE 0.0079 향상되었다.
- 어텐션 맵은 제안된 모델이 특히 운동 경계에서 프레임 간에 동적으로 주의를 이동시키는 반면, 표준 트랜스포머는 정적 어텐션을 보임을 보여주었다.
- Udacity 챌린지에서 3위 또는 4위를 기록하여 전이 학습 및 LSTM 기반 접근법을 뛰어넘었지만, 1위 솔루션(0.0483 RMSE)에는 미치지 못했다.
- 0.35의 요소로 예측을 스무딩함으로써 성능이 추가로 향상되어 일반화 능력과 노이즈 레이블에 대한 강건성이 향상됨을 시사하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.