Skip to main content
QUICK REVIEW

[论文解读] SAD-GAN: Synthetic Autonomous Driving using Generative Adversarial Networks

Arna Ghosh, Biswarup Bhattacharya|arXiv (Cornell University)|Nov 27, 2016
Generative Adversarial Networks and Image Synthesis被引用 13
一句话总结

该论文提出SAD-GAN,一种生成对抗网络框架,利用Road Rash游戏的游玩数据进行训练,基于DCGAN架构,从当前图像和按键输入合成未来的驾驶场景。其在将动作分类为'安全'或'不安全'方面达到90%的准确率,证明了通过模仿学习和强化学习原理,使用合成数据进行自动驾驶策略学习的可行性。

ABSTRACT

Autonomous driving is one of the most recent topics of interest which is aimed at replicating human driving behavior keeping in mind the safety issues. We approach the problem of learning synthetic driving using generative neural networks. The main idea is to make a controller trainer network using images plus key press data to mimic human learning. We used the architecture of a stable GAN to make predictions between driving scenes using key presses. We train our model on one video game (Road Rash) and tested the accuracy and compared it by running the model on other maps in Road Rash to determine the extent of learning.

研究动机与目标

  • 开发一种生成模型,根据当前视觉输入和控制动作预测未来的驾驶场景。
  • 探索利用视频游戏中的合成数据训练端到端驾驶策略网络。
  • 通过优先考虑车辆安全而非速度或排名的强化学习框架,实现在安全动作上的预测。
  • 展示训练后的生成器在不同游戏环境中的可迁移性,模拟真实世界驾驶的泛化能力。

提出的方法

  • 使用生成器训练深度卷积神经网络(DCGAN),该生成器根据当前图像和按键输入预测下一帧驾驶画面。
  • 使用带有卷积层和Leaky ReLU的判别器网络,以区分真实帧与生成帧,提升训练稳定性。
  • 在判别器中使用批量归一化,以稳定学习过程,并将输入归一化为均值为零、方差为一的分布。
  • 训练一个独立的卷积神经网络(基于AlexNet)根据预测的未来帧对动作进行'安全'或'不安全'的分类。
  • 使用带有动量(0.9)的随机梯度下降和小批量训练对所有网络进行优化。
  • 将强化学习的奖励隐式定义为游戏树中安全关卡的最大推进数量,优先考虑安全性而非速度。

实验结果

研究问题

  • RQ1基于GAN的模型能否有效从单张图像和按键输入生成逼真的未来驾驶场景?
  • RQ2在合成游戏玩法数据上训练的模型,在未见的游戏地图或环境中的泛化能力如何?
  • RQ3隐式强化学习策略在无显式奖励设计的情况下,学习安全驾驶行为的有效性如何?
  • RQ4生成器网络能否用于模拟多个未来状态,以支持自动驾驶中的决策制定?
  • RQ5当在单一游戏环境中训练时,模型性能是否能在不同驾驶场景中实现泛化?

主要发现

  • 安全/不安全分类网络在25个训练周期后达到90%的准确率,每类使用200张图像。
  • 在从Road Rash收集的数据集上,训练过程约耗时一小时。
  • 该模型成功从单个输入图像和按键组合生成了三个不同的未来帧(左转、右转、直行)。
  • 判别器有效区分了真实帧与生成帧,表明GAN训练过程稳定。
  • 基于游戏树中安全推进的隐式奖励机制,使模型行为优先考虑安全性,模拟了人类决策过程。
  • 该框架展示了迁移学习的潜力,生成器在初始训练后可应用于新环境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。