Skip to main content
QUICK REVIEW

[论文解读] Exploration of Reinforcement Learning for Event Camera using Car-like Robots

Riku Arakawa, Shintaro Shiba|arXiv (Cornell University)|Apr 2, 2020
Advanced Memory and Neural Computing参考文献 31被引用 4
一句话总结

本论文提出了首个用于机器人的事件相机强化学习(RL)系统,在仿真和真实世界部署中均实现了100 Hz的实时碰撞规避与目标追踪。通过将事件流转换为类似图像的特征,该方法实现了仿真环境中的端到端RL训练,并成功将策略迁移至一辆类汽车机器人,实现了毫秒级以下的控制响应,延迟极低。

ABSTRACT

We demonstrate the first reinforcement-learning application for robots equipped with an event camera. Because of the considerably lower latency of the event camera, it is possible to achieve much faster control of robots compared with the existing vision-based reinforcement-learning applications using standard cameras. To handle a stream of events for reinforcement learning, we introduced an image-like feature and demonstrated the feasibility of training an agent in a simulator for two tasks: fast collision avoidance and obstacle tracking. Finally, we set up a robot with an event camera in the real world and then transferred the agent trained in the simulator, resulting in successful fast avoidance of randomly thrown objects. Incorporating event camera into reinforcement learning opens new possibilities for various robotics applications that require swift control, such as autonomous vehicles and drones, through end-to-end learning approaches.

研究动机与目标

  • 通过事件相机实现高速机器人控制,突破标准RGB相机30–60 Hz帧率的限制。
  • 开发一种处理脉冲神经传感器异步事件流的方法,作为传统深度强化学习算法的输入。
  • 在配备事件相机(DAVIS240)的真实机器人上,成功实现从仿真到真实世界的策略迁移。
  • 验证基于事件视觉的端到端强化学习在动态环境中实现高速、低延迟机器人控制的可行性。

提出的方法

  • 通过在短时间窗口内累积事件,将原始事件流转换为类似图像的特征,实现与强化学习中常用卷积神经网络的兼容性。
  • 在仿真环境中使用类似图像的事件特征训练深度强化学习智能体,完成两项任务:高速碰撞规避与目标追踪。
  • 采用深度Q网络(DQN)或类似强化学习架构,并结合探索策略,以优化每集的累积奖励。
  • 通过WebSocket API将训练好的策略部署在GoPiGo3机器人搭载的Raspberry Pi 3上,推理任务由远程服务器处理以减轻计算负载。
  • 使用libcaer和EventVisionLibrary实时处理事件数据,为强化学习智能体提供低延迟输入。
  • 通过在仿真中训练并在真实机器人上直接部署的策略迁移方法,无需微调。

实验结果

研究问题

  • RQ1强化学习能否有效应用于事件相机数据以实现机器人控制?
  • RQ2从事件流中提取的类似图像特征能否在仿真中实现稳定且快速的强化学习训练?
  • RQ3在仿真中训练的策略能否成功迁移到配备事件相机的真实机器人上,以完成高速任务?
  • RQ4基于事件相机的强化学习能否实现显著高于传统相机系统控制频率?
  • RQ5与基于传统视觉的强化学习相比,基于事件相机的强化学习在延迟和响应速度方面表现如何?

主要发现

  • 强化学习智能体在仿真中成功学习了障碍物规避,累积奖励随训练集数增加而上升,表明策略获取有效。
  • 在九组不同随机种子的实验中,训练过程均实现稳定收敛,显示出良好的鲁棒性与可重复性。
  • 训练好的策略成功迁移至配备DAVIS240事件相机的真实GoPiGo3机器人上。
  • 当有物体突然被扔到机器人前方时,机器人能实时执行停止动作,响应时间低于毫秒级。
  • 服务器端每步推理延迟约为9 ms,支持100 Hz控制频率,显著高于标准30–60 Hz相机系统。
  • 结果证实了基于事件相机的端到端强化学习在真实场景中实现低延迟机器人控制的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。