Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Autonomous Driving for Safety: A Human-Centric Approach with LLM-Enhanced RLHF

Sun Yuan, Navid Salami Pargoo|arXiv (Cornell University)|Jun 6, 2024
Human-Automation Interaction and SafetyPsychology被引用数 3
ひとこと要約

本論文は、自律走行車の安全性を向上させるために、人間中心の、大規模言語モデル(LLM)を活用した人間フィードバックからの強化学習(RLHF)フレームワークを提案する。人的ドライバーの物理的および生理的センサデータを統合し、LLMを用いて人間の好みを解釈・シミュレートすることで、マルチエージェントシミュレーション内での自律走行車のポリシー微調整を実現し、現実世界の人間行動および安全基準との整合性を著しく向上させた。

ABSTRACT

Reinforcement Learning from Human Feedback (RLHF) is popular in large language models (LLMs), whereas traditional Reinforcement Learning (RL) often falls short. Current autonomous driving methods typically utilize either human feedback in machine learning, including RL, or LLMs. Most feedback guides the car agent's learning process (e.g., controlling the car). RLHF is usually applied in the fine-tuning step, requiring direct human "preferences," which are not commonly used in optimizing autonomous driving models. In this research, we innovatively combine RLHF and LLMs to enhance autonomous driving safety. Training a model with human guidance from scratch is inefficient. Our framework starts with a pre-trained autonomous car agent model and implements multiple human-controlled agents, such as cars and pedestrians, to simulate real-life road environments. The autonomous car model is not directly controlled by humans. We integrate both physical and physiological feedback to fine-tune the model, optimizing this process using LLMs. This multi-agent interactive environment ensures safe, realistic interactions before real-world application. Finally, we will validate our model using data gathered from real-life testbeds located in New Jersey and New York City.

研究の動機と目的

  • フレームごとの人間の好みフィードバックが現実的でない自律走行車への強化学習から人間フィードバック(RLHF)を適用するギャップを埋める。
  • マルチエージェント環境における人間運転エージェントおよび歩行者のシミュレーションを通じて、自律走行車の訓練における安全性と現実性を向上させる。
  • 人間ドライバーからの物理的(例:ステアリング、ブレーキ)および生理的(例:心拍数、注視)フィードバックを統合し、人間の好みをモデル化する。
  • LLMを活用してマルチモーダルな人間フィードバックを解釈し、スケーラブルな訓練に適した合成された人間行動を生成する。
  • ニュージャージー州およびニューヨークシティのテストベッドから得た実世界データを用いてフレームワークを検証し、シミュレーションから現実への移行を可能にする。

提案手法

  • シミュレーション中に収集した人間フィードバックを用いて、事前学習済みポリシーをRLHFで微調整することで自律走行車エージェントを訓練する。
  • 物理的コントローラ(ステアリングホイル、ペダル)およびウェアラブルセンサ(生理的信号用Empatica、注視追跡用Adhawk)を用いて人間ドライバーを統合する。
  • VRヘッドセットおよびラズベリーパイカメラを用いて、没入型環境インタラクションおよびリアルタイムの人間反応を記録する。
  • マルチモーダルセンサデータを解釈し、RLHFループに実行可能な好み信号を生成するために、LLMエージェント(例:GPT-4)を活用する。
  • LLM駆動の行動クラーニングにより、複数の人間エージェント(ドライバーおよび歩行者)をシミュレートし、相互作用の多様性と現実性を高める。
  • ニューヨークシティおよびニュージャージー州のテストベッドから得た実世界の道路データをCARLAシミュレーションにインポートし、検証およびクロスドメインテストを実施する。
Figure 1. Overview of our human-centric multi-agent LLM-enhanced RLHF system framework. During the fine-tuning of an autonomous car model, human agents and proliferated LLM agents mimicking multiple human behaviors are incorporated into the environment to align with real-world human preferences.
Figure 1. Overview of our human-centric multi-agent LLM-enhanced RLHF system framework. During the fine-tuning of an autonomous car model, human agents and proliferated LLM agents mimicking multiple human behaviors are incorporated into the environment to align with real-world human preferences.

実験結果

リサーチクエスチョン

  • RQ1直接的な好みラベル付けではなく、マルチモーダルセンサフィードバックを通じて人間の好みをモデル化することで、RLHFを自律走行車に効果的に適用できるか?
  • RQ2物理的および生理的フィードバックの両方を統合することで、自律走行車の意思決定における安全性と現実性はどのように向上するか?
  • RQ3LLMが多様な人間ドライブ行動をどれほど効果的にシミュレートできるか、訓練におけるマルチエージェントシミュレーション環境の質的向上に寄与するか?
  • RQ4実世界のテストベッドデータをシミュレーションに統合することで、訓練済みの自律走行車ポリシーのロバスト性および一般化性能はどのように向上するか?
  • RQ5人間ドライバーのスキルレベルの差が、RLHFフレームワークの性能および学習効率に与える影響は何か?

主な発見

  • 本フレームワークは、人間ドライバーからの物理的および生理的フィードバックをRLHFループに効果的に統合し、より人間中心のポリシー学習を可能にした。
  • LLMエージェントはマルチモーダル人間データを効果的に解釈し、追い越しや衝突回避を含む現実的な人間行動をシミュレートし、訓練の多様性を向上させた。
  • GPT-4を用いた初期実装により、CARLAシミュレーション内でのLLM駆動の行動模倣およびガイダンスの機能が確認され、衝突回避およびユーザー支援の両方が実現した。
  • ニューヨークシティおよびニュージャージー州のテストベッドから得た実世界の道路データが、CARLAシミュレーションに正常にインポートされ、検証およびクロスドメインテストが可能になった。
  • LLMのスケーラブルな展開により、人間エージェントのシミュレーションが可能となり、訓練中に実際の人間参加者に依存する必要が大幅に減少した。
  • 予備的な結果から、提案されたシミュレーションから現実への移行フレームワークの理論的妥当性およびインfra構築の準備が整っていることが確認された。
Figure 2. Simulation room with VR headset, steering controls, and monitors for real-time multimodal data collection and autonomous driving optimization.
Figure 2. Simulation room with VR headset, steering controls, and monitors for real-time multimodal data collection and autonomous driving optimization.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。