Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Discrete Soft Actor-Critic

Haibin Zhou, Wei, Tong|arXiv (Cornell University)|Sep 21, 2022
Neural Networks and Reservoir Computing被引用数 11
ひとこと要約

この論文は離散的Softアクターキャリブレーター(SAC)を再考し、2つの主要な失敗モードを特定する:無限大に発散するエントロピー更新によるポリシーの不安定化、およびクリッピングされた二重Q学習によるQ値の低減推定。これらの問題を解決するために、ポリシー更新を制約するエントロピーペナルティと、Q値推定を安定化させる二重平均Q学習にQクリッピングを組み合わせた手法を提案。この手法は、Atariゲームと大規模なMOBAゲーム(Honor of Kings)において顕著な性能向上を達成した。

ABSTRACT

We study the adaption of Soft Actor-Critic (SAC), which is considered as a state-of-the-art reinforcement learning (RL) algorithm, from continuous action space to discrete action space. We revisit vanilla discrete SAC and provide an in-depth understanding of its Q value underestimation and performance instability issues when applied to discrete settings. We thereby propose Stable Discrete SAC (SDSAC), an algorithm that leverages entropy-penalty and double average Q-learning with Q-clip to address these issues. Extensive experiments on typical benchmarks with discrete action space, including Atari games and a large-scale MOBA game, show the efficacy of our proposed method. Our code is at: https://github.com/coldsummerday/SD-SAC.git.

研究の動機と目的

  • 連続領域では成功を収めているものの、離散的行動空間では性能が著しく劣る、元々の離散的SACの劣化要因を診断・是正すること。
  • 特に無限大に発散するポリシー更新とクリッピングされた二重Q学習に起因する、離散的SACにおける訓練の不安定化とQ値推定の低減の根本的要因を同定すること。
  • エントロピーペナルティと二重平均Q学習にQクリッピングを組み合わせることで、離散環境におけるサンプル効率と訓練安定性を向上させること。
  • 標準ベンチマーク(Atari)と大規模な産業的MOBAゲーム(Honor of Kings)における本手法の有効性を検証し、スケーラビリティを示すこと。

提案手法

  • ポリシー最適化の目的関数にエントロピーペナルティを導入し、ポリシー更新の大きさを制約することで、訓練を不安定化させる急激なエントロピー変動を防ぐ。
  • 二重平均Q学習にQクリッピングを組み合わせた手法を提案。2つのQネットワークの出力を平均化し、その出力を固定範囲にクリッピングすることで、推定バイアスを低減する。
  • Q値推定の上限を表すQクリッピング範囲 $ c $ を導入。アブレーションスタディで $ c = 0.5 $ が最適であると判明。
  • 学習可能なエントロピーペナルティ係数 $ \beta $ を採用。$ \beta = 0.5 $ が探索と安定性のバランスを最良に保つことが示された。
  • 標準的な状態表現と離散的行動空間を用いて、AtariゲームとHonor of Kings 1v1環境に本手法を適用。
  • ELOレーティングと訓練曲線を用いて、離散的SACおよびRainbowベースラインと定量的に性能を比較。

実験結果

リサーチクエスチョン

  • RQ1連続制御では成功を収めているにもかかわらず、なぜ元々の離散的SACはAtariのような離散的環境で失敗するのか?
  • RQ2ポリシー更新の不安定化とQ値推定の低減に関連する、離散的SACの主な失敗モードは何か?
  • RQ3エントロピーペナルティはどのように離散的SACにおけるポリシー更新の安定性を向上させるか?
  • RQ4二重平均Q学習にQクリッピングを組み合わせることで、Q値の低減推定を効果的に是正できるか?
  • RQ5本手法は、Honor of Kings 1v1のような大規模で複雑な環境にも効果的にスケーリングできるか?

主な発見

  • 提案手法は、全59種類のAtariゲームにおいて、元々の離散的SACを顕著に上回り、平均で人間正規化スコアが22.4%向上した。
  • Honor of Kings 1v1環境において、3回の評価スナップショット(24、36、48時間)すべてで、離散的SACを上回るELOレーティングを達成した。
  • 損失関数の表面可視化から、提案手法は離散的SACに比べてより平坦で凸的な最適化の流れを示しており、滑らかな最適化が可能であることが示された。
  • アブレーションスタディにより、$ \beta = 0.5 $ と $ c = 0.5 $ が安定性と性能のバランスを最良に保つことが確認された。
  • 訓練の不安定性が低減され、特に報酬が疎な環境においてサンプル効率が向上した。
  • 改善が見られたものの、長時間にわたる意思決定タスクでは依然として性能が劣る傾向があり、長時間にわたるシーケンスにおける信用配分の限界が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。