[论文解读] Stabilizing Off-Policy Deep Reinforcement Learning from Pixels
本文識別出『視覺致命三聯征』——即使用卷積編碼器與低幅度稀疏獎勵的TD學習——為從畫素輸入的異策略深度強化學習中不穩定的根本原因,導致災難性自我過擬合。本文提出A-LIX方法,透過可學習層實現自適應梯度正則化與雙目標機制,在不使用數據增強或輔助損失的情況下,於DeepMind Control與Atari 100k基準上達到最尖端性能。
Off-policy reinforcement learning (RL) from pixel observations is notoriously unstable. As a result, many successful algorithms must combine different domain-specific practices and auxiliary losses to learn meaningful behaviors in complex environments. In this work, we provide novel analysis demonstrating that these instabilities arise from performing temporal-difference learning with a convolutional encoder and low-magnitude rewards. We show that this new visual deadly triad causes unstable training and premature convergence to degenerate solutions, a phenomenon we name catastrophic self-overfitting. Based on our analysis, we propose A-LIX, a method providing adaptive regularization to the encoder's gradients that explicitly prevents the occurrence of catastrophic self-overfitting using a dual objective. By applying A-LIX, we significantly outperform the prior state-of-the-art on the DeepMind Control and Atari 100k benchmarks without any data augmentation or auxiliary losses.
研究动机与目标
- 識別從畫素觀測輸入的異策略深度強化學習中不穩定的根本原因。
- 透過分析梯度信號受損,解釋為何現有方法依賴數據增強與輔助損失。
- 提出一種方法,可在不使用輔助損失或影像增強的情況下穩定訓練。
- 僅透過所提出的正則化機制,在DeepMind Control與Atari 100k基準上展示最尖端性能。
提出的方法
- 提出『視覺致命三聯征』——即TD損失、未正則化的CNN編碼器與低幅度獎勵——為不穩定的來源。
- 引入歸一化不連續性(ND)指標,用以量化梯度信號的不連續性,並預測自我過擬合。
- 設計一個可學習層LIX,透過參數化空間正則化,明確在特徵圖中強制實現平滑梯度。
- 採用雙目標機制,根據估計的ND指標適應性調整LIX參數,以穩定訓練過程。
- 將A-LIX無縫整合至異策略算法中,不修改主要訓練目標,亦不增加輔助損失。
- 在DeepMind Control與Atari 100k上驗證方法,結果顯示在無數據增強或輔助頭部的情況下表現更優異。
实验结果
研究问题
- RQ1為何異策略深度強化學習演算法在畫素觀測輸入下無法穩定訓練,即使在本體感覺設定中表現成功?
- RQ2TD學習、卷積編碼器與稀疏獎勵的組合如何導致視覺強化學習中的不穩定優化?
- RQ3特徵圖中高空間頻率梯度在導致過早收斂與退化解中扮演何種角色?
- RQ4為何數據增強與輔助損失在先前最尖端的視覺強化學習方法中被普遍使用?
- RQ5單一自適應正則化機制是否可取代視覺異策略強化學習中多種啟發式組件的需求?
主要发现
- 視覺致命三聯征導致編碼器特徵圖中出現高空間頻率梯度,進而引發不穩定優化與過早收斂。
- 歸一化不連續性(ND)指標與代理性能強烈相關,並能預測災難性自我過擬合。
- A-LIX在DeepMind Control與Atari 100k基準上顯著優於先前最尖端方法,且無需數據增強或輔助損失。
- 使用A-LIX訓練的代理在動作值曲面中對動作變化的敏感度更高,顯示更好的策略優化穩定性。
- 透過損失曲面分析與棋盤紋 Artifact 實驗,顯示該方法有效降低對特徵圖中高頻噪音的過擬合。
- A-LIX實現了僅需最少超參數調校的穩定訓練,展現出在多樣化視覺強化學習環境中的魯棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。