[论文解读] Off-Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers
本文提出 DARC(基于分类器的奖励域自适应),一种通过使用分类器区分源域与目标域转移状态来修改奖励函数的方法,从而在强化学习中提升策略迁移性能。通过惩罚类似源域的动力学行为,DARC 使在更安全的源域中训练的策略能够有效泛化至动力学不同的目标域,在温和假设下实现理论保证的近最优性能。
We propose a simple, practical, and intuitive approach for domain adaptation in reinforcement learning. Our approach stems from the idea that the agent's experience in the source domain should look similar to its experience in the target domain. Building off of a probabilistic view of RL, we formally show that we can achieve this goal by compensating for the difference in dynamics by modifying the reward function. This modified reward function is simple to estimate by learning auxiliary classifiers that distinguish source-domain transitions from target-domain transitions. Intuitively, the modified reward function penalizes the agent for visiting states and taking actions in the source domain which are not possible in the target domain. Said another way, the agent is penalized for transitions that would indicate that the agent is interacting with the source domain, rather than the target domain. Our approach is applicable to domains with continuous states and actions and does not require learning an explicit model of the dynamics. On discrete and continuous control tasks, we illustrate the mechanics of our approach and demonstrate its scalability to high-dimensional tasks.
研究动机与目标
- 解决从源域(如仿真环境)向动力学不同的目标域迁移策略的挑战,其中在目标域中直接训练成本高或存在安全隐患。
- 开发一种无需建模转移概率即可补偿动力学差异的方法,从而在高维控制任务中实现可扩展的迁移。
- 提供一种理论基础扎实的方法,在轻量假设下保证目标域中接近最优的性能表现。
- 证明通过学习到的分类器修改奖励函数,可隐式学习到安全且有效的行为,而无需显式奖励塑造。
提出的方法
- 该方法使用两个二分类器,用于区分来自源域与目标域的转移状态,训练数据为状态-动作-下一状态三元组。
- 利用这些分类器估计的密度比对数来修改奖励函数,对类似源域动力学的转移施加惩罚。
- 修改后的奖励函数源自期望回报的变分下界,确保源域与目标域策略之间的一致性。
- 该方法无需显式建模动力学或转移概率,因此可扩展至高维连续控制任务。
- 该方法在源域训练过程中应用,目标是生成在目标域中具有良好泛化能力的策略。
- 分类器同时依赖于状态和动作,这在边际状态分布相似时对区分动力学差异至关重要。
实验结果
研究问题
- RQ1我们能否通过基于学习到的源域与目标域转移分类器来修改奖励函数,实现在强化学习中的有效域自适应?
- RQ2在何种条件下,基于分类器的密度比估计的奖励修改可使目标域中的策略接近最优?
- RQ3为何将分类器同时基于状态和动作进行条件化,相较于仅基于状态的无动作依赖方法,在动力学适应中表现更优?
- RQ4该方法是否可在无需显式动力学建模的情况下,泛化至高维连续控制任务?
- RQ5即使未提供显式的安全奖励,该方法是否仍能隐式学习到安全行为?
主要发现
- DARC 成功将策略从源域迁移至动力学不同的目标域,在离散与连续控制任务中均实现了近最优性能。
- 在 111 维 Ant 任务中,DARC 无需估计动力学模型即可有效扩展,且在样本效率与稳定性方面优于基于模型的基线方法。
- 在动作效果反转的网格世界环境中,DARC 在 80% 的试验中成功,而 MATL(缺乏动作条件化)在 100% 的试验中失败。
- 该方法使智能体在源域中避免了可能导致目标域中智能体提前终止的不安全行为,表明其在无显式奖励塑造的情况下实现了隐式安全。
- 实验表明,DARC 在所有评估任务中均优于 MATL 和标准强化学习等基线方法,包括具有随机策略和细微动力学偏移的任务。
- 理论分析表明,在轻量假设下,DARC 可保证生成的目标域策略性能接近最优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。