[论文解读] Domain-Adversarial and Conditional State Space Model for Imitation Learning
该论文提出了一种领域对抗性且领域条件化的状态空间模型(DAC-SSM),用于在存在显著领域差异的局部可观测环境中,学习领域无关、任务相关且动态感知的状态表征,以实现模仿学习。通过联合优化状态推理、观测重建、前向动态预测和奖励建模,并结合领域判别器和领域条件编码器/解码器进行对抗性训练,DAC-SSM 使智能体在连续控制任务中实现了专家级性能——在稀疏奖励仿真环境中,其表现优于基线模型超过2倍。
State representation learning (SRL) in partially observable Markov decision processes has been studied to learn abstract features of data useful for robot control tasks. For SRL, acquiring domain-agnostic states is essential for achieving efficient imitation learning. Without these states, imitation learning is hampered by domain-dependent information useless for control. However, existing methods fail to remove such disturbances from the states when the data from experts and agents show large domain shifts. To overcome this issue, we propose a domain-adversarial and conditional state space model (DAC-SSM) that enables control systems to obtain domain-agnostic and task- and dynamics-aware states. DAC-SSM jointly optimizes the state inference, observation reconstruction, forward dynamics, and reward models. To remove domain-dependent information from the states, the model is trained with domain discriminators in an adversarial manner, and the reconstruction is conditioned on domain labels. We experimentally evaluated the model predictive control performance via imitation learning for continuous control of sparse reward tasks in simulators and compared it with the performance of the existing SRL method. The agents from DAC-SSM achieved performance comparable to experts and more than twice the baselines. We conclude domain-agnostic states are essential for imitation learning that has large domain shifts and can be obtained using DAC-SSM.
研究动机与目标
- 为解决模仿学习中的领域差异挑战,即专家数据与智能体数据在外观或与控制无关的上下文上存在差异。
- 学习对领域特定干扰(如机器人外观、摄像头角度)具有不变性的状态表征,同时保留与任务相关的动态信息。
- 通过解耦领域不变的控制特征与领域特定的噪声,提升在部分可观察马尔可夫决策过程(POMDPs)中的模仿学习性能。
- 开发一个统一框架,联合优化状态推理、重建、动态预测与奖励建模,以实现鲁棒的模仿学习。
- 验证在存在显著领域差异,尤其是稀疏奖励环境中,领域无关状态表征对于有效模仿学习的必要性。
提出的方法
- DAC-SSM 在循环状态空间模型(RSSM)的基础上,引入领域对抗性训练,以最小化潜在状态中的领域特异性信息。
- 训练一个领域判别器以分类潜在状态的领域,并通过梯度反传最小化其损失,以促进领域不变性。
- 编码器和解码器均以领域标签为条件,以实现对领域特异性和控制相关特征的解耦重建。
- 模型联合优化四个目标:状态推理、观测重建、前向动态预测与奖励建模。
- 奖励模型被实现为一个最优性判别器,基于潜在状态评估轨迹质量,模仿奖励则从领域无关的表征中计算得出。
- 训练目标包含领域混淆损失(对抗性)与基于领域标签的重建损失,从而实现控制相关特征与领域特异性特征的解耦。
实验结果
研究问题
- RQ1在专家数据与智能体数据存在显著领域差异的情况下,能否有效学习到领域无关的状态表征?
- RQ2当存在与控制无关的视觉变化时,使用领域判别器进行对抗性训练是否能提升模仿学习性能?
- RQ3对编码器和解码器施加领域标签条件,如何影响领域不变特征与任务相关特征的解耦?
- RQ4DAC-SSM 是否能在存在领域差异的稀疏奖励连续控制任务中,超越现有SRL方法的模仿学习性能?
- RQ5超参数调优(如领域混淆损失系数)对学习到的状态表征质量有何影响?
主要发现
- DAC-SSM 在所有评估的稀疏奖励任务中均达到了与专家策略相当的性能,其累积回报优于基线模型(PlaNet+D_O)超过2倍。
- 采用双奖励机制的DAC-SSM版本(DAC/dual)在大多数任务中表现最佳,仅在Cup-Catch任务中因规划时长远低于预期而表现不佳。
- 当移除领域对抗性训练(DA/dual)后,性能显著下降,表明对抗性训练对实现领域不变性至关重要。
- 消融实验表明,仅使用领域条件编码器/解码器(DC/dual)的模型表现接近DAC/dual,但仅当与对抗性训练结合时,模型才能达到最优性能。
- 重建结果证实,DAC-SSM 能够捕捉与控制相关的特征(如关节角度),同时抑制领域特异性特征(如地板颜色、物体纹理),实现了成功的特征解耦。
- 领域混淆损失系数 λ 的最优值具有任务依赖性,例如在Connector-Insertion任务中,λ=3 时性能最佳,表明超参数调优对模型鲁棒性至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。