Skip to main content
QUICK REVIEW

[论文解读] Action-Sufficient State Representation Learning for Control with Structural Constraints

Biwei Huang, Chaochao Lu|arXiv (Cornell University)|Oct 12, 2021
Reinforcement Learning in Robotics参考文献 51被引用 5
一句话总结

本文提出动作充分状态表征(ASRs)——一种最小化、结构受限的状态表征,仅捕捉在部分可观察环境中最优策略学习所必需的信息。通过建模环境的生成过程并利用从奖励最大化中推导出的结构约束,作者开发了一种结构化序列变分自编码器(SS-VAE),以学习紧凑且可解释的ASRs,在CarRacing和VizDoom基准测试中提升了样本效率与模型效率。

ABSTRACT

Perceived signals in real-world scenarios are usually high-dimensional and noisy, and finding and using their representation that contains essential and sufficient information required by downstream decision-making tasks will help improve computational efficiency and generalization ability in the tasks. In this paper, we focus on partially observable environments and propose to learn a minimal set of state representations that capture sufficient information for decision-making, termed extit{Action-Sufficient state Representations} (ASRs). We build a generative environment model for the structural relationships among variables in the system and present a principled way to characterize ASRs based on structural constraints and the goal of maximizing cumulative reward in policy learning. We then develop a structured sequential Variational Auto-Encoder to estimate the environment model and extract ASRs. Our empirical results on CarRacing and VizDoom demonstrate a clear advantage of learning and using ASRs for policy learning. Moreover, the estimated environment model and ASRs allow learning behaviors from imagined outcomes in the compact latent space to improve sample efficiency.

研究动机与目标

  • 为解决深度强化学习中因高维、噪声观测导致的效率低下与可解释性差的问题。
  • 识别在部分可观察环境中,对最优策略学习既充分又必要的最小状态表征集合。
  • 通过从奖励最大化目标中推导出的结构约束,形式化动作充分状态表征(ASRs)的概念。
  • 开发一种结构化生成模型与推理方法,实现在保持可解释性与下游策略性能的同时,可靠地提取ASRs。

提出的方法

  • 在部分可观察马尔可夫决策过程(POMDP)框架下,构建一个显式编码观测、状态、动作、奖励与动态之间关系的生成环境模型。
  • 将ASRs表征为与奖励在因果上相连的最小状态变量集合,无论直接或间接,均通过生成模型中的结构约束实现。
  • 开发一种结构化序列变分自编码器(SS-VAE),以建模观测、状态、动作与奖励的联合分布,同时通过可学习的邻接矩阵强制实施结构稀疏性。
  • 采用变分推理框架,联合优化环境模型与ASR提取过程,并引入正则化项,通过互信息最小化促进低维、最小化表征。
  • 将学习到的ASRs集成到下游策略学习中,实现在紧凑潜在空间中实现样本高效的模仿与规划。
  • 应用权重归一化与架构约束(如混合密度网络头、LSTM编码器)以提升训练稳定性与表征质量。

实验结果

研究问题

  • RQ1在部分可观察环境中,哪些状态变量对最优决策既必要又充分?
  • RQ2如何利用环境中生cheng过程的结构约束,识别出最小但充分的状态表征?
  • RQ3结构化变分自编码器能否可靠地从高维观测中学习并提取动作充分状态表征(ASRs)?
  • RQ4ASRs在基于模型的强化学习中,能在多大程度上提升样本效率与模型性能?
  • RQ5能否在ASRs的紧凑潜在空间中,通过想象的轨迹有效学习行为策略?

主要发现

  • 21维的ASR表征在VizDoom的‘躲避’任务中表现优异,优于原始观测与标准状态表征。
  • 估计的结构矩阵显示出稀疏连接性:仅少数状态维度影响奖励,且极少受动作影响,证实了所学习ASRs的最小性与充分性。
  • 基于ASRs的策略学习显著提升了样本效率,减少了在真实环境中进行高风险探索的需求。
  • 所学习的环境模型能够有效利用潜在空间中的想象结果进行行为学习,证明了使用紧凑表征进行基于模型规划的可行性。
  • SS-VAE框架成功解耦了相关状态动态,并提取出与任务底层结构一致的可解释、低维表征。
  • 在CarRacing与VizDoom上的实证结果表明,基于ASR的策略泛化能力更强,且所需交互次数少于基于原始观测训练的策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。