[论文解读] The Role of Pretrained Representations for the OOD Generalization of RL Agents
本文研究了预训练变分自编码器(VAE)基表示如何提升强化学习(RL)智能体在分布外(OOD)设置下的泛化能力。通过在模拟环境中对240种表示和10,000条RL策略进行大量实验,发现这些表示上的代理任务能可靠预测下游OOD泛化性能,从而实现对能生成鲁棒智能体的表示的高效选择——即使在具有挑战性的仿真到现实分布偏移下也如此。
Building sample-efficient agents that generalize out-of-distribution (OOD) in real-world settings remains a fundamental unsolved problem on the path towards achieving higher-level cognition. One particularly promising approach is to begin with low-dimensional, pretrained representations of our world, which should facilitate efficient downstream learning and generalization. By training 240 representations and over 10,000 reinforcement learning (RL) policies on a simulated robotic setup, we evaluate to what extent different properties of pretrained VAE-based representations affect the OOD generalization of downstream agents. We observe that many agents are surprisingly robust to realistic distribution shifts, including the challenging sim-to-real case. In addition, we find that the generalization performance of a simple downstream proxy task reliably predicts the generalization performance of our RL agents under a wide range of OOD settings. Such proxy tasks can thus be used to select pretrained representations that will lead to agents that generalize.
研究动机与目标
- 研究预训练表示如何提升RL智能体在分布外(OOD)设置下的泛化能力。
- 评估不同VAE基表示特性对下游RL策略在分布偏移下性能的影响。
- 确定一个简单代理任务是否能可靠预测RL智能体在不同表示上的OOD泛化能力。
- 识别在类似真实世界设置中导致鲁棒、样本高效RL智能体的表示特性。
提出的方法
- 在模拟机器人环境中训练240种不同的VAE基表示,以捕捉多样化的世界表征。
- 在每种表示之上训练超过10,000条RL策略,以评估其在OOD设置下的下游泛化性能。
- 使用代理任务——在简单非RL下游任务上评估表示质量——来预测RL智能体的OOD泛化性能。
- 在多种OOD设置下评估泛化性能,包括仿真到现实的迁移、观测空间中的分布偏移以及动作空间的变化。
- 分析代理任务性能与实际RL智能体性能在多种表示类型之间的相关性。
实验结果
研究问题
- RQ1预训练的VAE基表示在多大程度上提升了RL智能体在OOD设置下的泛化能力?
- RQ2一个简单的代理任务是否能准确预测在不同表示上训练的RL智能体的OOD泛化性能?
- RQ3预训练表示的哪些特性与下游RL策略在OOD设置下的鲁棒泛化能力最强相关?
- RQ4表示质量如何影响在仿真到现实分布偏移下的样本效率与鲁棒性?
主要发现
- 许多在预训练表示上训练的RL智能体即使未进行显式领域自适应,也对现实的分布偏移(包括仿真到现实的迁移)表现出强鲁棒性。
- 在表示上执行的简单下游代理任务的性能,能强烈预测对应RL智能体在多样化OOD设置下的OOD泛化性能。
- 在代理任务上表现良好的表示,始终能生成泛化性能更优的RL智能体,从而实现对高性能表示的高效筛选。
- 即使不进行微调,预训练表示也能显著提升样本效率与OOD泛化能力,表明其作为真实世界RL中归纳偏置的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。