Skip to main content
QUICK REVIEW

[论文解读] Improving Policy Learning via Language Dynamics Distillation

Victor W. Zhong, Jesse Mu|arXiv (Cornell University)|Sep 30, 2022
Topic Modeling被引用 5
一句话总结

本文提出语言动态蒸馏(LDD),一种方法:先通过无标注演示与语言描述预训练模型以预测环境动态,再在强化学习过程中通过蒸馏语言对齐表征进行微调。LDD 提升了样本效率与泛化能力,在五个语言丰富的环境(NetHack、ALFWorld、RTFM、Messenger、Touchdown)中优于从零开始的强化学习、VAE 预训练以及基于专家的奖励设计。

ABSTRACT

Recent work has shown that augmenting environments with language descriptions improves policy learning. However, for environments with complex language abstractions, learning how to ground language to observations is difficult due to sparse, delayed rewards. We propose Language Dynamics Distillation (LDD), which pretrains a model to predict environment dynamics given demonstrations with language descriptions, and then fine-tunes these language-aware pretrained representations via reinforcement learning (RL). In this way, the model is trained to both maximize expected reward and retain knowledge about how language relates to environment dynamics. On SILG, a benchmark of five tasks with language descriptions that evaluate distinct generalization challenges on unseen environments (NetHack, ALFWorld, RTFM, Messenger, and Touchdown), LDD outperforms tabula-rasa RL, VAE pretraining, and methods that learn from unlabeled demonstrations in inverse RL and reward shaping with pretrained experts. In our analyses, we show that language descriptions in demonstrations improve sample-efficiency and generalization across environments, and that dynamics modelling with expert demonstrations is more effective than with non-experts.

研究动机与目标

  • 解决在稀疏、延迟奖励的强化学习中对复杂语言抽象进行对齐的挑战。
  • 克服在强化学习中将语言理解与策略优化解耦的困难。
  • 利用廉价的无标注演示与语言描述,提升语言对齐策略学习的样本效率与泛化能力。
  • 探究使用专家与非专家演示进行动态建模,对初始化与蒸馏信号效果的影响。
  • 评估语言描述在预训练与后续策略学习中的贡献。

提出的方法

  • 使用无标注演示,预训练教师模型以从先前观测中预测下一次观测(包括语言描述)。
  • 在强化学习过程中,利用预训练的教师模型初始化并蒸馏中间表征到策略学习者。
  • 应用知识蒸馏以在优化累积奖励的同时保留语言对齐的动态知识。
  • 在廉价收集的无标注演示上训练动态模型,避免动作标注的成本。
  • 在微调策略网络时结合强化学习,同时从固定教师模型中蒸馏知识,防止语言理解能力的灾难性遗忘。
  • 将观测中的语言描述(如事件消息、空间描述)作为输入的一部分,以改善对齐与动态建模。

实验结果

研究问题

  • RQ1在无标注演示与语言描述上预训练动态模型,是否能提升强化学习中下游策略学习的效果?
  • RQ2从预训练的动态模型中蒸馏语言对齐表征,是否能提升语言丰富环境中策略学习的样本效率与泛化能力?
  • RQ3演示质量(专家 vs. 非专家)如何影响动态建模与后续策略蒸馏的有效性?
  • RQ4观测中的语言描述在多大程度上提升了动态建模的准确性与最终策略的性能?
  • RQ5与 VAE 预训练、逆强化学习或使用预训练专家的奖励设计等替代方法相比,语言动态蒸馏是否更有效?

主要发现

  • 在 SILG 基准的五个环境中,LDD 均优于从零开始的强化学习、VAE 预训练以及基于专家的奖励设计。
  • 在 NetHack 与 Touchdown 中,若在动态预训练阶段移除观测中的语言描述,性能显著下降,表明语言描述在初始化与蒸馏中起关键作用。
  • 在专家演示上训练的动态模型,其帧预测准确率高于在非专家轨迹上训练的模型,尤其在 NetHack 与 Touchdown 等部分可观察环境中更为明显。
  • LDD 在除 Touchdown 外的所有环境中均实现更快收敛与更高的评估胜率,而在 Touchdown 中虽训练性能较低,但评估性能更高。
  • 语言描述提升了动态模型的准确性,从而带来更优的策略初始化与更强的蒸馏增益。
  • 在复杂环境(如需要长期规划或稀有状态探索)中,专家演示提供的动态信号比非专家轨迹更具信息量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。