Skip to main content
QUICK REVIEW

[论文解读] Countering Language Drift with Seeded Iterated Learning

Yuchen Lu, Soumye Singhal|arXiv (Cornell University)|Mar 28, 2020
Topic Modeling参考文献 60被引用 4
一句话总结

本文提出种子迭代学习(SIL),一种无需外部语言约束的、与任务无关的方法,通过定期让学生代理模仿新训练的教师代理来缓解任务导向对话智能体中的语言漂移问题。SIL在保持句法和语义语言结构的同时提升了任务完成度,在玩具级和真实世界语言游戏中均优于基线模型。

ABSTRACT

Pretraining on human corpus and then finetuning in a simulator has become a standard pipeline for training a goal-oriented dialogue agent. Nevertheless, as soon as the agents are finetuned to maximize task completion, they suffer from the so-called language drift phenomenon: they slowly lose syntactic and semantic properties of language as they only focus on solving the task. In this paper, we propose a generic approach to counter language drift called Seeded iterated learning (SIL). We periodically refine a pretrained student agent by imitating data sampled from a newly generated teacher agent. At each time step, the teacher is created by copying the student agent, before being finetuned to maximize task completion. SIL does not require external syntactic constraint nor semantic knowledge, making it a valuable task-agnostic finetuning protocol. We evaluate SIL in a toy-setting Lewis Game, and then scale it up to the translation game with natural language. In both settings, SIL helps counter language drift as well as it improves the task completion compared to baselines.

研究动机与目标

  • 解决通过交互式强化学习训练的任务导向对话智能体中的语言漂移问题。
  • 在微调过程中保持预训练语言模型的句法和语义特性。
  • 开发一种无需外部语言知识或约束的、与任务无关的自监督方法。
  • 在受控环境和真实世界语言游戏中实证验证该方法。
  • 理解模仿学习在交互式训练中如何稳定语言分布的机制。

提出的方法

  • SIL在教师智能体的交互式训练与学生智能体的监督式模仿学习之间交替进行。
  • 在每次迭代中,教师被初始化为当前学生的一个副本,并通过强化学习微调以最大化任务完成度。
  • 教师通过贪婪解码生成与任务相关的语句数据集,随后用于监督学习微调学生。
  • 该过程在多代之间重复,每代学生均基于新训练的教师输出进行优化。
  • 该方法利用模仿学习的归纳偏置,过滤掉非结构化、任务特定的语言,从而保留自然语言特性。
  • 该协议在Lewis游戏(单轮发送者-接收者)和法语-德语翻译游戏两种场景中应用,以评估其鲁棒性与可扩展性。

实验结果

研究问题

  • RQ1一种自监督的、与任务无关的方法能否有效抑制交互式对话智能体中的语言漂移?
  • RQ2种子迭代学习在交互式训练过程中如何保持句法和语义结构?
  • RQ3与标准微调基线相比,SIL是否在保持语言质量的同时提升任务完成度?
  • RQ4提前停止SIL对语言漂移和任务表现有何影响?
  • RQ5在不同训练设置下,语言似然与语义对齐度量与语言漂移之间的相关性如何?

主要发现

  • 与基线相比,SIL通过将负对数似然(NLL)降低11%,有效减少了语言漂移,表明生成语句的句法结构更优。
  • 模仿学习后,学生模型的NLL始终低于教师模型,表明监督微调能有效过滤非结构化语言。
  • 当SIL提前停止时,尽管任务表现仍在提升,但语言质量迅速下降,表明SIL在整个训练过程中持续抑制语言漂移。
  • SIL在提升语言似然的同时保持了稳定的语义对齐度(R1),表明其在增强语法结构的同时保留了语义信息。
  • 在翻译游戏中,SIL生成的句子在语法正确性和可理解性上均优于基线模型(vanilla Gumbel和S2P),即使在处理罕见词汇时也表现更优。
  • 该方法在任务完成度和语言质量方面均优于强基线模型,证明其在交互式学习过程中有效保持了自然语言特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。