[论文解读] Unified Pragmatic Models for Generating and Following Instructions
本文提出了一种统一的语用推理框架,通过建模说话者与听者对彼此意图的推理,提升了复杂、序列化任务中的指令生成与指令遵循能力。通过将学习到的基模型与反事实推理相结合——说话者预判听者的理解,听者推断说话者意图——该方法实现了最先进性能,在导航、拼图和交互任务等多样化领域中,指令生成的准确率最高提升46%,指令理解的准确率最高提升10%。
We show that explicit pragmatic inference aids in correctly generating and following natural language instructions for complex, sequential tasks. Our pragmatics-enabled models reason about why speakers produce certain instructions, and about how listeners will react upon hearing them. Like previous pragmatic models, we use learned base listener and speaker models to build a pragmatic speaker that uses the base listener to simulate the interpretation of candidate descriptions, and a pragmatic listener that reasons counterfactually about alternative descriptions. We extend these models to tasks with sequential structure. Evaluation of language generation and interpretation shows that pragmatic inference improves state-of-the-art listener models (at correctly interpreting human instructions) and speaker models (at producing instructions correctly interpreted by humans) in diverse settings.
研究动机与目标
- 通过在指令生成与理解中建模语用推理,解决人类标注指令与动作序列之间直接映射的局限性。
- 将显式语用推理从先前的简单指代游戏扩展至具有结构化世界状态和相互依赖动作的复杂、序列化、具身任务。
- 通过使智能体能够推理彼此意图及潜在误解,同时提升指令遵循与指令生成的性能。
- 证明语用推理可生成比人类标注数据更具鲁棒性的指令,甚至在某些情况下优于人类生成的指引。
- 验证统一推理流程的有效性,即使用相同的推理机制处理说话者与听者角色,并共享基模型。
提出的方法
- 利用学习到的基说话者与听者模型作为语用推理的基础组件。
- 通过基听者模型模拟候选指令的听者理解,选择最具可解释性的输出,构建语用说话者。
- 通过反事实推理构建语用听者:评估是否存在其他描述更可能产生所观察到的指令。
- 应用统一推理流程,说话者与听者均使用对另一方行为的共享模型,选择最偏好输出序列。
- 通过重排序实现模型组合:候选输出使用基模型评分,并通过语用推理机制整合。
- 使用基模型的集成(例如10个基听者与10个基说话者)提升鲁棒性,理性模型的表现优于相同规模的简单集成。
实验结果
研究问题
- RQ1显式语用推理是否能在复杂、序列化任务中,使指令生成性能超越基模型?
- RQ2语用推理是否可通过使听者基于说话者意图进行反事实推理,提升指令遵循性能以解决歧义?
- RQ3是否能通过统一的语用推理框架——对说话者与听者应用相同的推理机制——在多样化领域中实现一致的性能提升?
- RQ4语用模型在多大程度上能生成比人类标注指令更具可遵循性的指令,即使后者被视为真实标准?
- RQ5理性听者或说话者的性能与基模型的简单集成相比如何?统一模型组合是否具有优势?
主要发现
- 语用说话者模型在各领域中指令生成的准确率最高提升46%,在Tangrams领域显著优于基模型与人类标注指令。
- 语用听者模型相比基模型将理解准确率最高提升10%,即使存在多条路径满足字面指令,也能正确选择路径。
- 在SAIL导航领域,理性说话者生成的指令与先前最先进系统(DBW)的准确率相当,尽管其基于统一的语用框架生成。
- 使用10个基听者与10个基说话者的理性听者在Scene领域达到72.7%的准确率,优于20个基听者的简单集成(71.9%)。
- 在Tangrams领域,理性说话者将人类可遵循性准确率从58.7%提升至92.7%,证明语用推理可生成优于人类标注指令的指令。
- BLEU分数被发现是可遵循性的一个差指标,高BLEU分数并不对应高指令准确率——凸显语用推理相较于自动指标的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。