[论文解读] Interactive Semantic Parsing for If-Then Recipes via Hierarchical Reinforcement Learning
本文提出一种用于交互式语义解析 If-Then 食谱的分层强化学习(HRL)智能体,该智能体可动态选择澄清问题及子任务顺序,以在最小化用户交互的前提下提升解析准确率。HRL 框架在模拟环境与人工评估中均优于非交互式及基于规则的基线模型,在提升准确率的同时减少了所需问题数量。
Given a text description, most existing semantic parsers synthesize a program in one shot. However, it is quite challenging to produce a correct program solely based on the description, which in reality is often ambiguous or incomplete. In this paper, we investigate interactive semantic parsing, where the agent can ask the user clarification questions to resolve ambiguities via a multi-turn dialogue, on an important type of programs called "If-Then recipes." We develop a hierarchical reinforcement learning (HRL) based agent that significantly improves the parsing performance with minimal questions to the user. Results under both simulation and human evaluation show that our agent substantially outperforms non-interactive semantic parsers and rule-based agents.
研究动机与目标
- 为解决在单次解析中因自然语言描述模糊或不完整而导致程序合成错误的问题,特别是针对 If-Then 食谱的解析挑战。
- 通过智能选择问题,最小化澄清问题数量,同时最大化解析准确率,从而降低用户交互成本。
- 开发一种强化学习框架,仅使用最终正确性反馈作为监督信号,学习在交互式解析过程中何时以及问什么问题。
- 通过分层策略学习将复杂解析任务分解为四个子任务:触发通道、触发函数、动作通道和动作函数。
- 使智能体能够基于上下文和用户响应,动态优化子任务执行顺序,从而提升整体效率与准确率。
提出的方法
- 将交互式语义解析建模为具有四个预定义子任务的分层马尔可夫决策过程(MDP):预测触发与动作组件。
- 实现两级策略:高层策略负责选择最优子任务顺序,低层策略则针对每个子任务决定是否提问或预测组件。
- 使用稀疏奖励信号进行策略训练——仅根据每个预测组件是否正确提供奖励——而无需对提问时机或用户响应质量提供显式监督。
- 在 HRL 框架中使用选项(options)实现时间抽象,降低状态-动作空间复杂度,提升学习效率。
- 设计用户模拟器以在训练期间生成合成用户响应,实现无需真实人类交互的端到端训练。
- 通过在奖励函数中平衡探索与利用,同时优化高解析准确率与低问题数量。
实验结果
研究问题
- RQ1分层强化学习智能体是否能通过交互式澄清问题有效解决 If-Then 食谱描述中的歧义?
- RQ2智能体动态选择子任务顺序的能力如何影响解析准确率与交互效率?
- RQ3在模拟环境与真实人工评估场景中,HRL 智能体是否能优于非交互式与基于规则的智能体?
- RQ4在仅使用正确性反馈作为监督信号的前提下,智能体在保持高准确率的同时,能在多大程度上最小化提问数量?
- RQ5该 HRL 框架在具有自然可分解子任务的其他语义解析任务中是否具备良好的泛化能力?
主要发现
- HRL 智能体在模拟与人工评估中均显著优于非交互式语义解析器,在模糊描述上的解析准确率更高。
- 与 HRL-fixedOrder 基线相比,HRL 智能体通过智能协调子任务顺序,提问更少,降低了交互成本且未牺牲准确率。
- 在人工评估中,HRL 智能体通过提出上下文相关的澄清问题,成功将模糊描述如 'record to evernote' 解析为正确的 If-Then 食谱。
- 智能体通过强化学习仅使用正确性反馈作为监督,学习仅提出必要问题,无需标注的问题时机数据。
- 由于其模块化、子任务分解的结构,HRL 框架在其他语义解析任务(如基于知识的问答)中也表现出良好的泛化能力。
- 即使用户响应为自然语言,智能体性能依然稳健,表明其能有效处理现实世界用户输入的多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。