[论文解读] DOM-Q-NET: Grounded RL on Structured Language
DOM-Q-NET 提出了一种基于图神经网络和目标注意力机制的因子化 Q-network 架构,用于基于结构化语言的网页导航,实现了在 MiniWoB 基准上的样本高效、无专家示范的强化学习。通过联合训练点击、输入和模式动作的独立 MLP 头部以及分层的 DOM 表示,该方法在多任务学习中实现了最先进性能,并将样本效率提升至 2 倍。
Building agents to interact with the web would allow for significant improvements in knowledge understanding and representation learning. However, web navigation tasks are difficult for current deep reinforcement learning (RL) models due to the large discrete action space and the varying number of actions between the states. In this work, we introduce DOM-Q-NET, a novel architecture for RL-based web navigation to address both of these problems. It parametrizes Q functions with separate networks for different action categories: clicking a DOM element and typing a string input. Our model utilizes a graph neural network to represent the tree-structured HTML of a standard web page. We demonstrate the capabilities of our model on the MiniWoB environment where we can match or outperform existing work without the use of expert demonstrations. Furthermore, we show 2x improvements in sample efficiency when training in the multi-task setting, allowing our model to transfer learned behaviours across tasks.
研究动机与目标
- 解决使用深度强化学习进行网页导航时面临的巨大且可变的动作空间与稀疏奖励的挑战。
- 通过基于 DOM 树建模结构化网页界面,实现在无需专家示范情况下的端到端训练。
- 通过多任务训练提升样本效率,并实现在多样化网页任务之间的迁移学习。
- 开发一种完全可微分的架构,联合优化网页交互中的状态、动作和目标表征。
- 展示因子化 Q 函数参数化在真实网页环境中对点击、输入和模式动作的优越性。
提出的方法
- 使用图神经网络(GNN)编码网页的树状 DOM 结构,捕捉局部、邻近和全局表征。
- 采用三个独立的多层感知机(MLP)对 Q 函数进行参数化,分别对应点击、输入和模式三类动作。
- 引入目标注意力机制,根据任务目标动态关注相关 DOM 元素,提升多任务设置下的泛化能力。
- 应用神经消息传递与读出机制,聚合 DOM 树中节点特征以生成状态表征。
- 使用经验回放和优先经验回放,通过深度强化学习端到端训练整个架构。
- 利用分段树实现高效的优先经验回放,以加速学习过程。
实验结果
研究问题
- RQ1深度强化学习智能体是否能在不依赖专家示范的情况下解决复杂的网页导航任务?
- RQ2因子化 Q 函数参数化在具有巨大动作空间的网页导航中,如何提升样本效率?
- RQ3多任务学习在多样的网页任务之间实现行为迁移的潜力有多大?
- RQ4目标注意力在不同任务目标下,引导智能体聚焦于相关 DOM 元素方面的有效性如何?
- RQ5在基于 GNN 的 DOM 编码中,局部、邻近和全局表征对任务性能的贡献分别是什么?
主要发现
- DOM-Q-NET 在 MiniWoB 基准上无需任何专家示范,性能达到或超越现有方法。
- 与单任务训练相比,多任务学习中样本效率提升 2 倍,11 项任务的总帧数从 477,000 减少至 319,000。
- 消融实验表明,若省略邻近模块,智能体会在点击复选框等任务中失败,凸显其必要性。
- 目标注意力在多任务设置中显著提升样本效率,尽管在单任务场景中增益较小,表明其在跨任务泛化中的关键作用。
- 模型成功实现了任务间的知识迁移,多任务智能体在预训练于简单任务后,能更高效地解决复杂任务(如社交媒体、搜索引擎)。
- 局部和全局 GNN 模块提供互补的表征:全局模块支持高层理解,局部模块捕捉细粒度细节。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。