[论文解读] WebNav: A New Large-Scale Task for Natural Language based Sequential Decision Making.
本文提出了WebNav,一个大规模基准,用于评估基于自然语言的序列决策智能体在目标驱动的网络导航中的表现。该基准将网站转化为图结构环境,其中智能体需使用自然语言查询进行导航。利用包含500万篇维基百科文章和1200万条查询的WikiNav数据集,对神经网络智能体进行训练与评估,揭示了人类与机器在该任务中面临的重大挑战。
We propose a goal-driven web navigation as a benchmark task for evaluating an agent with abilities to understand natural language and plan on partially observed environments. In this challenging task, an agent navigates through a web site, which is represented as a graph consisting of web pages as nodes and hyperlinks as directed edges, to find a web page in which a query appears. The agent is required to have sophisticated high-level reasoning based on natural languages and efficient sequential decision making capability to succeed. We release a software tool, called WebNav, that automatically transforms a website into this goal-driven web navigation task, and as an example, we make WikiNav, a dataset constructed from the English Wikipedia containing approximately 5 million articles and more than 12 million queries for training. We evaluate two different agents based on neural networks on the WikiNav and provide the human performance. Our results show the difficulty of the task for both humans and machines. With this benchmark, we expect faster progress in developing artificial agents with natural language understanding and planning skills.
研究动机与目标
- 开发一项基准任务,评估智能体在部分可观测的网络环境中理解自然语言并执行序列决策的能力。
- 构建一个可扩展的框架,将真实网站自动转化为结构化的导航任务,用于训练和评估人工智能智能体。
- 发布WikiNav,一个基于英文维基百科的大规模数据集,包含500万篇文章和1200万条查询,用于训练和评估。
- 评估基于神经网络的智能体在该复杂任务中的表现,并与人类表现进行比较。
- 突出展示在网页导航中结合自然语言理解与长时程规划所面临的困难。
提出的方法
- 将网站转化为图结构环境,其中网页为节点,超链接为有向边。
- 将每个导航任务表示为一个目标:找到包含给定自然语言查询的网页。
- 使用名为WebNav的软件工具,通过提取页面和链接,自动从任意网站生成导航任务。
- 通过将WebNav应用于英文维基百科,构建WikiNav数据集,形成包含500万篇文章和超过1200万条查询的数据集。
- 利用该数据集训练和评估神经智能体,重点关注在部分可观测条件下的序列决策能力。
- 对机器智能体和人类表现进行基准测试,以评估该任务的难度。
实验结果
研究问题
- RQ1基于自然语言的神经智能体在大规模、目标驱动的网络导航任务中表现如何?
- RQ2在使用自然语言查询导航复杂网页结构时,人类用户与机器智能体之间的性能差距有多大?
- RQ3网页图的复杂性与部分可观测性在多大程度上对序列决策智能体构成挑战?
- RQ4WebNav框架在实现大规模网络导航基准自动创建方面的有效性如何?
- RQ5在网页导航中,将自然语言理解与长时程规划相结合面临哪些关键挑战?
主要发现
- WebNav基准揭示了目标驱动的网络导航存在显著难度,即使对人类参与者而言也是如此,表明智能体性能需达到较高标准。
- 在WikiNav上训练的神经智能体表现有限,表明当前模型在基于自然语言的长时程、多步导航任务中仍存在困难。
- 该任务对人类和机器而言均具挑战性,表明在推理与规划能力方面仍需进一步突破。
- 包含500万篇文章和超过1200万条查询的WikiNav数据集,为训练和评估智能体提供了大规模且真实的环境。
- WebNav工具能够自动将网站转化为结构化的导航任务,支持大规模基准测试的可扩展实现。
- 人类在该任务上的表现虽非微不足道,但仍显著优于当前的神经智能体,凸显了在推理与规划能力方面的差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。