[论文解读] Iterative Hierarchical Attention for Answering Complex Questions over Long Documents
本文提出 DocHopper,一种新颖的迭代层次注意力模型,通过在连续嵌入空间中更新查询而非拼接文本,实现对长篇结构化文档的复杂多跳问题问答。该模型在四个基准数据集(QASPER、HybridQA、ShARC 和 HotpotQA)上达到最先进性能,准确率比基线模型高出 3–5%,且推理速度提升 3–10 倍,得益于预计算的文档表征。
We propose a new model, DocHopper, that iteratively attends to different parts of long, hierarchically structured documents to answer complex questions. Similar to multi-hop question-answering (QA) systems, at each step, DocHopper uses a query $q$ to attend to information from a document, combines this ``retrieved'' information with $q$ to produce the next query. However, in contrast to most previous multi-hop QA systems, DocHopper is able to ``retrieve'' either short passages or long sections of the document, thus emulating a multi-step process of ``navigating'' through a long document to answer a question. To enable this novel behavior, DocHopper does not combine document information with $q$ by concatenating text to the text of $q$, but by combining a compact neural representation of $q$ with a compact neural representation of a hierarchical part of the document, which can potentially be quite large. We experiment with DocHopper on four different QA tasks that require reading long and complex documents to answer multi-hop questions, and show that DocHopper achieves state-of-the-art results on three of the datasets. Additionally, DocHopper is efficient at inference time, being 3--10 times faster than the baselines.
研究动机与目标
- 解决在长篇层次化结构化文档(如研究论文、法律文本或政策文件)上回答复杂多跳问题的挑战。
- 改进现有依赖文本拼接进行查询优化的多跳问答模型,此类方法效率低下且难以捕捉结构关系。
- 通过结合层次注意力与连续向量空间中的迭代查询更新,实现对文档章节的高效且有效的导航。
- 在无需额外预训练的情况下,利用现有的预训练模型(如 ETC)实现长文档问答任务的高性能表现。
提出的方法
- DocHopper 使用基于 ETC 的层次变压器编码器,生成文档在多个层级(段落和更高层级章节)上的紧凑神经表征。
- 在每次迭代中,模型执行层次注意力,关注文档中与当前查询嵌入相关的部分,根据当前查询嵌入选择短片段或更广泛的章节。
- 不将检索到的文本与问题拼接,而是通过将查询向量与所关注文档部分的神经表征相结合,实现其在嵌入空间中的更新。
- 通过使用可学习的注意力权重,对所有步骤中关注的嵌入进行线性组合,模型维护一个累积上下文向量,该权重通过基于查询的注意力机制计算得出。
- 最终预测通过将分类器头应用于聚合的上下文向量生成,整个过程保持端到端可微分。
- 文档表征预先计算,实现快速推理——相比基线模型快 3–10 倍——且无需为每个样本重新处理文档。
实验结果
研究问题
- RQ1与基于文本拼接的方法相比,采用连续查询更新的迭代层次注意力是否能提升在长篇结构化文档上的复杂多跳问答性能?
- RQ2使用层次化文档表征(段落和章节)在捕捉复杂问答任务中的结构上下文方面是否有效?
- RQ3与基于标记拼接的方式相比,在嵌入空间中更新查询是否能带来更好的泛化能力并实现更快的推理速度?
- RQ4基于预训练 ETC 风格编码器构建的模型是否能在无需额外预训练的情况下,在多样化的长文档问答基准上实现最先进性能?
- RQ5与检索-阅读流水线和顺序分块阅读基线相比,该模型在性能和效率方面表现如何?
主要发现
- DocHopper 在所评估的四个数据集中的三个——QASPER、HybridQA 和 ShARC——上达到最先进性能,准确率比基线高出 3–5%。
- 在 HotpotQA 数据集上,DocHopper 取得具有竞争力的结果,展现出在多样化长文档问答任务中的强大泛化能力。
- 由于预计算的文档表征,该模型在推理阶段比基线模型快 3–10 倍,显著降低了计算成本。
- 消融实验确认,层次注意力机制和嵌入空间中的查询更新是性能关键,显著提升了证据检索准确率。
- 该模型在预测中保持高置信度,且未对无关段落产生过拟合,而顺序阅读基线模型常将非相关文本误分类为正例。
- 所有实验均在单张 GPU 上运行,模型在无需额外预训练的情况下实现 SOTA 结果,凸显其高效性与实际可部署性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。