Skip to main content
QUICK REVIEW

[论文解读] A Study of BERT for Non-Factoid Question-Answering under Passage Length Constraints

Yosi Mass, Haggai Roitman|arXiv (Cornell University)|Aug 19, 2019
Topic Modeling参考文献 10被引用 14
一句话总结

本文研究了在段落长度限制下,使用 BERT 微调进行非事实型问答的性能,比较了逐点式与成对式学习排序方法。研究发现,使用 256 个标记的序列时 BERT 表现最佳,而通过注意力机制进行段落分割可实现对更长段落的处理,仅造成适度的准确率损失。

ABSTRACT

We study the use of BERT for non-factoid question-answering, focusing on the passage re-ranking task under varying passage lengths. To this end, we explore the fine-tuning of BERT in different learning-to-rank setups, comprising both point-wise and pair-wise methods, resulting in substantial improvements over the state-of-the-art. We then analyze the effectiveness of BERT for different passage lengths and suggest how to cope with large passages.

研究动机与目标

  • 评估 BERT 在严格输入长度限制下,用于非事实型问答段落重排序的有效性。
  • 比较使用 BERT 进行段落重排序时,逐点式与成对式学习排序策略的性能。
  • 分析段落长度对 BERT 表示质量的影响,并确定最优序列长度。
  • 开发并评估通过分段与表示聚合处理超过 BERT 512 个标记限制的段落的方法。
  • 为在长度受限输入环境下实际部署 BERT 于真实世界问答系统提供实用指导。

提出的方法

  • 使用预训练的基础模型,基于查询-段落对,采用交叉熵损失进行逐点排序微调(BERT[PW]),以及采用三元组损失进行成对排序微调(BERTlets)。
  • 使用 BERT 的 [CLS] 标记表示作为最终句子对嵌入向量用于评分。
  • 探索将段落分割为 128 个标记的块,通过多头注意力机制将块级表示聚合为段落级表示。
  • 评估了其他聚合方法,包括最大池化,其结果与基于注意力的融合方法相似。
  • 使用 Adam 优化器,初始初始学习率为 2e-5,在 Tesla K40m GPU 上训练三轮。
  • 使用标准信息检索指标(P@1、MAP 和 MRR)在三个基准数据集(nfL6、WebAP 和 WikiPassageQA)上评估性能。

实验结果

研究问题

  • RQ1在输入长度限制下,BERT 在非事实型段落重排序中的表现如何?
  • RQ2BERT 在段落重排序中的最优序列长度(SeqLen)是多少?其表现如何随段落长度变化?
  • RQ3将段落分割为较小块并结合基于注意力的聚合,能否有效处理超过 BERT 512 个标记限制的段落?
  • RQ4在使用 BERT 微调进行段落重排序时,逐点式与成对式学习排序策略的性能表现如何比较?
  • RQ5通过分段处理长段落与保持重排序准确率之间的权衡是什么?

主要发现

  • 在所有数据集中,使用 256 个标记序列的 BERT 表现最佳,在 nfL6 数据集上的 P@1 指标上,相比 BM25 和先前的深度学习基线模型,性能最高提升达 120%。
  • 在较短(64、128)和较长(384)序列长度下性能下降,尤其在平均段落长度较长的 WikiPassageQA 上表现更明显。
  • 将段落分割为两个或三个 128 个标记的块,并结合基于注意力的聚合,可实现对超过 512 个标记段落的处理,尽管相比完整长度处理,性能有适度下降。
  • 在 WikiPassageQA 上,BERTlets 成对方法优于 BERT[PW](MAP=0.74 vs. 0.71);而在 WebAP 上,BERT[PW] 略胜 BERTlets(P@1=0.55 vs. 0.53)。
  • 对块表示进行最大池化可获得与基于注意力的聚合相似的结果,表明简单池化是融合方法的可行替代方案。
  • 本研究证实,逐点式与成对式微调策略性能相当,其中 BERTlets 在某些设置下表现略优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。