[论文解读] Tree of Clarifications: Answering Ambiguous Questions with Retrieval-Augmented Large Language Models
本文提出 Tree of Clarifications (ToC),一种检索增强型框架,通过少样本提示(few-shot prompting)和外部知识,递归生成用于开放域问答中模糊查询的消歧问题(DQs)树。通过利用检索到的文本片段引导多样化的消歧路径并剪枝无用分支,ToC 生成全面的长篇答案,在 ASQA 基准测试中达到最先进性能——仅使用 5-shot 提示,其在 Disambig-F1 和 Disambig-ROUGE 指标上超越了完全监督模型。
Questions in open-domain question answering are often ambiguous, allowing multiple interpretations. One approach to handling them is to identify all possible interpretations of the ambiguous question (AQ) and to generate a long-form answer addressing them all, as suggested by Stelmakh et al., (2022). While it provides a comprehensive response without bothering the user for clarification, considering multiple dimensions of ambiguity and gathering corresponding knowledge remains a challenge. To cope with the challenge, we propose a novel framework, Tree of Clarifications (ToC): It recursively constructs a tree of disambiguations for the AQ -- via few-shot prompting leveraging external knowledge -- and uses it to generate a long-form answer. ToC outperforms existing baselines on ASQA in a few-shot setup across the metrics, while surpassing fully-supervised baselines trained on the whole training set in terms of Disambig-F1 and Disambig-ROUGE. Code is available at https://github.com/gankim/tree-of-clarifications.
研究动机与目标
- 为解决开放域问答(ODQA)中无需用户澄清即可回答模糊问题(AQs)的挑战。
- 通过检索外部知识克服大语言模型在处理多维模糊性与事实幻觉方面的局限。
- 开发一种结构化、递归的方法,以探索模糊问题的多样化解释,同时确保事实一致性与完整性。
- 生成全面涵盖原始模糊问题所有合理消歧解释的长篇答案。
提出的方法
- 使用稠密检索模型为模糊问题(AQ)检索相关维基百科文本片段。
- 应用少样本提示从检索到的文本片段生成消歧问题(DQs),探索模糊性的多个维度。
- 构建树状结构(ToC),其中每个节点代表一个 DQ,支持对消歧路径的递归探索。
- 通过大语言模型实现自验证机制,评估 DQ 与检索上下文之间的事实一致性,剔除不一致或无用的分支。
- 将检索到的上下文与经验证的 DQ 作为输入,生成整合所有有效解释的长篇答案。
- 采用两阶段流程:第一阶段为检索增强型消歧(RAC),用于生成并剪枝 DQ;第二阶段使用消歧后的 DQ 与上下文生成答案。

实验结果
研究问题
- RQ1检索增强型大语言模型框架能否在无用户交互的情况下,有效探索开放域问题中的多维模糊性?
- RQ2如何利用检索到的文本片段中的外部知识,引导大语言模型生成多样化且事实一致的消歧问题?
- RQ3与完全监督基线相比,检索增强型少样本提示在多大程度上能提升模糊问题长篇答案的质量?
- RQ4与平面或顺序方法相比,基于树状结构的消歧方法在提升答案全面性与事实一致性方面表现如何?
主要发现
- ToC 在 5-shot 设置下于 ASQA 基准测试中达到最先进性能,全面超越现有少样本基线模型。
- ToC 的 5-shot 表现优于在完整训练集上微调的完全监督基线模型,在 Disambig-F1 上高出 7.3 分,在 Disambig-ROUGE 上高出 2.9 分。
- 与标准大语言模型提示相比,检索增强型少样本提示显著提升了事实一致性与消歧解释的覆盖范围。
- 自验证机制能有效过滤幻觉或不连贯的消歧问题,提升答案可靠性。
- 树状结构方法可系统性探索多维模糊性,例如在复杂模糊问题中区分奖牌类型或奥运赛事。
- ToC 表明,检索增强型大语言模型无需微调即可生成高质量长篇答案,甚至在关键指标上超越完全监督模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。