[论文解读] CLAM: Selective Clarification for Ambiguous Questions with Generative Language Models
CLAM 是一种 few-shot prompting 框架,可使大型语言模型检测出含糊问题,并在回答前选择性地生成澄清问题,从而在不损害无歧义问题性能的前提下,显著提高含糊问题的准确率。它通过模型对歧义的自我意识引入了大模型的元认知能力,并利用具有特权信息的 oracle 语言模型实现自动评估。
Users often ask dialogue systems ambiguous questions that require clarification. We show that current language models rarely ask users to clarify ambiguous questions and instead provide incorrect answers. To address this, we introduce CLAM: a framework for getting language models to selectively ask for clarification about ambiguous user questions. In particular, we show that we can prompt language models to detect whether a given question is ambiguous, generate an appropriate clarifying question to ask the user, and give a final answer after receiving clarification. We also show that we can simulate users by providing language models with privileged information. This lets us automatically evaluate multi-turn clarification dialogues. Finally, CLAM significantly improves language models' accuracy on mixed ambiguous and unambiguous questions relative to SotA.
研究动机与目标
- 解决大型语言模型(LLMs)在面对含糊问题时幻觉式地直接回答而非寻求澄清的问题。
- 开发一种框架,使 LLM 能够仅在问题真正含糊时才选择性地提出澄清问题。
- 引入一种元认知方法,使 LLM 在回答前能够推理自身的不确定性。
- 利用具有特权信息的 oracle 语言模型,实现对多轮澄清对话的可扩展、自动评估。
- 通过减少对含糊查询的错误回答,提升 LLM 在真实场景部署中的可靠性与安全性。
提出的方法
- 使用 few-shot prompting,基于上下文中的示例,判断用户问题是否含糊。
- 应用 few-shot prompting,为含糊输入生成针对具体歧义的定制化澄清问题。
- 使用具有特权事实信息的 oracle 语言模型,模拟用户响应以解决歧义。
- 在接收到模拟用户提供的澄清信息后,使用 few-shot prompting 生成最终答案。
- 设计多轮对话流程:歧义检测 → 澄清问题生成 → 收到澄清后生成答案。
- 采用自动评估协议,由 oracle 模型替代人类用户,模拟澄清对话并评估模型性能。
实验结果
研究问题
- RQ1few-shot prompting 是否能使 LLM 可靠地检测含糊问题,避免在无澄清时直接回答?
- RQ2LLM 是否能生成有效的澄清问题,在无需微调的情况下解决歧义?
- RQ3选择性澄清方法是否能在提升含糊问题回答准确率的同时,保持对无歧义问题的性能?
- RQ4oracle 语言模型是否能可靠地模拟类人般的澄清响应,以实现对多轮对话的自动评估?
- RQ5元认知——即对自身不确定性的思考——在多大程度上能提升基于 LLM 的问答可靠性?
主要发现
- 与最先进方法相比,CLAM 显著提升了 LLM 在含糊问题上的准确率,且未降低无歧义问题的性能。
- 用于歧义检测的 few-shot prompting 方法极为可靠,显著减少了误报(不必要的澄清)和漏报(未识别的歧义)。
- 在 TriviaQA 和 CLAQUA II 上,oracle 模型在 95% 的情况下能可靠地提供正确澄清信息;在 CLAQUA I 上也大多提供正确信息。
- 该框架在包含含糊问题的数据集上实现了显著的性能提升,证明了选择性澄清的有效性。
- 该方法无需对语言模型进行任何微调,因此可直接使用现成的 LLM 进行部署。
- 所提出的基于 oracle 模型的自动评估协议,实现了多轮澄清对话的可扩展、可复现且符合伦理的评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。