Skip to main content
QUICK REVIEW

[논문 리뷰] CLAM: Selective Clarification for Ambiguous Questions with Generative Language Models

Lorenz Kuhn, Yarin Gal|arXiv (Cornell University)|2022. 12. 15.
Topic Modeling인용 수 7
한 줄 요약

CLAM은 대규모 언어 모델이 모호한 질문을 탐지하고 답변하기 전에 필요한 경우에만 명확화 질문을 생성하도록 하는 few-shot prompting 프레임워크입니다. 이는 모호한 질문에 대한 정확도를 크게 향상시키지만, 모호하지 않은 질문에 대한 성능에는 영향을 주지 않습니다. CLAM은 모호성에 대한 자기 인식을 통해 대규모 언어 모델에 메타인지 능력을 도입하고, 특권 정보를 가진 오라클 언어 모델을 사용해 자동 평가를 가능하게 합니다.

ABSTRACT

Users often ask dialogue systems ambiguous questions that require clarification. We show that current language models rarely ask users to clarify ambiguous questions and instead provide incorrect answers. To address this, we introduce CLAM: a framework for getting language models to selectively ask for clarification about ambiguous user questions. In particular, we show that we can prompt language models to detect whether a given question is ambiguous, generate an appropriate clarifying question to ask the user, and give a final answer after receiving clarification. We also show that we can simulate users by providing language models with privileged information. This lets us automatically evaluate multi-turn clarification dialogues. Finally, CLAM significantly improves language models' accuracy on mixed ambiguous and unambiguous questions relative to SotA.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)이 모호한 질문에 대해 명확화 없이 응답을 생성하는 환각 현상을 해결하기 위해.
  • 질문이 진정으로 모호할 경우에만 명확화 질문을 선택적으로 요청할 수 있는 프레임워크를 개발하기 위해.
  • LLM이 자신의 불확실성에 대해 스스로 생각하는 메타인지 접근 방식을 도입하기 위해.
  • 특권 정보를 가진 오라클 언어 모델을 사용해 다중 전환 대화의 자동 평가를 가능하게 하기 위해.
  • 모호한 질의에 대한 잘못된 응답을 줄임으로써 실세계 적용에서 LLM의 신뢰성과 안전성을 향상시키기 위해.

제안 방법

  • 문맥 내 예시를 기반으로 사용자 질문이 모호한지 여부를 분류하기 위해 few-shot prompting을 사용합니다.
  • 모호한 입력에 맞는 특정한 모호성을 해결하는 명확화 질문을 생성하기 위해 few-shot prompting을 적용합니다.
  • 모호성을 해결하기 위해 특권 정보에 접근할 수 있는 오라클 언어 모델을 사용해 사용자 응답을 시뮬레이션합니다.
  • 시뮬레이션된 사용자로부터 명확화 정보를 수신한 후, 최종 답변을 생성하기 위해 few-shot prompting을 사용합니다.
  • 다중 전환 대화 파이프라인을 설계합니다: 모호성 탐지 → 명확화 질문 생성 → 명확화 후 답변 생성.
  • 인간 사용자를 대체해 명확화 대화를 시뮬레이션하고 모델 성능을 평가하기 위해 오라클 모델을 사용하는 자동 평가 프로토콜을 사용합니다.

실험 결과

연구 질문

  • RQ1few-shot prompting이 LLM이 모호한 질문을 신뢰성 있게 탐지하고 명확화 없이 응답을 회피하는 데에 효과적인가요?
  • RQ2LLM이 미세조정 없이도 효과적인 명확화 질문을 생성할 수 있나요?
  • RQ3선택적 명확화 접근 방식이 모호한 질문에 대한 정답률을 향상시키지만, 모호하지 않은 질문에 대한 성능은 유지합니까?
  • RQ4오라클 언어 모델이 다중 전환 대화의 자동 평가를 위해 인간과 유사한 명확화 응답을 신뢰성 있게 시뮬레이션할 수 있나요?
  • RQ5자신의 불확실성에 대해 생각하는 메타인지 — 즉, 자기 인식 — 능력이 LLM 기반 질의 응답의 신뢰성에 얼마나 기여합니까?

주요 결과

  • CLAM은 최신 기술 대비 모호한 질문에 대한 LLM의 정확도를 크게 향상시켰지만, 모호하지 않은 질문에 대한 성능에는 영향을 주지 않았습니다.
  • 모호성 탐지에 대한 few-shot prompting 접근 방식은 매우 신뢰할 수 있으며, 불필요한 명확화(거짓 양성)와 모호성 누락(거짓 음성)을 최소화합니다.
  • 오라클 모델은 TriviaQA와 CLAQUA II의 95%의 경우에서 정확한 명확화 정보를 제공했고, CLAQUA I의 대부분의 경우에서도 신뢰할 수 있는 결과를 보였습니다.
  • 모호한 질문을 포함한 데이터셋에서 프레임워크가 큰 성능 향상을 달성하여 선택적 명확화의 효과를 입증했습니다.
  • 언어 모델의 미세조정이 전혀 필요 없어, 시장에 유통되는 LLM을 그대로 활용해 구현이 가능합니다.
  • 특권 정보를 가진 오라클 모델을 사용한 자동 평가 프로토콜은 다중 전환 명확화 대화의 스케일러블하고 재현 가능하며 윤리적으로 준수 가능한 평가를 가능하게 합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.