Skip to main content
QUICK REVIEW

[논문 리뷰] Clarify When Necessary: Resolving Ambiguity Through Interaction with LMs

Michael J. Q. Zhang, Eunsol Choi|arXiv (Cornell University)|2023. 11. 16.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 대화식 명확화를 통해 LLM의 모호함을 해결하기 위한 작업에 종속되지 않는 프레임워크를 제안한다. 이 과정은 세 단계로 분해된다: 명확화가 필요한지 감지하는 것, 효과적인 명확화 질문을 생성하는 것, 사용자 답변에 정확하게 대응하는 것. 주요 기여는 의도 엔트로피를 사용하여 언제 명확화가 성능 향상에 기여하는지 식별하는 새로운 불확실성 추정 방법인 Intent-Sim이며, 입력의 10%만 명확화해도 기존 베이스라인 대비 성능 향상이 두 배로 향상된다.

ABSTRACT

Resolving ambiguities through interaction is a hallmark of natural language, and modeling this behavior is a core challenge in crafting AI assistants. In this work, we study such behavior in LMs by proposing a task-agnostic framework for resolving ambiguity by asking users clarifying questions. Our framework breaks down this objective into three subtasks: (1) determining when clarification is needed, (2) determining what clarifying question to ask, and (3) responding accurately with the new information gathered through clarification. We evaluate systems across three NLP applications: question answering, machine translation and natural language inference. For the first subtask, we present a novel uncertainty estimation approach, intent-sim, that determines the utility of querying for clarification by estimating the entropy over user intents. Our method consistently outperforms existing uncertainty estimation approaches at identifying predictions that will benefit from clarification. When only allowed to ask for clarification on 10% of examples, our system is able to double the performance gains over randomly selecting examples to clarify. Furthermore, we find that intent-sim is robust, demonstrating improvements across a wide range of NLP tasks and LMs. Together, our work lays foundation for studying clarifying interactions with LMs.

연구 동기 및 목표

  • 시스템이 언제 명확화가 필요한지 감지할 수 있도록 상호작용적 모호함 해소를 모델링하기 위해.
  • 사용자 의도의 모호함을 드러내는 효과적인 명확화 질문을 생성하기 위한 프레임워크를 개발하기 위해.
  • 사용자가 제공한 명확화에 정확하게 대응하여 최종 작업 성능을 향상시키기 위해.
  • 질의응답, 기계 번역, 자연어 추론 등 다양한 NLP 작업에서 프레임워크의 성능을 평가하기 위해.
  • 의도 기반의 새로운 불확실성 추정 방법인 Intent-Sim를 도입하고 검증하기 위해

제안 방법

  • 프레임워크는 세 단계의 순차적 하위 작업으로 구성된다: (1) 명확화를 요청할 시점을 결정하는 것, (2) 명확화 질문을 생성하는 것, (3) 사용자의 응답을 바탕으로 정확한 출력을 생성하는 것.
  • Intent-Sim는 다수의 사용자-보조원 상호작용을 시뮬레이션하여 예측된 사용자 의도의 엔트로피를 계산함으로써 불확실성을 추정한다.
  • 이 방법은 모호한 입력에서의 다수의 애너테이션을 사용하여 사용자 의도의 자연스러운 분포를 모델링하고 의도 엔트로피를 계산한다.
  • 평가를 위해 저자들은 명확화 생성 및 응답 모듈의 성능를 격리하고 평가하기 위해 오라클 기반의 명확화 QA 쌍을 사용한다.
  • 기존의 모호한 데이터셋을 사용하여 질의응답, 기계 번역, 자연어 추론 세 가지 NLP 작업에서 시스템을 평가한다. 각 데이터셋은 다수의 애너테이션을 포함한다.
  • 성능는 최종 작업 정확도와 AUROC로 측정되며, 상호작용 비용을 최소화하면서 성능 향상을 극대화하는 데 중점을 둔다.
Figure 1: Our three-stage framework for resolving ambiguity with clarification questions. In the first step, systems must identify which inputs will benefit from clarification. In the second step, after deciding to clarify, we provide systems with a clarifying QA pair corresponding to the gold inter
Figure 1: Our three-stage framework for resolving ambiguity with clarification questions. In the first step, systems must identify which inputs will benefit from clarification. In the second step, after deciding to clarify, we provide systems with a clarifying QA pair corresponding to the gold inter

실험 결과

연구 질문

  • RQ1의도 엔트로피 기반의 불확실성 추정이 명확화로 성능 향상이 기대되는 모호한 입력을 효과적으로 식별할 수 있는가?
  • RQ2입력의 소수만 명확화하는 경우, 제안된 프레임워크가 최종 작업 성능을 얼마나 향상시키는가?
  • RQ3Intent-Sim 방법이 다양한 NLP 작업과 LLM 아키텍처 전반에서 얼마나 강건한가?
  • RQ4사용자 피드백 이후 최종 출력 정확도에 영향을 주는 명확화 질문의 품질은 어떤가?
  • RQ5모호함 해소를 위한 작업에 종속되지 않는 프레임워크가 QA, MT, NLI와 같은 다양한 NLP 응용 분야에 효과적으로 적용될 수 있는가?

주요 결과

  • Intent-Sim는 기존의 불확실성 추정 방법보다 명확화로 이점이 기대되는 모호한 입력을 더 효과적으로 식별한다.
  • 입력의 10%만 명확화하는 제약 조건 하에서도, 무작위 선택 대비 성능 향상이 두 배로 향상된다.
  • Intent-Sim는 평가된 모든 작업과 LLM에서 일관된 향상을 보이며, 여섯 개의 LLM-작업 설정 중 네 곳에서 가장 뛰어난 성능을 기록한다.
  • 낮은 상호작용 예산 조건에서도 강건성을 유지하며, 제한된 샘플에서의 엔트로피 추정이 뜨거운 수준이더라도 높은 유용성을 유지한다.
  • LLM이 모호함을 감지하고 사용자 피드백을 통해 상호작용적으로 해결함으로써 최종 작업 정확도를 향상시키는 데 성공한 프레임워크이다.
  • 결과적으로 의도 엔트로피 기반의 불확실성 추정은 가능성 기반 또는 히وري스틱 접근보다 명확화에 더 효과적인 신호임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.