[논문 리뷰] Tree of Clarifications: Answering Ambiguous Questions with Retrieval-Augmented Large Language Models
이 논문은 개방형 질의응답(ODQA)에서 모호한 질의에 대해 사용자 상호작용 없이도 다수의 해석 경로를 탐색할 수 있도록 설계된 검색 증강형 프레임워크인 '의문의 나무(ToC)'를 제안한다. ToC는 소수의 예시를 활용한 프롬프팅과 외부 지식을 통합하여, 모호한 질의에 대해 다수의 해석된 질문(DQs)을 순환적으로 생성하는 트리 구조를 형성한다. 검색된 문단을 바탕으로 다양한 해석 경로를 안내하고 불필요한 분지들을 잘라내어 종합적인 장문의 답변을 생성하며, 5-shot 프롬프팅만으로도 ASQA 벤치마크에서 최신 기준 성능을 달성한다. 이는 완전히 지도 학습된 모델보다도 Disambig-F1과 Disambig-ROUGE 지표에서 뛰어난 성능을 보였다.
Questions in open-domain question answering are often ambiguous, allowing multiple interpretations. One approach to handling them is to identify all possible interpretations of the ambiguous question (AQ) and to generate a long-form answer addressing them all, as suggested by Stelmakh et al., (2022). While it provides a comprehensive response without bothering the user for clarification, considering multiple dimensions of ambiguity and gathering corresponding knowledge remains a challenge. To cope with the challenge, we propose a novel framework, Tree of Clarifications (ToC): It recursively constructs a tree of disambiguations for the AQ -- via few-shot prompting leveraging external knowledge -- and uses it to generate a long-form answer. ToC outperforms existing baselines on ASQA in a few-shot setup across the metrics, while surpassing fully-supervised baselines trained on the whole training set in terms of Disambig-F1 and Disambig-ROUGE. Code is available at https://github.com/gankim/tree-of-clarifications.
연구 동기 및 목표
- 사용자 상호작용 없이 개방형 질의응답(ODQA) 환경에서 모호한 질문(AQs)을 해결하는 데 도전하는 것.
- 검색을 통한 외부 지식 통합을 통해 LLM의 다차원적 모호성 처리 능력과 사실 왜곡 문제를 극복하는 것.
- 모호한 질문의 다양한 해석을 체계적이고 재귀적으로 탐색하면서도 사실적 일관성과 완전성을 유지하는 구조적 방법을 개발하는 것.
- 원래의 모호한 질문의 모든 가능한 해석된 해석을 종합적으로 다루는 장문의 답변을 생성하는 것.
제안 방법
- 모호한 질문(AQ)에 대해 밀도 기반 검색 모델을 사용해 관련된 위키백과 문단을 검색한다.
- 검색된 문단을 바탕으로 소수의 예시를 활용한 프롬프팅을 적용하여, 다양한 모호성 차원을 고려한 해석된 질문(DQs)을 생성한다.
- 각 노드가 DQ를 나타내는 트리 구조(ToC)를 구성하여, 해석 경로를 순환적으로 탐색할 수 있도록 한다.
- LLM를 활용한 자체 검증 메커니즘을 구현하여, DQ와 검색된 맥락 간의 사실적 일관성을 평가하고, 일관성이 없는 또는 도움이 되지 않는 분지를 제거한다.
- 검색된 맥락과 검증된 DQs를 입력으로 사용하여 모든 유효한 해석을 통합한 장문의 답변을 생성한다.
- 두 단계 과정을 활용한다: 첫 번째로, 검색 증강형 해석(RAC)을 통해 DQs를 생성하고 분기를 잘라낸다; 두 번째로, 해석된 질문과 맥락을 기반으로 답변을 생성한다.

실험 결과
연구 질문
- RQ1사용자 상호작용 없이도 검색 증강형 LLM 프레임워크가 개방형 질문의 다수의 모호성 차원을 효과적으로 탐색할 수 있는가?
- RQ2검색된 문단에서 유래한 외부 지식은 LLM이 다양한 사실적으로 일관된 해석된 질문을 생성하는 데 어떻게 기여하는가?
- RQ3검색을 통한 소수의 예시 프롬프팅은 완전히 지도 학습된 기준 모델 대비 장문의 답변 품질을 얼마나 향상시킬 수 있는가?
- RQ4트리 구조적 접근 방식은 평면적 또는 순차적 방법에 비해 답변의 종합성과 사실적 일관성 측면에서 향상되는가?
주요 결과
- ToC는 5-shot 설정에서 ASQA 벤치마크에서 최신 기준 성능을 달성하였으며, 모든 지표에서 기존의 소수의 예시 기반 베이스라인을 뛰어넘었다.
- ToC의 5-shot 성능은 전체 학습 세트로 훈련된 완전히 지도 학습된 모델보다 Disambig-F1에서 7.3점, Disambig-ROUGE에서 2.9점 높은 성능을 보였다.
- 검색 증강형 소수의 예시 프롬프팅은 표준 LLM 프롬프팅 대비 사실적 일관성과 해석된 해석의 커버리지 측면에서 뚜렷한 향상을 보였다.
- 자체 검증 메커니즘이 사실 왜곡되거나 일관성이 없는 해석된 질문을 효과적으로 걸러내어 답변의 신뢰도를 향상시켰다.
- 트리 구조적 접근은 복잡한 AQs에서 메달 종류나 올림픽 경기 종목 등 다양한 모호성 요소를 체계적으로 탐색할 수 있도록 했다.
- ToC는 미세조정 없이도 검색 증강형 LLM이 고품질의 장문의 답변을 생성할 수 있음을 입증하였으며, 핵심 지표에서 완전히 지도 학습된 모델을 초월하는 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.