Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding and Improving Zero-shot Multi-hop Reasoning in Generative Question Answering

Zhengbao Jiang, Jun Araki|arXiv (Cornell University)|2022. 10. 09.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 생성형 질문-답변(QA) 모델에서 단일 허프 질문에만 훈련된 경우의 제로샷 다중 허프 추론을 조사하며, 모델이 단일 허프에서 다중 허프 질문으로 일반화하지 못함을 드러낸다. 이를 개선하기 위해 두 가지 방법—단일 허프 질문을 연결하는 것과 SPARQL 논리 형식으로의 피니테이닝—을 제안하며, 특히 이 두 방법을 결합했을 때 상당한 성능 향상을 이룬다.

ABSTRACT

Generative question answering (QA) models generate answers to questions either solely based on the parameters of the model (the closed-book setting) or additionally retrieving relevant evidence (the open-book setting). Generative QA models can answer some relatively complex questions, but the mechanism through which they do so is still poorly understood. We perform several studies aimed at better understanding the multi-hop reasoning capabilities of generative QA models. First, we decompose multi-hop questions into multiple corresponding single-hop questions, and find marked inconsistency in QA models' answers on these pairs of ostensibly identical question chains. Second, we find that models lack zero-shot multi-hop reasoning ability: when trained only on single-hop questions, models generalize poorly to multi-hop questions. Finally, we demonstrate that it is possible to improve models' zero-shot multi-hop reasoning capacity through two methods that approximate real multi-hop natural language (NL) questions by training on either concatenation of single-hop questions or logical forms (SPARQL). In sum, these results demonstrate that multi-hop reasoning does not emerge naturally in generative QA models, but can be encouraged by advances in training or modeling techniques.

연구 동기 및 목표

  • 생성형 QA 모델이 단일 허프 질문에만 훈련된 경우에도 강건한 제로샷 다중 허프 추론을 수행할 수 있는지 조사하기 위해.
  • 다중 허프 질문을 단일 허프 구성요소로 분해했을 때 모델 응답의 일관성과 정확성을 분석하기 위해.
  • 다중 허프 질문의 근사치—연결된 단일 허프 질문이나 SPARQL 쿼리—를 통해 제로샷 다중 허프 추론 능력이 향상되는지 평가하기 위해.
  • 다중 허프 질문에 대해 구조화된 논리 형식(SPARQL)으로 훈련하는 것이 자연어 다중 허프 질문으로의 일반화를 가능하게 하는지 탐색하기 위해.
  • 현재 생성형 QA 모델의 조합적 추론에서 나타나는 한계를 규명하고, 제로샷 다중 허프 성능을 향상시키기 위한 확장 가능한 훈련 기법을 제안하기 위해.

제안 방법

  • 모델의 일관성을 점검하기 위해 히우리스틱 방법을 사용해 다중 허프 QA 질문을 단일 허프 질문의 체인으로 분해한다.
  • 다중 허프 추론 패턴을 근사하기 위해 연결된 단일 허프 질문으로 생성형 QA 모델(UnifiedQA 및 RAG)을 훈련시킨다.
  • 다중 허프 질문에서 유도된 SPARQL 쿼리로 모델을 피니테이닝하여 명시적인 조합적 추론 구조를 가르친다.
  • 연결된 자연어 질문과 SPARQL를 함께 사용해 제로샷 다중 허프 추론 능력을 공동으로 향상시킨다.
  • 질문 임bedding과 컨텍스트(오픈북 설정)를 기반으로 시퀀스-투-시퀀스 생성을 사용한 사전 훈련된 언어 모델을 사용해 답변을 생성한다.
  • 피니테이닝 후 단일 허프 및 다중 허프 질문으로 테스트하여 제로샷 베이스라인과 성능을 비교함으로써 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1분해된 단일 허프 질문의 정확성이 다중 허프 질문의 정확성에 필수적이고 충분한 조건인가?
  • RQ2다중 허프 질문과 그 구성 요소인 단일 허프 질문에 대한 답변이 생성형 QA 모델 간에 일관성 있는가?
  • RQ3단일 허프 질문에만 훈련된 모델이 다중 허프 질문으로의 제로샷 일반화를 보이는가?
  • RQ4다중 허프 질문의 근사치—예를 들어 연결된 단일 허프 질문이나 SPARQL 논리 형식—으로 훈련하면 제로샷 다중 허프 추론 능력이 향상되는가?
  • RQ5SPARQL 쿼리를 실행하는 법을 배우는 것이 자연어 다중 허프 질문에서의 성능 향상으로 이어지는가?

주요 결과

  • 생성형 QA 모델는 분해된 단일 허프 질문과 그에 해당하는 다중 허프 질문에 대해 뚜렷한 일관성이 없으며, 이는 신뢰할 수 있는 다중 허프 추론이 아니라 잘못된 추론을 의미한다.
  • 단일 허프 질문에만 훈련된 모델은 다중 허프 질문으로의 제로샷 일반화 능력이 떨어지며, 닫힌 책(UnityQA) 및 열린 책(RAG) 설정 모두에서 성능이 크게 떨어진다.
  • 연결된 단일 허프 질문으로 훈련하면 제로샷 다중 허프 성능이 향상되며, UnifiedQA의 ComplexWebQuestions에서 F1 점수가 25.69로 상승하고 RAG는 53.93로 상승하여 이 방법이 다중 허프 추론의 효과적인 근사치임을 보여준다.
  • SPARQL 쿼리로 피니테이닝하면 모델이 자연어 다중 허프 질문으로 일반화할 수 있으며, 자연어 다중 허프 질문으로 훈련한 것과 비교해 F1 점수 하락 폭이 7~15 포인트에 그쳐 강력한 전이 능력을 보인다.
  • 연결된 자연어 질문과 SPARQL를 모두 사용한 감독 신호를 결합하면 추가적인 성능 향상이 이루어지며, UnifiedQA의 F1 점수가 다중 허프 질문에서 27.14로 상승하여 상호보완적 성과를 보여준다.
  • 성능 향상에도 불구하고 제로샷 방법과 실제 다중 허프 자연어 질문으로 훈련된 모델 간에 여전히 큰 성능 격차가 존재하여, 더 나은 근사치 또는 모델링 기법이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.