Skip to main content
QUICK REVIEW

[논문 리뷰] Commonsense for Generative Multi-Hop Question Answering Tasks

Lisa Bauer, Yicheng Wang|arXiv (Cornell University)|2018. 09. 17.
Topic Modeling참고 문헌 38인용 수 14
한 줄 요약

이 논문은 ConceptNet에서 가져온 외부 공공지식을 통합하여 개선된 다단계 생성형 질문 응답 모델을 제안한다. 이는 점별 상호정보량과 어휘 빈도를 기반으로 한 새로운 선택 방법과 선택적 게이팅 주의 메커니즘(NOIC)을 사용하여 이러한 지식을 통합한다. 이 방법은 NarrativeQA에서 새로운 최고 성능을 달성하여 Rouge-L을 41.49에서 44.16으로, METEOR를 17.33에서 19.03으로 향상시키며, 인간 평가를 통해 답변 품질 향상도 확인되었다.

ABSTRACT

Reading comprehension QA tasks have seen a recent surge in popularity, yet most works have focused on fact-finding extractive QA. We instead focus on a more challenging multi-hop generative task (NarrativeQA), which requires the model to reason, gather, and synthesize disjoint pieces of information within the context to generate an answer. This type of multi-step reasoning also often requires understanding implicit relations, which humans resolve via external, background commonsense knowledge. We first present a strong generative baseline that uses a multi-attention mechanism to perform multiple hops of reasoning and a pointer-generator decoder to synthesize the answer. This model performs substantially better than previous generative models, and is competitive with current state-of-the-art span prediction models. We next introduce a novel system for selecting grounded multi-hop relational commonsense information from ConceptNet via a pointwise mutual information and term-frequency based scoring function. Finally, we effectively use this extracted commonsense information to fill in gaps of reasoning between context hops, using a selectively-gated attention mechanism. This boosts the model's performance significantly (also verified via human evaluation), establishing a new state-of-the-art for the task. We also show promising initial results of the generalizability of our background knowledge enhancements by demonstrating some improvement on QAngaroo-WikiHop, another multi-hop reasoning dataset.

연구 동기 및 목표

  • 긴 복잡한 서사에서 분산된 증거와 암묵적 추론을 바탕으로 답변을 통합해야 하는 생성형 다단계 질문 응답 과제를 해결하기 위해.
  • 서사 간 추론 격차를 메우기 위해 관련 배경 공공지식을 식별하고 통합하기 위해.
  • ConceptNet에서 근거가 되는 다단계 관계적 공공지식 경로를 선별하여 추론에 유용하고 관련성이 있는 방법을 개발하기 위해.
  • NarrativeQA와 같이 생성형 비추출 기반 QA 벤치마크에서 공공지식 통합의 효과를 평가하고, 다른 데이터셋으로의 일반화 가능성도 평가하기 위해.

제안 방법

  • 종합적인 생성을 위한 다중 양방향 주의 레이어와 포인터-생성기 디코더를 갖춘 다단계 포인터-생성 모델(MHPGM)을 제안한다.
  • 점별 상호정보량(PMI)과 어휘 빈도를 조합한 점수 함수를 도입하여 ConceptNet에서 관련성 있고 근거가 되는 다단계 공공지식 경로를 선택한다.
  • 선택된 공공지식을 추론 중에 동적으로 통합하기 위해 선택적 게이팅 주의 메커니즘을 사용하는 필수 및 선택적 정보 셀(NOIC)을 설계한다.
  • 공공지식 보강 모델을 NarrativeQA에 적용하고 자동 평가 지표 및 인간 평가를 통해 성능을 평가한다.
  • QAngaroo-WikiHop와 같은 추출형 다단계 데이터셋에 적용하여 방법의 일반화 능력을 검증하며, 유망한 성능 향상을 보였다.

실험 결과

연구 질문

  • RQ1추론 격차를 메우기 위해 외부 공공지식을 통합함으로써 생성형 다단계 QA 모델의 성능을 크게 향상시킬 수 있는가?
  • RQ2ConceptNet과 같은 대규모 지식 그래프에서 관련성 있고 근거가 되는 다단계 공공지식 관계를 자동으로 어떻게 선별할 수 있는가?
  • RQ3게이팅 주의 메커니즘을 통해 선택된 공공지식을 통합하면 복잡한 서사에서 답변 생성 품질에 측정 가능한 향상이 이루어지는가?
  • RQ4NarrativeQA를 초월한 다른 다단계 QA 데이터셋으로의 공공지식 선별 및 통합 방법의 일반화 정도는 어느 정도인가?

주요 결과

  • MHPGM 기준 모델은 NarrativeQA 요약 하위 작업에서 Rouge-L 41.49와 METEOR 17.33을 기록하며 이전의 생성형 모델들을 능가한다.
  • PMI와 어휘 빈도를 기반으로 한 공공지식 선별 방법이 성능 향상에 크게 기여하여 Rouge-L은 44.16으로, METEOR는 19.03으로 상승하였다.
  • 인간 평가 결과, 공공지식 보강 모델은 기준 모델 대비 23%의 경우에서 더 나은 답변을 생성하였으며, 41%의 경우는 둘 다 양호한 것으로 평가되어 고품질 생성을 보였다.
  • 이 방법은 일반화 가능성이 있다: 기준 모델에 공공지식을 통합하면 QAngaroo-WikiHop에서 성능 향상이 나타나, 더 넓은 적용 가능성을 시사한다.
  • 단절 분석 결과, 무작위, 단일 단계 또는 근거 없는 공공지식은 성능 향상에 기여하지 않으며, 본 논문에서 제안한 선별 및 통합 방법은 통계적으로 유의미한 성과 향상을 이룬다.
  • 수동 분석 결과, NarrativeQA 질문의 50%가 외부 공공지식이 필요하며, 이 방법은 이러한 경우의 34%에서 관련 지식을 성공적으로 식별하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.