Skip to main content
QUICK REVIEW

[논문 리뷰] Towards a Better Metric for Evaluating Question Generation Systems

Preksha Nema, Mitesh M. Khapra|arXiv (Cornell University)|2018. 08. 30.
Topic Modeling참고 문헌 31인용 수 6
한 줄 요약

이 논문은 n-그램 유사도와 함께 질문의 답변 가능성(Answerability)을 통합함으로써 자동 질문 생성(AQG) 시스템 평가를 향상시키는 수정된 메트릭 Q-BLEU를 제안한다. 답변 가능성은 Wh-어순, 개체명, 관계 등 관련 질문 구성 요소에 중점을 두며, 인간 평가에 기반한 학습 가능한 가중치를 사용한다. 이로 인해 기존 메트릭인 BLEU, METEOR, NIST보다 인간 평가와의 상관관계가 유의미하게 향상된다.

ABSTRACT

There has always been criticism for using $n$-gram based similarity metrics, such as BLEU, NIST, etc, for evaluating the performance of NLG systems. However, these metrics continue to remain popular and are recently being used for evaluating the performance of systems which automatically generate questions from documents, knowledge graphs, images, etc. Given the rising interest in such automatic question generation (AQG) systems, it is important to objectively examine whether these metrics are suitable for this task. In particular, it is important to verify whether such metrics used for evaluating AQG systems focus on answerability of the generated question by preferring questions which contain all relevant information such as question type (Wh-types), entities, relations, etc. In this work, we show that current automatic evaluation metrics based on $n$-gram similarity do not always correlate well with human judgments about answerability of a question. To alleviate this problem and as a first step towards better evaluation metrics for AQG, we introduce a scoring function to capture answerability and show that when this scoring function is integrated with existing metrics, they correlate significantly better with human judgments. The scripts and data developed as a part of this work are made publicly available at https://github.com/PrekshaNema25/Answerability-Metric

연구 동기 및 목표

  • 기존의 n-그램 기반 메트릭(BLEU, METEOR, NIST 등)이 자동 질문 생성(AQG) 시스템 평가에 적합한지 비판적으로 평가하는 것.
  • 현재 메트릭이 생성된 질문의 답변 가능성(즉, 질문이 충분한 정보를 포함해 답변 가능하게 되어 있는지)을 충분히 반영하고 있는지 조사하는 것.
  • 인간 평가와의 일치도를 향상시키기 위해 답변 가능성 요소를 학습 가능한 구성 요소로 통합한 수정된 메트릭을 개발하는 것.
  • 내재적 상관관계 분석과 외재적 평가(하류 QA 모델 성능 측정)를 통해 제안된 메트릭을 검증하는 것.
  • 재현 가능성과 AQG 평가 분야의 향후 연구를 지원하기 위해 인간이 애너테이션한 데이터와 코드를 공개하는 것.

제안 방법

  • SQuAD, WikiMovies, VQA 데이터셋의 기준 질문에 체계적인 노이즈(예: Wh-어순, 정규어, 명시적 개체명 제거)를 도입하여 질문의 답변 가능성에 대한 인간 평가를 수집한다.
  • n-그램 유사도(BLEU 등)와 Wh-어순, 개체명, 관계 등 핵심 질문 구성 요소의 존재를 기반으로 한 학습 가능한 답변 가능성 점수를 조합하는 Q-메트릭을 정의한다.
  • 인간 애너테이션된 답변 가능성 점수를 레이블로 사용하여 질문 구성 요소별 가중치를 학습하는 로지스틱 회귀 모델을 훈련한다.
  • 학습된 답변 가능성 구성 요소를 기존 메트릭에 통합하여, 관련성이 있는 단어의 기여도를 조정하는 Q-BLEU를 구성한다.
  • 노이즈가 가미된 훈련 데이터로 QA 모델을 훈련하고, BLEU 및 Q-BLEU가 평가한 노이즈 질문의 질에 따라 테스트 성능을 측정함으로써 외재적 평가를 수행한다.
  • 세 데이터셋(SQuAD, WikiMovies, VQA) 간 일관성 있는 평가를 확보하기 위해 동일한 노이즈 패턴을 적용한다.

실험 결과

연구 질문

  • RQ1BLEU, METEOR, NIST와 같은 표준 n-그램 기반 메트릭이 자동 질문 생성에서 질문의 답변 가능성에 대한 인간 평가와 잘 상관되는가?
  • RQ2Wh-어순, 명시적 개체명, 관계와 같은 핵심 정보 구성 요소의 존재가 생성된 질문의 답변 가능성에 어느 정도 영향을 미치는가?
  • RQ3답변 가능성의 특성을 효과적으로 포착하는 학습 가능한 구성 요소를 기존 메트릭에 통합할 수 있는가?
  • RQ4수정된 메트릭(Q-BLEU)이 하류 QA 모델 성능 측정 기준으로 훈련 데이터 필터링에 사용되었을 때 AQG 시스템의 선택을 더 잘 이끌어내는가?
  • RQ5정규어 제거와 Wh-어순 제거와 같은 다양한 노이즈 유형이 표준 메트릭과 인간 평가에서 질문의 질에 어떻게 영향을 미치는가?

주요 결과

  • BLEU와 같은 표준 n-그램 메트릭은 SQuAD, WikiMovies, VQA에서 대부분의 경우 인간 평가와의 상관계수가 0.5 이하로 낮게 나타나 답변 가능성 평가에 대해 약한 상관관계를 보인다.
  • 학습 가능한 답변 가능성 가중치를 통합한 제안된 Q-BLEU 메트릭은 기존 메트릭보다 인간 평가와 유의미하게 높은 상관관계를 보이며, 특히 문서 기반 및 시각 기반 QA에서 성능 향상이 두드러진다.
  • 외재적 평가 결과, Q-BLEU로 필터링된 데이터로 훈련된 모델은 BLEU로 필터링된 데이터로 훈련된 모델보다 더 높은 하류 성능을 기록하며, Q-BLEU가 더 유용한 훈련 예제를 효과적으로 식별하고 있음을 시사한다.
  • 정규어는 BLEU 점수에 비례해 과도하게 영향을 미치지만, 답변 가능성이나 하류 QA 성능에는 거의 영향을 주지 않아, 기존 메트릭의 핵심적 결함을 드러낸다.
  • 인간 평가를 기반으로 답변 가능성 예측을 위한 모델은 Wh-어순, 개체명 등 질문 구성 요소 중 답변 가능성에 가장 중요한 요소를 높은 정확도로 식별할 수 있었다.
  • Q-BLEU 메트릭은 테스트 세트에서 모델 성능 예측 능력에서 BLEU4를 능가하며, 높은 Q-BLEU 점수를 기록한 경우 일반화 성능이 항상 뛰어나며, 특히 SQuAD 및 VQA 데이터셋에서 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.