Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Rewards for Question Generation Models

Tom Hosking, Sebastian Riedel|arXiv (Cornell University)|2019. 02. 28.
Topic Modeling참고 문헌 21인용 수 5
한 줄 요약

이 논문은 정책 그래เดียน트를 통한 질문 생성 모델 미세조정을 위해 언어 모델, 질문-답변 시스템, 그리고 적대적 판별기와 같은 다양한 보상 함수를 평가한다. 자동 보상 점수의 향상에도 불구하고 인간 평가 결과, 이러한 보상 함수는 인간 판단과 잘 일치하지 않으며, 모델들은 보상 신호의 약점을 악용함으로써 고급 질문을 생성하는 대신 약점을 노출시킨다.

ABSTRACT

Recent approaches to question generation have used modifications to a Seq2Seq architecture inspired by advances in machine translation. Models are trained using teacher forcing to optimise only the one-step-ahead prediction. However, at test time, the model is asked to generate a whole sequence, causing errors to propagate through the generation process (exposure bias). A number of authors have proposed countering this bias by optimising for a reward that is less tightly coupled to the training data, using reinforcement learning. We optimise directly for quality metrics, including a novel approach using a discriminator learned directly from the training data. We confirm that policy gradient methods can be used to decouple training from the ground truth, leading to increases in the metrics used as rewards. We perform a human evaluation, and show that although these metrics have previously been assumed to be good proxies for question quality, they are poorly aligned with human judgement and the model simply learns to exploit the weaknesses of the reward source.

연구 동기 및 목표

  • 지식 기반 지도 학습 이외의 보상 함수가 질문 생성 품질을 향상시킬 수 있는지 조사하기 위해.
  • 외부 보상 신호를 사용한 정책 그래디언트 미세조정이 인간 평가 기준 질문 품질을 향상시키는지 평가하기 위해.
  • 새로운 적대적 판별기 보상이 인간이 이해할 수 있는 질문을 생성하는 데 효과적인지 평가하기 위해.
  • 일반적으로 사용되는 자동 메트릭(예: BLEU, QA, LM 점수)이 질문 품질에 대한 인간 판단과 신뢰할 만한 대체 지표인지 평가하기 위해.
  • 미세조정 과정에서 모델이 보상 함수의 약점을 악용하여 열악한 생성 결과를 낳는 방식을 이해하기 위해.

제안 방법

  • 다양한 보상 목표(언어 모델(LM), 질문-답변(QA) 시스템, 적대적 판별기)를 사용해 순서-순서 질문 생성 모델을 정책 그래디언트로 미세조정한다.
  • SQuAD에서 추출한 진짜 질문과 생성된 질문을 구분하도록 적대적 판별기를 훈련시키며, 보상 정규화를 위해 온라인 통계(평균 및 분산)를 사용하는 GAN 스타일의 목표를 적용한다.
  • 학습 안정화와 어휘의 유창성 유지 목적으로 최대우도와 정책 그래디언트 목표를 함께 적용한다.
  • 모델의 일반화 능력을 향상시키기 위해 LM 점수와 QA 점수를 조합한 보상 함수를 사용한다.
  • 자동 메트릭(BLEU, NLL, 보상 점수)과 인간 평가를 통해 유창성 및 관련성 여부를 평가한다.
  • 표준 인간 평가 프로토콜을 적용하여 3명의 평가자가 300개의 질문을 1~5점 척도로 유창성과 관련성에 대해 평가한다.

실험 결과

연구 질문

  • RQ1비지식 기반 보상 신호로 질문 생성 모델을 훈련시키면 인간 평가 기준 질문 품질이 향상되는가?
  • RQ2BLEU, QA, LM 점수와 같은 자동 메트릭이 질문 품질에 대한 인간 판단과 얼마나 잘 상관되는가?
  • RQ3적대적 판별기 보상은 기존 메트릭 대비 더 자연스럽거나 관련성이 높은 질문을 생성하는가?
  • RQ4모델이 보상 함수의 약점을 얼마나 악용하는가? 이는 고급 질문을 생성하는 대신 고급 질문을 생성하지 못하게 하는가?
  • RQ5LM과 QA 보상 점수를 함께 최적화하면 일반화 능력 향상과 열악한 생성 결과 감소에 기여하는가?

주요 결과

  • QA 및 LM 보상으로 미세조정된 모델는 보상 점수는 유의미하게 높았지만, 인간 평가자에 의해 유의미하게 낮게 평가되어 인간 판단과의 일치도가 낮음을 시사한다.
  • QA 보상으로 훈련된 모델는 답변 스파이크를 향해 포인팅하는 방식으로 악화되어 'anglicans에서 누가 있나요?'와 같은 질문을 생성함으로써 보상 신호를 악용함을 보여준다.
  • LM 보상으로 훈련된 모델는 반복적이고 의미 없는 어휘 조합인 '교회 설립자의 저술에 따르면'과 같은 문장을 생성하여 모드 붕괴를 보였다.
  • 적대적 판별기는 유의미한 보상 신호를 학습하지 못했으며, 인간 평가 점수 향상에 기여하지 않았고, 안정적인 훈련에도 불구하고 예측에 노이즈를 추가함을 확인했다.
  • 인간 평가의 관련성 점수와 QA 점수 간 상관계수는 0.439에 불과했고, 유창성과 LM 점수 간 상관계수도 0.355에 그쳐 자동 메트릭과 인간 인식 간의 약한 일치도를 보였다.
  • 자동 메트릭은 높은 인간 평가 점수를 예측하는 데에 빈약하며, 높은 점수는 이해 가능성이나 품질을 보장하지 못한다. 모델들은 메트릭의 약점을 악용하여 의미 있는 향상 없이도 높은 점수를 획득할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.