Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond User Self-Reported Likert Scale Ratings: A Comparison Model for Automatic Dialog Evaluation

Weixin Liang, James Zou|arXiv (Cornell University)|2020. 05. 21.
Topic Modeling참고 문헌 60인용 수 7
한 줄 요약

이 논문은 CMADE를 제안하며, 이는 잡음이 많은 자가 보고한 리커트 척도 평가를 신뢰할 수 있는 비교 기반 판단으로 변환함으로써 자동 대화 평가를 향상시키는 세 단계의 노이즈 제거 파이프라인이다. 자기 지율적 표현 학습, KNN 기반 레이블 스무딩, 데이터 쇼플리(Shapley)를 활용한 샘플 정제를 통해 CMADE는 전문가가 평가한 대화 쌍에서 89.2%의 정확도와 0.787의 카파를 기록하며 기존의 기준 모델들을 크게 앞서 간다.

ABSTRACT

Open Domain dialog system evaluation is one of the most important challenges in dialog research. Existing automatic evaluation metrics, such as BLEU are mostly reference-based. They calculate the difference between the generated response and a limited number of available references. Likert-score based self-reported user rating is widely adopted by social conversational systems, such as Amazon Alexa Prize chatbots. However, self-reported user rating suffers from bias and variance among different users. To alleviate this problem, we formulate dialog evaluation as a comparison task. We also propose an automatic evaluation model CMADE (Comparison Model for Automatic Dialog Evaluation) that automatically cleans self-reported user ratings as it trains on them. Specifically, we first use a self-supervised method to learn better dialog feature representation, and then use KNN and Shapley to remove confusing samples. Our experiments show that CMADE achieves 89.2% accuracy in the dialog comparison task.

연구 동기 및 목표

  • 실제 대화 시스템(예: 아마존 알렉사)에서 사용되는 자가 보고한 리커트 척도 평가의 높은 편향과 분산을 해결하기 위해.
  • 잡음이 많은 사용자 평가를 신뢰할 수 있는 비교 기반 판단으로 변환함으로써 자동 대화 평가를 향상시키기 위해.
  • 모델의 일반화 능력 향상과 전문가 평가와의 일치도 향상을 위한 노이즈 제거 파이프라인 개발을 위해.
  • 비교 기반 평가 프레임워크가 기준 문장 기반 지표와 원시 사용자 평가를 능가할 수 있음을 입증하기 위해.

제안 방법

  • 먼저, 사전 훈련된 BERT 기반 인코더를 사용하여 강력한 대화 표현을 학습하기 위해 자기 지율적 학습을 적용한다.
  • 두 번째로, 학습된 특징 공간에 KNN 기반 레이블 스무딩을 적용하여 자가 보고 평가의 노이즈를 감소시킨다.
  • 세 번째로, 모델 성능에 기여도가 낮은 학습 샘플을 식별하고 제거하기 위해 데이터 쇼플리를 활용한다.
  • 청소된 데이터셋으로 모델을 미세 조정하여 일반화 능력을 향상시키고 노이즈 있는 레이블에 대한 과적합을 방지한다.
  • 노이즈 제거된 데이터를 사용하여 쌍별 비교 모델을 훈련시켜 두 대화 응답 중 어느 것이 더 나은지 예측한다.
  • 강력한 초기 특징 표현을 확보하기 위해 사전 훈련된 가중치로 초기화된 BERT 기반 대화 인코더를 사용한다.

실험 결과

연구 질문

  • RQ1비교 기반 자동 평가 모델이 개방형 대화 시스템에서 BLEU와 같은 기준 문장 기반 지표를 능가할 수 있는가?
  • RQ2잡음이 많은 자가 보고 리커트 척도 평가를 효과적으로 노이즈 제거하여 모델 성능을 향상시킬 수 있는가?
  • RQ3자기 지율적 표현 학습에서 시작하여 데이터 쇼플리로 끝나는 점진적인 세 단계 노이즈 제거 파이프라인은 모델 정확도와 강건성 향상에 기여하는가?
  • RQ4데이터 쇼플리는 대화 평가에서 노이즈 있는 학습 샘플을 식별하고 제거하는 데 얼마나 효과적인가?

주요 결과

  • CMADE는 전문가가 평가한 대화 쌍의 테스트 세트에서 89.2%의 정확도와 0.787의 카파를 기록하여 인간 평가와의 강한 일치를 보였다.
  • 세 단계 파이프라인은 노이즈 제거가 없는 모델이나 무작위 샘플 제거를 사용한 모델을 포함한 모든 기준 모델들을 크게 능가한다.
  • 1단계(자기 지율적 표현 학습)가 핵심적이다: BERT 초기화가 있더라도 이를 생략하면 이후 단계의 성능이 저하된다.
  • 3단계에서 데이터 쇼플리 노이즈 제거는 이전 단계와 조합될 때 가장 효과적이며, 이로 인해 정확도가 0.837에서 0.892로 향상된다.
  • 저쇼플리 값 샘플을 제거하면 KNN 회귀기 성능이 향상되지만, 무작위 제거는 성능을 악화시키므로 쇼플리 기반 정제의 효과가 입증된다.
  • 개발 세트를 직접 훈련 데이터에 추가하는 것보다 데이터 쇼플리 노이즈 제거를 활용하는 것이 더 효과적이며, 이는 BERT-Pairwise+Dev에서 0.749의 정확도 대비 CMADE에서 0.892의 정확도로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.