Skip to main content
QUICK REVIEW

[논문 리뷰] How to Evaluate the Next System: Automatic Dialogue Evaluation from the Perspective of Continual Learning

Li Lü, Zhongheng He|arXiv (Cornell University)|2019. 12. 10.
Topic Modeling참고 문헌 21인용 수 5
한 줄 요약

이 논문은 사전에 훈련된 신경 평가자에 대해 지속적 학습 기법을 적용하여 새로운 대화 시스템에 적응하면서 이전 지식을 잊지 않고 자동 대화 평가를 향상시키는 방법을 제안한다. 에라스틱 웨이트 콜라보레이션(EWC)과 변동형 지속적 학습(VCL)을 적용함으로써, 전체 재훈련과 유사한 성능를 달성하면서도 훨씬 적은 애너테이션 자원을 요구하며, 복수의 평가자 유지가 필요 없게 되어 장기적으로 확장 가능하고 저비용이며 프라이버시를 보호하는 평가를 가능하게 한다.

ABSTRACT

Automatic dialogue evaluation plays a crucial role in open-domain dialogue research. Previous works train neural networks with limited annotation for conducting automatic dialogue evaluation, which would naturally affect the evaluation fairness as dialogue systems close to the scope of training corpus would have more preference than the other ones. In this paper, we study alleviating this problem from the perspective of continual learning: given an existing neural dialogue evaluator and the next system to be evaluated, we fine-tune the learned neural evaluator by selectively forgetting/updating its parameters, to jointly fit dialogue systems have been and will be evaluated. Our motivation is to seek for a lifelong and low-cost automatic evaluation for dialogue systems, rather than to reconstruct the evaluator over and over again. Experimental results show that our continual evaluator achieves comparable performance with reconstructing new evaluators, while requires significantly lower resources.

연구 동기 및 목표

  • 새로운 대화 시스템에 대해 원래의 훈련 분포 외부에 있는 시스템을 평가할 때 정적 신경 대화 평가자의 일반화 능력이 떨어지는 문제를 해결하기 위해.
  • 매번 새로운 대화 시스템을 위해 평가자를 다시 훈련하는 데 드는 자원 비용과 유지보수 부담을 줄이기 위해.
  • 한 개의 평가자만으로도 이전의 시스템 지식을 유지하면서 새로운 시스템에 적응할 수 있도록 수명 주기 평가를 가능하게 하기 위해.
  • 훈련 분포 내에 있는 시스템에 대한 편향을 최소화하여 평가의 공정성을 향상시키기 위해.
  • 지속적 학습이 더 적은 애너테이션 자원으로 전체 재훈련과 유사한 성능를 달성할 수 있는지 탐색하기 위해.

제안 방법

  • 기존의 신경 대화 평가자(ADEM)를 지속적 학습 기법을 사용해 새로운 대화 시스템에 적응시키되, 이전 지식을 잊지 않도록 한다.
  • 에라스틱 웨이트 콜라보레이션(EWC)을 적용하여 이전 대화 시스템에서 중요한 파라미터는 선택적으로 유지하면서 새로운 시스템에 맞게 나머지 파라미터는 갱신한다.
  • 변동형 지속적 학습(VCL)을 사용해 모델 가중치에 대한 베이지안 사후분포를 유지하고, 새로운 데이터로 지식을 점진적으로 갱신한다.
  • 이전과 새로 평가된 모든 대화 시스템에 동시에 적합하는 단일 통합 평가자를 유지하여 다시 훈련할 필요 없이 운영한다.
  • 인간 애너테이터가 제공한 점수를 각 새로운 시스템의 지도로 사용하여 대화 시스템의 시퀀스 순서로 평가자를 점진적으로 훈련시킨다.
  • 지속적 학습 성능를 평가하기 위해 유연성(새로운 시스템에 대한 적응 능력)과 안정성(이전 예측과의 일관성)을 측정한다.

실험 결과

연구 질문

  • RQ1지속적 학습은 원래 훈련 분포를 초월한 대화 시스템 평가에서 신경 대화 평가자의 일반화 능력을 향상시킬 수 있는가?
  • RQ2평가 정확도와 자원 효율성 측면에서 지속적 토닝은 전체 재훈련에 비해 어떻게 비교되는가?
  • RQ3지속적 학습은 새로운 대화 시스템에 적응하면서 이전 대화 시스템의 지식을 어느 정도 유지할 수 있는가?
  • RQ4지속적 학습은 새로운 대화 시스템 평가에 필요한 애너테이션 비용을 줄일 수 있는가?
  • RQ5지속적 학습 기반 평가자는 치명적인 잊음 없이 다양한 대화 시스템에서 안정적인 성능를 유지할 수 있는가?

주요 결과

  • 지속적 학습 기반 평가자(EWC 및 VCL)는 다음 대화 시스템 평가에서 전체 재훈련과 유사한 성능를 달성하며, 인간-시스템 평가에서 스피어만 상관계수 0.78을 기록했고, 재구성 기반 결과인 0.80에 근접한다.
  • EWC 기반 평가에서는 안정성이 매우 높으며, 이전에 평가된 시스템에서 정확도가 0.055 감소하는 데 그치지만, 유연성은 여전히 높다.
  • VCL 기반 평가에서는 인간-시스템에서 EWC(0.245)에 비해 유연성이 약간 낮은 0.190을 기록하여, EWC가 안정성과 유연성의 균형을 더 잘 유지함을 시사한다.
  • 훈련 데이터 크기가 감소함에 따라, 지속적 학습 방법(EWC 및 VCL)은 유연성에 덜 영향을 받는 반면, 일반 토닝은 인간-시스템에서 유연성이 0.345에서 0.190으로 급격히 감소함을 보였다.
  • 지속적 학습 접근법은 애너테이션 요구량을 줄이고 복수의 평가자나 대규모 애너테이션 세트를 유지할 필요 없이 확장 가능하고 프라이버시를 보호하는 평가를 가능하게 한다.
  • 이 방법은 비중요한 파라미터만 선택적으로 갱신함으로써 안정성-탄력성 딜레마를 성공적으로 완화하여 이전 대화 시스템의 지식을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.