Skip to main content
QUICK REVIEW

[논문 리뷰] AugESC: Dialogue Augmentation with Large Language Models for Emotional Support Conversation

Chujie Zheng, Sahand Sabour|arXiv (Cornell University)|2022. 02. 26.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 감정 지원 대화(ESC)를 위한 대규모 대화 증강 프레임워크인 AugESC를 제안한다. 미세튜닝된 대규모 언어모델(LLM)을 사용하여, 대화 증강을 대화 완성 작업으로 간주함으로써 짧은 게시물에서 고품질이고 다양한 대화를 생성한다. 이로 인해 ESConv 데이터셋의 규모(45배)와 주제 커버리지가 크게 증가한다. 인간 평가 결과, AugESC의 품질은 커뮤니티 기반 데이터와 유사하며, 이에 기반한 미세튜닝은 개방형 주제로의 다운스트림 모델 일반화 능력을 향상시킨다.

ABSTRACT

Crowdsourced dialogue corpora are usually limited in scale and topic coverage due to the expensive cost of data curation. This would hinder the generalization of downstream dialogue models to open-domain topics. In this work, we leverage large language models for dialogue augmentation in the task of emotional support conversation (ESC). By treating dialogue augmentation as a dialogue completion task, we prompt a fine-tuned language model to complete full dialogues from available dialogue posts of various topics, which are then postprocessed based on heuristics. Applying this approach, we construct AugESC, an augmented dataset for the ESC task, which largely extends the scale and topic coverage of the crowdsourced ESConv corpus. Through comprehensive human evaluation, we demonstrate that our approach is superior to strong baselines of dialogue augmentation and that AugESC has comparable dialogue quality to the crowdsourced corpus. We also conduct human interactive evaluation and prove that post-training on AugESC improves downstream dialogue models' generalization ability to open-domain topics. These results suggest the utility of AugESC and highlight the potential of large language models in improving data-scarce dialogue generation tasks.

연구 동기 및 목표

  • ESConv와 같은 커뮤니티 기반 감정 지원 대화 데이터셋의 제한된 규모와 좁은 주제 커버리지 문제를 해결하기 위해.
  • 감정적으로 민감한 ESC 작업에서 대화 데이터를 확장 가능한 자동화된 방법을 개발하기 위해.
  • LLM에 의해 생성된 대화가 감정 지원 시나리오에서 인간이 정제한 데이터와 동등한 품질을 가지는지 평가하기 위해.
  • 증강된 데이터 기반 미세튜닝이 개방형 주제로의 다운스트림 모델 일반화 능력을 향상시키는지 확인하기 위해.
  • 잠재적 편향과 유해 콘텐츠 위험을 고려하여 합리적인 윤리적 사용을 보장하기 위해.

제안 방법

  • 기존 ESConv 대화 샘플을 기반으로 6B 파라미터 GPT-J 언어모델을 미세튜닝하여 감정 지원 대화 생성에 적합한 모델로 조정한다.
  • EmpatheticDialogues에서 수집한 주제 다양성이 높은 짧은 대화 게시물에서 시작하여, 미세튜닝된 LLM을 활용해 전체 대화를 완성한다.
  • 합리적인 기준 기반 후처리를 적용하여 생성된 대화의 일관성, 감정적 관련성, 품질을 확보한다.
  • 생성된 대화와 원본 ESConv 코퍼스를 결합하여 AugESC를 구성함으로써, 원본 데이터보다 45배 더 큰 규모이자 더 넓은 주제 커버리지의 데이터셋을 확보한다.
  • 자동 평가 지표(PPL, BLEU, ROUGE-L, Distinct)와 종합적인 인간 평가를 통해 대화 품질 및 모델 일반화 능력을 평가한다.
  • 인간 상호작용 평가를 수행하여 AugESC가 개방형 감정 지원 작업에서 다운스트림 모델 성능 향상에 기여하는지 검증한다.

실험 결과

연구 질문

  • RQ1LLM 기반 대화 증강이 인간이 정제한 데이터와 유사한 품질의 감정 지원 대화를 생성할 수 있는가?
  • RQ2LLM에 의해 생성된 대화로 ESConv 데이터셋을 증강하면 다운스트림 대화 모델의 개방형 주제로의 일반화 능력이 유의미하게 향상되는가?
  • RQ3제안된 대화 완성 접근법은 기존의 대화 증강 베이스라인 대비 효과성과 효율성 측면에서 어떻게 비교되는가?
  • RQ4AugESC 기반 후처리 학습이 원본 ESConv 테스트 세트에서의 도메인 내 성능을 얼마나 잘 유지하는가?
  • RQ5연구 목적에 한정하여 사용할 경우, 합성된 LLM 기반 감정 지원 대화를 사용하는 데 있어 윤리적 함의는 무엇인가?

주요 결과

  • 제안된 대화 완성 접근법은 인간 평가와 자동 평가 지표 양면에서 강력한 베이스라인을 초월하여, 대화 증강의 효과성과 효율성 측면에서 뛰어난 성능을 보였다.
  • 종합적인 인간 평가를 통해 AugESC가 원본 커뮤니티 기반 ESConv 코퍼스와 동등한 수준의 대화 품질을 확보함을 입증하였다.
  • 인간 상호작용 평가를 통해 AugESC 기반 미세튜닝이 다운스트림 대화 모델의 개방형 주제로의 일반화 능력을 유의미하게 향상시킴을 확인하였다.
  • AugESC 기반 후처리 학습은 ESConv 테스트 세트에서 강력한 도메인 내 성능을 유지하였으며, 퍼플렉서티(PPL)와 BLEU 점수와 같은 자동 평가 지표에서도 최소한의 성능 저하를 보였다.
  • 증강된 데이터셋은 원본 ESConv 코퍼스의 규모를 45배로 확장하였고, 주제 커버리지가 상당히 넓어져 다양한 감정 지원 시나리오의 표현 능력을 향상시켰다.
  • 편향과 유해 콘텐츠 잠재 위험에도 불구하고, 투명한 인간 평가 프로토콜과 연구 목적에 한정된 사용 제한 조건을 통해 AugESC의 윤리적 사용이 가능함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.