Skip to main content
QUICK REVIEW

[논문 리뷰] A Large-Scale Chinese Short-Text Conversation Dataset

Yida Wang, Pei Ke|arXiv (Cornell University)|2020. 08. 10.
Topic Modeling참고 문헌 39인용 수 6
한 줄 요약

이 논문은 680만 개(베이스) 및 1,200만 개(라지) 대화를 포함하는 대규모 고품질 중국어 짧은 대화 데이터셋인 LCCC를 소개한다. 이 데이터셋은 규칙 기반 필터링과 수작업로 레이블링된 11만 개의 쌍을 기반으로 훈련된 분류기를 결합한 이단계 처리 파이프라인을 통해 청소되었다. 저자들은 LCCC에서 훈련된 사전 미세조정된 대화 모델(CDialGPT)을 공개하며, 이는 자동 평가 및 인간 평가에서 뛰어난 성능을 보이며 중국어 오픈도메인 대화 생성 분야의 벤치마크를 설정한다.

ABSTRACT

The advancements of neural dialogue generation models show promising results on modeling short-text conversations. However, training such models usually needs a large-scale high-quality dialogue corpus, which is hard to access. In this paper, we present a large-scale cleaned Chinese conversation dataset, LCCC, which contains a base version (6.8million dialogues) and a large version (12.0 million dialogues). The quality of our dataset is ensured by a rigorous data cleaning pipeline, which is built based on a set of rules and a classifier that is trained on manually annotated 110K dialogue pairs. We also release pre-training dialogue models which are trained on LCCC-base and LCCC-large respectively. The cleaned dataset and the pre-training models will facilitate the research of short-text conversation modeling. All the models and datasets are available at https://github.com/thu-coai/CDial-GPT.

연구 동기 및 목표

  • 신경 대화 생성 모델을 훈련하기 위한 대규모 고품질 중국어 대화 데이터셋의 부족을 해결하기 위해.
  • 공개된 소셜 미디어 코퍼스에서의 데이터 품질 문제(예: 유해 콘텐츠, 낮은 관련성 등)를 해결하기 위해.
  • 중국어 짧은 텍스트 대화에 적합한 확장 가능한 규칙 기반 및 분류기 기반의 데이터 청소 파이프라인을 개발하기 위해.
  • 연구를 가속화하기 위해 벤치마크 데이터셋과 사전 훈련된 모델을 공개하기 위해.
  • 정제된 중국어 대화 데이터를 대규모 사전 훈련을 통해 오픈도메인 대화 생성 분야에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 이중 단계 데이터 청소 파이프라인을 설계함: 먼저 히우리스틱 규칙을 적용해 부적절한 콘텐츠를 필터링하고, 이후 11만 개의 수작업 레이블링된 대화 쌍을 기반으로 훈련된 분류기를 사용해 품질을 추가로 개선함.
  • LCCC 데이터셋은 베이스 버전의 경우 7,900만 개의 Weibo 대화에서, 라지 버전은 추가적인 중국어 코퍼스를 통합하여 구성됨.
  • 사전 훈련된 모델(CDialGPT)은 중국어 소설 코퍼스에서 사전 훈련된 후, 마스크된 언어 모델링 목표를 사용해 LCCC 데이터셋에서 미세조정됨.
  • 모델들은 순서 기반 생성 프레임워크와 자동회귀 디코딩을 사용해 하류 작업에서 미세조정됨.
  • 모델 평가에는 자동 평가 지표(BLEU, 퍼플렉서티, 디스티크트 n-그램, 그리디 매칭, 임베딩 평균)와 인간 평가의 조합이 사용됨.
  • 모든 모델과 데이터셋은 공개용으로 GitHub에 배포됨: https://github.com/thu-coai/CDial-GPT

실험 결과

연구 질문

  • RQ1확장 가능한 규칙 기반 및 분류기 기반 파이프라인은 고품질 대화 샘플을 유지하면서 대규모 중국어 짧은 텍스트 대화를 효과적으로 청소할 수 있는가?
  • RQ2소규모 또는 노이즈가 많은 데이터셋에서 훈련된 모델에 비해, 정제된 대규모 중국어 대화 코퍼스에서의 사전 훈련은 오픈도메인 대화 생성 성능을 어떻게 향상시키는가?
  • RQ3공개된 사전 훈련된 모델(CDialGPT)이 중국어 대화 생성 분야에서 자동 평가 및 인간 평가 지표에서 기존 베이스라인을 얼마나 뛰어나게 성과를 내는가?
  • RQ4LCCC 데이터셋은 중국어 대화 생성 모델의 훈련 및 평가를 위한 견고한 벤치마크로 기능하는가?
  • RQ5데이터셋의 크기와 품질은 생성된 응답의 유창성, 관련성, 정보성에 어떤 영향을 미치는가?

주요 결과

  • LCCC-라지 데이터셋은 1,200만 개의 고품질 대화를 포함하며, 베이스 버전은 680만 개로, 중국어 대화 연구를 위한 자원을 크게 확장함.
  • 규칙 기반 필터링과 훈련된 분류기를 조합한 이중 단계 청소 파이프라인은 노이즈를 효과적으로 감소시켜 사전 훈련에 적합한 고품질 코퍼스를 생성함.
  • LCCC에서 사전 훈련된 CDialGPT 모델은 LCCC-라지 버전에서 퍼플렉서티 18.23을 기록하며 자동 평가 및 인간 평가에서 다른 모델을 압도함.
  • 인간 평가 결과, CDialGPT_{LCCC-라지}는 2/1/0 척도에서 1.217점의 점수를 기록했으며, 48.6%의 응답이 높은 정보성으로 평가되어 뛰어난 유창성과 관련성 확보됨.
  • BLEU 점수는 낮지만, Transformer 및 GPT2-chitchat과 같은 강력한 베이스라인 모델보다 인간 평가에서 뛰어난 성능을 보이며, 데이터 품질의 중요성을 확인함.
  • https://github.com/thu-coai/CDial-GPT 에서 데이터셋과 모델을 공개함으로써 재현 가능한 연구와 중국어 대화 생성 분야의 발전을 가속화함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.