[논문 리뷰] ClovaCall: Korean Goal-Oriented Dialog Speech Corpus for Automatic Speech Recognition of Contact Centers
ClovaCall은 실시간 레스토랑 예약 전화에서 유래한 60,746개의 발화-문장 쌍을 포함한 대규모 한국어 목표 지향 대화 음성 코퍼스로, 처음으로 제작된 것이다. Deep Speech 2 및 LAS 모델을 사용한 평가에서, 일반 도메인 데이터로 사전 훈련한 후 미세조정하는 방식으로 음성 인식 성능이 크게 향상되었으며, 특히 컨택센터 응용 분야에서 작업 특화 코퍼스의 중요성을 입증한다.
Automatic speech recognition (ASR) via call is essential for various applications, including AI for contact center (AICC) services. Despite the advancement of ASR, however, most publicly available call-based speech corpora such as Switchboard are old-fashioned. Also, most existing call corpora are in English and mainly focus on open domain dialog or general scenarios such as audiobooks. Here we introduce a new large-scale Korean call-based speech corpus under a goal-oriented dialog scenario from more than 11,000 people, i.e., ClovaCall corpus. ClovaCall includes approximately 60,000 pairs of a short sentence and its corresponding spoken utterance in a restaurant reservation domain. We validate the effectiveness of our dataset with intensive experiments using two standard ASR models. Furthermore, we release our ClovaCall dataset and baseline source codes to be available via https://github.com/ClovaAI/ClovaCall.
연구 동기 및 목표
- 컨택센터 응용 분야에서의 자동 음성 인식(ASR)을 위한 대규모, 작업 특화 한국어 음성 코퍼스의 부족 문제를 해결하기 위해.
- 레스토랑 예약 시나리오에 특화된 고품질의 목표 지향 대화 데이터셋을 제공하기 위해.
- 작업 특화 데이터의 효과성을 검증하여 실생활 AICC(컨택센터를 위한 인공지능) 서비스의 ASR 성능 향상에 기여하기 위해.
- 공개 가능한 고품질의 한국어 코퍼스를 제공함으로써 저자원 언어의 ASR 연구를 지원하기 위해.
- 일반 도메인 데이터로 사전 훈련한 후 작업 특화 데이터로 미세조정하는 것이, 초기 훈련부터 시작하는 것보다 우수한 성능을 내는지 확인하기 위해.
제안 방법
- ClovaCall 코퍼스는 11,000명 이상의 참가자가 사전에 정의된 짧은 문장을 읽는 시뮬레이션 레스토랑 예약 전화를 통해 수집되었다.
- 이 데이터셋은 60,746개의 쌍으로 구성되어 있으며, 모두 하나의 목표 지향 도메인인 레스토랑 예약에 집중되어 있다.
- 짧고 자연스러운 질문과 답변을 사용함으로써 정렬 및 종료 지점 탐지 문제를 최소화하도록 코퍼스를 설계하였다.
- 표준 ASR 모델 두 종류—Deep Speech 2(DS2)와 Listen, Attend and Spell(LAS)—를 사용하여 세 가지 훈련 방식(사전 훈련-미세조정, 초기 훈련, 데이터 증강을 적용한 초기 훈련)으로 훈련하였다.
- 사전 훈련은 AIHub의 개방형 도메인 한국어 코퍼스를 사용하였고, 이후 ClovaCall 또는 더 작은 QA 기반 전화 코퍼스로 미세조정을 수행하였다.
- 노이즈 증강(NA) 및 SpecAugment(SA)와 같은 데이터 증강 기법을 적용하여 내성적 저항성을 평가하였지만, 녹음본에 이미 충분한 노이즈가 포함되어 있어 성능 향상이 제한적이었다.

실험 결과
연구 질문
- RQ1일반 도메인 코퍼스만을 사용하는 것과 비교해, 작업 특화의 목표 지향 한국어 음성 코퍼스가 ASR 성능 향상에 기여하는가?
- RQ2AIHub와 같은 대규모 개방형 도메인 코퍼스로 사전 훈련한 후 ClovaCall과 같은 더 작은 도메인 특화 코퍼스로 미세조정하면 ASR 성능 향상이 이루어지는가?
- RQ3ClovaCall에서 초기 훈련으로만 수행한 ASR 모델의 성능은 일반 도메인 데이터로 사전 훈련한 후 미세조정한 모델과 비교해 어떻게 되는가?
- RQ4데이터 증강 기법이 ClovaCall 데이터셋의 ASR 정확도 향상에 어느 정도 기여하는가?
- RQ5CER 및 내성적 저항성 측면에서 ClovaCall의 성능은 AIHub 및 QA 기반 전화 데이터셋과 비교해 어떻게 되는가?
주요 결과
- 일반 도메인 AIHub 코퍼스로 사전 훈련한 후 ClovaCall로 미세조정하면 LAS의 단어 오류률(WER)이 8.0%로 감소하였고, DS2는 8.31%로 크게 향상되었다. 이는 초기 훈련보다 뚜렷이 뛰어난 성능을 보였다.
- ClovaCall에서 초기 훈련으로 수행한 결과, DS2의 WER는 11.4%, LAS는 15.1%로 나타나, 높은 성능을 달성하기 위해 작업 특화 데이터의 필수성을 확인하였다.
- AIHub에서 사전 훈련한 후 ClovaCall로 미세조정하면, 초기 훈련만으로 AIHub에서 훈련한 것과 비교해 LAS의 WER가 69.2% 감소했고, DS2는 59.5% 감소하였다.
- QA 기반 전화 코퍼스는 사전 훈련-미세조정 및 초기 훈련 모두에서 ClovaCall을 초월했으며, 이는 더 큰 테스트 세트와 더 넓은 어휘를 갖추고 있기 때문일 것이다.
- 데이터 증강(NA 및 SA)은 성능 향상이 미미하여, 녹음본에 이미 충분한 노이즈가 포함되어 있었고, 특히 LAS와 같은 작은 모델에 과도한 증강은 악영향을 줄 수 있음을 시사하였다.
- 결과적으로 목표 지향 대화 시스템의 ASR 성능 향상에 작업 특화 코퍼스가 필수적임을 확인하였으며, 특히 한국어와 같은 저자원 언어에서 그러한 필요성이 뚜렷하다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.