Skip to main content
QUICK REVIEW

[논문 리뷰] Speech Corpus of Ainu Folklore and End-to-end Speech Recognition for Ainu Language

Kohei Matsuura, Sei Ueno|arXiv (Cornell University)|2020. 02. 16.
Speech Recognition and Synthesis참고 문헌 34인용 수 12
한 줄 요약

이 논문은 위기적인 언어인 아이ヌ어 민속어휘 자료를 제작하고, 비표준적 글자 체계를 가진 저자원 아이ヌ어를 대상으로 종단간 자동 음성 인식(ASR) 시스템을 개발한다. 음절 기반 모델링과 하이브리드 CTC-attention 모델을 사용하여, 발화자-폐쇄 조건에서 80% 단어 정확도와 90% 음소 정확도를 달성하고, 발화자-개방 조건에서는 60% 단어 정확도를 기록한다. 또한 다국어 미사전훈련을 통해 개방 설정 성능을 10% 상대적 WER 감소로 향상시킨다.

ABSTRACT

Ainu is an unwritten language that has been spoken by Ainu people who are one of the ethnic groups in Japan. It is recognized as critically endangered by UNESCO and archiving and documentation of its language heritage is of paramount importance. Although a considerable amount of voice recordings of Ainu folklore has been produced and accumulated to save their culture, only a quite limited parts of them are transcribed so far. Thus, we started a project of automatic speech recognition (ASR) for the Ainu language in order to contribute to the development of annotated language archives. In this paper, we report speech corpus development and the structure and performance of end-to-end ASR for Ainu. We investigated four modeling units (phone, syllable, word piece, and word) and found that the syllable-based model performed best in terms of both word and phone recognition accuracy, which were about 60% and over 85% respectively in speaker-open condition. Furthermore, word and phone accuracy of 80% and 90% has been achieved in a speaker-closed setting. We also found out that a multilingual ASR training with additional speech corpora of English and Japanese further improves the speaker-open test accuracy.

연구 동기 및 목표

  • 비표준적 글자 체계를 지닌 위기적인 언어인 아이누어를 보존하기 위해, 대규모로 정렬된 아이누어 민속어휘 자료를 구축함으로써 언어 기록의 긴급한 필요를 해결하고자 한다.
  • 표준화된 글자 체계가 없고 자원이 극히 부족한 위기적인 언어인 아이누어를 대상으로 종단간 자동 음성 인식(ASR) 시스템을 개발하고자 한다.
  • 저자원 환경에서 ASR 성능에 영향을 미치는 다양한 모델링 단위—음소, 음절, 단어 조각, 단어—의 영향을 평가하고자 한다.
  • 일본어 및 영어 어휘 자료를 활용한 다국어 미사전훈련이 아이누어와 같은 저자원 언어의 ASR 성능 향상에 얼마나 효과적인지 조사하고자 한다.
  • 데이터 증강 및 전이 학습 기법을 통해 발화자-폐쇄와 발화자-개방 ASR 설정 간 성능 격차를 줄이고자 한다.

제안 방법

  • 아이누 박물관과 니부타니 아이누 문화 박물관의 38.5시간 분량의 아이누어 민속 기록을 바탕으로 서사적 이야기 전달에 중점을 둔 어휘 자료를 구축하였다.
  • 연결망 시간 분류(CTC)와 주목적 기반 병합을 결합한 하이브리드 종단간 ASR 모델을 사용하였으며, 가중 손실 함수를 적용한 모델링 방식을 사용하였다: $\mathcal{L}_{\rm{all}} = \lambda\mathcal{L}_{\rm{attn}} + (1-\lambda)\mathcal{L}_{\rm{CTC}}$이며, $\lambda = 0.5$로 설정하였다.
  • 네 가지 모델링 단위—음소(~25), 음절(~500), 단어 조각(500), 단어(5,000)—를 평가하였으며, 희귀어는 <unk>로 대체하였다.
  • 아이누어 데이터와 일본어(JNAS) 및 영어(WSJ) 자료를 결합하여 다국어 미사전훈련을 수행하였고, 30 에포크 후 아이누어 데이터에 대해 미세조정을 실시하였다.
  • 특히 저자원 환경에서 일반화 능력을 향상시키기 위해 CTC 보조 작업에 음소 수준의 레이블을 사용하였다.
  • 발화자 기반 평가를 통해 발화자-폐쇄 및 발화자-개방 조건에서 성능을 평가하기 위해 발화자 간 가중 평균을 적용하였다.

실험 결과

연구 질문

  • RQ1종단간 ASR에서 아이누어 언어의 단어 및 음소 인식 정확도를 높이는 데 가장 효과적인 모델링 단위는 음소, 음절, 단어 조각, 또는 단어 중 무엇인가?
  • RQ2일본어 및 영어 어휘 자료를 활용한 다국어 미사전훈련이 아이누어 ASR 시스템의 성능, 특히 발화자-개방 설정에서 향상되는가?
  • RQ3발화자-폐쇄 및 발화자-개방 평가 간 ASR 시스템의 성능 격차는 어떻게 변화하며, 그 격차를 초래하는 요인은 무엇인가?
  • RQ4아이누어의 복합어가 낮은 음소 오류율( PER )에도 불구하고 높은 단어 오류율(WER)을 초래하는 정도는 어느 정도인가?
  • RQ5저자원이고 축합어적 성격을 지닌 언어인 아이누어와 같은 언어에서 음절 기반 모델링이 단어 수준의 모델링보다 더 넓은 커버리지와 더 강한 제약을 제공하는가?

주요 결과

  • 음절 기반 모델링 단위가 가장 뛰어난 성능을 보였으며, 발화자-폐쇄 조건에서 단어 오류율(WER)은 20%이고, 음소 오류율(PER)은 6%였다.
  • 발화자-개방 조건에서는 음절 모델이 60%의 단어 정확도와 14%의 WER를 기록하였으며, PER는 14%로, 다양한 발화자 간의 변동성이 뚜렷하게 나타났다.
  • 단어 기반 모델은 빈번한 <unk> 토큰 생성과 복합어 분할 오류로 인해 성능이 열악하여 일부 사례에서 WER이 최대 30%에 이르렀다.
  • 일본어(JNAS) 및 영어(WSJ) 자료를 활용한 다국어 미사전훈련은 발화자-개방 조건에서 WER을 10% 상대적으로 감소시켰으며, 언어적 유사성 덕분에 JNAS가 더 효과적인 것으로 나타났다.
  • 발화자-폐쇄 조건에서는 94%의 음소 정확도, 발화자-개방 조건에서는 86%의 음소 정확도를 기록하여, 저자원 조건임에도 불구하고 강력한 음소 인식 능력을 보였다.
  • WER와 PER 간의 괴리—예를 들어 WER 57%와 PER 0%—는 복합어의 단어 분할 오류가 아이누어 ASR에서 주요 과제임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.