[논문 리뷰] Knowledge-driven Subword Grammar Modeling for Automatic Speech Recognition in Tamil and Kannada
이 논문은 타밀어와 칸나다어의 자동 음성 인식(ASR)을 위한 지식 기반 서브워드 문법 모델링 접근법을 제안한다. 수작업으로 정제된 형태소 규칙을 활용하여 가중치가 부여된 유한 상태 변환기(SG-WFST)를 구성함으로써 서브워드 분할을 수행한다. 동사, 명사, 대명사, 수사어 등에 대해 접두사, 중위어, 접미사를 정의함으로써 언어학적 지식을 활용하여 단어 오류율(WER)을 기준선 단어 기반 ASR 대비 타밀어에서 12.39%, 칸나다어에서 13.56% 감소시켰으며, 동시에 OOV(어휘 외 어휘) 비율도 낮게 유지하였다.
In this paper, we present specially designed automatic speech recognition (ASR) systems for the highly agglutinative and inflective languages of Tamil and Kannada that can recognize unlimited vocabulary of words. We use subwords as the basic lexical units for recognition and construct subword grammar weighted finite state transducer (SG-WFST) graphs for word segmentation that captures most of the complex word formation rules of the languages. We have identified the following category of words (i) verbs, (ii) nouns, (ii) pronouns, and (iv) numbers. The prefix, infix and suffix lists of subwords are created for each of these categories and are used to design the SG-WFST graphs. We also present a heuristic segmentation algorithm that can even segment exceptional words that do not follow the rules encapsulated in the SG-WFST graph. Most of the data-driven subword dictionary creation algorithms are computation driven, and hence do not guarantee morpheme-like units and so we have used the linguistic knowledge of the languages and manually created the subword dictionaries and the graphs. Finally, we train a deep neural network acoustic model and combine it with the pronunciation lexicon of the subword dictionary and the SG-WFST graph to build the subword-ASR systems. Since the subword-ASR produces subword sequences as output for a given test speech, we post-process its output to get the final word sequence, so that the actual number of words that can be recognized is much higher. Upon experimenting the subword-ASR system with the IISc-MILE Tamil and Kannada ASR corpora, we observe an absolute word error rate reduction of 12.39% and 13.56% over the baseline word-based ASR systems for Tamil and Kannada, respectively.
연구 동기 및 목표
- 타밀어와 칸나다어와 같이 극도로 축합적인 드라비디아어 언어에서 높은 어휘 외 어휘(OOV) 비율을 해결하기 위해.
- 데이터 기반 서브워드 방법이 언어학적으로 의미 있는 형태소 유사 단위를 생성하지 못하는 한계를 극복하기 위해.
- 언어학적 지식을 활용해 복잡한 어형 형성 규칙을 모델링함으로써 무제한 어휘를 인식할 수 있는 서브워드 기반 ASR 시스템을 설계하기 위해.
- 구조화된 서브워드 문법과 히우리스틱 분할을 통해 기준선 단어 수준 ASR 시스템 대비 단어 오류율(WER)을 크게 감소시키기 위해.
- 정규화된 후처리 규칙을 통해 서브워드 출력에서 단어 시퀀스를 안정적으로 복구할 수 있도록 하기 위해.
제안 방법
- 언어학적 지식을 기반으로 수작업으로 구성한 서브워드 사전을 활용하여 동사, 명사, 대명사, 수사어 등 어휘 카테고리로 분류한다.
- 타밀어와 칸나다어의 형태적 변화와 축합을 모델링하기 위해 각 어휘 카테고리별로 접두사, 중위어, 접미사 목록을 설계한다.
- 서브워드 단위의 문자열 연결을 통해 유효한 어형 형성 규칙을 표현하기 위해 서브워드 문법 가중 유한 상태 변환기(SG-WFST)를 구축한다.
- SG-WFST 규칙에 포함되지 않는 예외적 어휘를 처리하기 위해 히우리스틱 분할 알고리즘을 개발한다.
- DNN 음향 모델과 서브워드 사전, 언어 모델 WFST를 결합하여 최종 ASR 디코딩 그래프를 구성한다.
- 문맥 마커를 사용한 결정론적 연결 및 제거를 통해 서브워드 출력에서 최종 어휘 시퀀스를 복원하기 위한 후처리를 적용한다.
실험 결과
연구 질문
- RQ1지식 기반 서브워드 문법 모델은 타밀어와 칸나다어와 같이 극도로 축합적인 언어에서 OOV 비율을 효과적으로 감소시킬 수 있는가?
- RQ2형태학적으로 정보를 반영한 서브워드 분할 접근법은 데이터 기반 서브워드 방법 대비 WER와 형태학적 정확도 측면에서 어떻게 비교되는가?
- RQ3SG-WFST 기반 서브워드 모델링은 기준선 단어 수준 ASR 시스템 대비 WER를 얼마나 향상시킬 수 있는가?
- RQ4히우리스틱 후처리 분할은 SG-WFST 문법 규칙을 따르지 않는 예외적 어휘를 처리할 수 있는가?
- RQ5제안된 서브워드-ASR 시스템은 어원 복원 및 표기 변환과 같은 다른 NLP 작업에 대해 확장 가능하고 재사용 가능한가?
주요 결과
- 제안된 서브워드-ASR 시스템은 타밀어에서 WER 12.31%를 달성하여 기준선 단어 기반 ASR 시스템 대비 절대 감소율 12.39%를 기록하였다.
- 칸나다어에서는 WER 8.39%를 기록하여 기준선 단어 수준 ASR 시스템 대비 절대 개선율 13.56%를 달성하였다.
- OOV 비율은 타밀어에서 1.68%, 칸나다어에서 1.12%로 감소하였으며, 주로 테스트 세트 내 고유명사 및 희귀어 때문이었다.
- 서브워드 사전과 SG-WFST의 수작업 구성 덕분에 데이터 기반 접근법이 언어학적 일관성이 결여된 것과는 달리 형태학적으로 의미 있는 서브워드 단위를 확보하였다.
- 히우리스틱 분할 알고리즘이 SG-WFST 문법 규칙을 따르지 않는 예외적 어휘를 성공적으로 처리하였다.
- 문맥 마커를 사용한 결정론적 연결 및 후처리를 통해 서브워드 출력에서 유효한 어휘 시퀀스를 효과적으로 복원하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.