[논문 리뷰] Mere account mein kitna balance hai? -- On building voice enabled Banking Services for Multilingual Communities
이 논문은 음성 기반 뱅킹 시스템을 다국어 공동체에 적용하기 위해 청각적 음소 단위와 나이브 베이즈 분류기를 사용하여 혼합 언어(Hinglish) 음성에서 사용자 의도를 인식하는 방법을 제안한다. 작은 데이터셋에도 불구하고, 유니그램, 바이그램, 트리그램 모델을 절대 할인 기법과 조합하여 83%의 정확도를 달성하였으며, 자원이 제한된 환경에서의 다국어 음성 기반 뱅킹의 실현 가능성을 입증한다.
Tremendous progress in speech and language processing has brought language technologies closer to daily human life. Voice technology has the potential to act as a horizontal enabling layer across all aspects of digitization. It is especially beneficial to rural communities in scenarios like a pandemic. In this work we present our initial exploratory work towards one such direction -- building voice enabled banking services for multilingual societies. Speech interaction for typical banking transactions in multilingual communities involves the presence of filled pauses and is characterized by Code Mixing. Code Mixing is a phenomenon where lexical items from one language are embedded in the utterance of another. Therefore speech systems deployed for banking applications should be able to process such content. In our work we investigate various training strategies for building speech based intent recognition systems. We present our results using a Naive Bayes classifier on approximate acoustic phone units using the Allosaurus library.
연구 동기 및 목표
- 농촌 인도와 같은 언어 다양성과 낮은 디지털 문해력이 문제인 다국어 공동체를 위한 음성 기반 뱅킹 서비스 개발.
- 비공식 뱅킹 상호작용에서 흔한 혼합 언어인 Hinglish과 같은 언어적 복잡성을 다루기.
- 여러 인도어 언어에서 수집한 제한된 자원 기반 음성 데이터를 활용한 의도 분류에 효과적인 학습 전략 탐색.
- 음성 번역을 통한 의사 평행 다국어 데이터셋 구축으로 향후 준지도 학습을 가능하게 하기.
- 자원이 제한된 다국어 음성 환경에서 의도 인식에 대해 약한 청각적 음소 단위를 기반으로 한 N-그램 모델의 성능 평가.
제안 방법
- 11명의 참가자로부터 Hinglish로 100개 이상의 작업 기반 대화를 수집하여, 다섯 가지 뱅킹 의도를 다루는 드래그 앱을 사용.
- 힌두어, 마라티어, 구자라트어, 펀자브어, 텔루구어, 보지푸리어 등 6개의 인도어 언어에서 음성 데이터 확보.
- 후속 분류를 위해 원시 오디오를 Allosaurus 라이브러리를 사용하여 약한 청각적 음소 단위로 변환.
- N-그램 언어 모델링을 위해 add-1 스무딩과 절대 할인 기법을 적용한 나이브 베이즈 분류기 사용.
- 5개의 교차 검증을 수행하며, 각 폴드에서 테스트용으로 두 개의 문장을 제외함. '돈 인출'과 '예금' 의도는 단일 샘플 크기로 인해 제외.
- 절대 할인 기법으로 유도된 최적의 델타 값(5, 1, 1)을 사용하여 유니그램, 바이그램, 트리그램 모델을 융합하여 성능 향상.
실험 결과
연구 질문
- RQ1자원이 제한된 인도 뱅킹 환경에서 흔한 혼합 언어 음성, 특히 Hinglish를 효과적으로 처리할 수 있는 음성 기반 의도 인식 시스템은 가능한가?
- RQ2N-그램 모델의 순서(유니그램, 바이그램, 트리그램)가 제한된 자원 기반 음성 데이터에서 의도 분류 정확도에 어떤 영향을 미치는가?
- RQ3절대 할인 기법이 자원이 적은 환경에서 add-1 스무딩보다 의도 분류 성능을 향상시키는가?
- RQ4유니그램, 바이그램, 트리그램 특징를 융합한 하이브리드 N-그램 모델이 개별 모델보다 더 높은 정확도를 달성할 수 있는가?
- RQ5청각 번역을 통해 생성된 의사 평행 데이터는 향후 다국어 음성 애플리케이션의 준지도 학습을 지원할 수 있는가?
주요 결과
- add-1 스무딩을 사용한 유니그램 모델이 개별 N-그램 모델 중 가장 높은 정확도 56%를 기록했으며, 트리그램 모델은 정확도가 급격히 떨어져 17%에 그쳤다.
- 절대 할인 기법은 모든 N-그램 모델에서 테스트 정확도를 향상시켰으며, 유니그램 모델은 델타 값 5를 사용해 69%의 정확도를 달성했다.
- 최적의 델타 값(유니그램: 5, 바이그램: 1, 트리그램: 1)을 사용한 통합 모델이 가장 뛰어난 성능을 보이며 83%의 정확도를 기록했다.
- N-그램 순서가 증가할수록 성능 저하가 발생한 것은 初기 탐색 데이터셋의 데이터 희소성 때문이며, 더 큰 데이터셋은 균일한 N-그램 분포를 제공할 수 있음을 시사한다.
- 동일한 참가자로부터 생성된 의사 평행 데이터는 향후 다국어 음성 애플리케이션에서 준지도 학습을 위한 잠재적 기반을 제공한다.
- 청각적 음소 수준의 N-그램 모델링과 나이브 베이즈 분류기의 조합은 자원이 제한된 다국어 뱅킹 환경에서의 의도 인식에 실현 가능하다는 결론을 도출했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.