Skip to main content
QUICK REVIEW

[論文レビュー] Mere account mein kitna balance hai? -- On building voice enabled Banking Services for Multilingual Communities

Akshat Gupta, Sai Krishna Rallabandi|arXiv (Cornell University)|Oct 9, 2020
Linguistic Variation and Morphology参考文献 1被引用数 6
ひとこと要約

本稿では、音声電話ユニットとナイーブベイズ分類器を用いて、混合言語(ヒングリッシュ)音声におけるユーザーの意図を認識することで、多言語コミュニティ向けの音声対応バンキングシステムを提案する。小さなデータセットでも、ユニグラム、ビグラム、トライグラムモデルを絶対的ディスcountとともに組み合わせることで83%の正確性を達成し、リソースが限られた環境における多言語音声ベースのバンキングの実現可能性を示している。

ABSTRACT

Tremendous progress in speech and language processing has brought language technologies closer to daily human life. Voice technology has the potential to act as a horizontal enabling layer across all aspects of digitization. It is especially beneficial to rural communities in scenarios like a pandemic. In this work we present our initial exploratory work towards one such direction -- building voice enabled banking services for multilingual societies. Speech interaction for typical banking transactions in multilingual communities involves the presence of filled pauses and is characterized by Code Mixing. Code Mixing is a phenomenon where lexical items from one language are embedded in the utterance of another. Therefore speech systems deployed for banking applications should be able to process such content. In our work we investigate various training strategies for building speech based intent recognition systems. We present our results using a Naive Bayes classifier on approximate acoustic phone units using the Allosaurus library.

研究の動機と目的

  • 多言語コミュニティ、特に言語多様性と低いデジタルリテラシーが課題である地方インドを対象とした音声対応バンキングサービスの開発。
  • 日常的なバンキング対話で一般的なコードミックスドスピーチ(特にヒングリッシュ)の言語的複雑さに対処すること。
  • 複数のインド語から得た限られたリソースの少ない音声データを用いた意図分類の有効なトレーニング戦略の調査。
  • 音声翻訳により1つの言語の発話から別の言語に変換することで、将来の半教師付き学習を可能にする擬似並列多言語データセットの作成。
  • リソースが限られた多言語音声において、近似音声電話ユニットを用いたN-gramモデルの意図認識への適用に関する評価。

提案手法

  • 11人の被験者を対象に、ダミーのバンキングアプリを用いてヒングリッシュで100件以上のタスクベースの対話を収集。5つのバンキング意図をカバー。
  • ヒンディー語、マラーティー語、グジャラート語、パンジャブ語、テルグ語、ボージュプーリー語の6つのインド語の音声データを取得。
  • 下流の分類のため、生の音声をAllosaurusライブラリを用いて近似音声電話ユニットに変換。
  • N-gram言語モデリングに、add-1スムージングと絶対的ディスカウントを併用したナイーブベイズ分類器を適用。
  • 5分割交差検証を実施。各フォールドで2件の発話をテスト用に除外。『お金を引き出す』と『お金を預ける』の2つの意図はサンプル数が1件のみのため除外。
  • 絶対的ディスカウントによる最適なデルタ値を用いて、ユニグラム、ビグラム、トライグラムモデルを統合し、性能向上を図った。

実験結果

リサーチクエスチョン

  • RQ1コードミックスドで多言語の発話が一般的なインドのバンキング状況において、音声ベースの意図認識システムは効果的に機能するか?
  • RQ2N-gramの順序(ユニグラム、ビグラム、トライグラム)が、限られたリソースの少ない音声データにおける意図分類の正確性に与える影響は何か?
  • RQ3絶対的ディスカウントは、add-1スムージングと比較して、データが少ない状況下で意図分類の性能を向上させるか?
  • RQ4ユニグラム、ビグラム、トライグラムの特徴を統合したハイブリッドN-gramモデルは、個別のモデルよりも高い正確性を達成できるか?
  • RQ5音声翻訳による生成された擬似並列データは、将来的な多言語音声アプリケーションにおける半教師付き学習を支援できるか?

主な発見

  • add-1スムージングを用いたユニグラムモデルが、個別のN-gramモデルの中で最も高い正確性(56%)を達成したが、トライグラムモデルの性能は著しく低下し17%にまで低下した。
  • 絶対的ディスカウントは、すべてのN-gramモデルでテスト正確性を向上させ、デルタ値が5のユニグラムモデルでは69%の正確性に到達した。
  • 最適なデルタ値(ユニグラム:5、ビグラム:1、トライグラム:1)を用いた統合モデルが、83%の正確性という最高の性能を達成した。
  • N-gram順序の増加に伴う性能低下は、初期の探索的データセットにおけるデータスパarsity(希少性)に起因すると考えられ、より大きなデータセットではN-gram分布がより均一になる可能性がある。
  • 同じ発話者からの擬似並列データの使用は、将来的な多言語音声アプリケーションにおける半教師付き学習の可能性を秘めている。
  • 結果から、ナイーブベイズを用いた音声電話レベルのN-gramモデリングが、リソースが限られた多言語バンキング状況における意図認識に実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。