[論文レビュー] NUBOT: Embedded Knowledge Graph With RASA Framework for Generating Semantic Intents Responses in Roman Urdu
本稿では、RASA NLUおよび対話管理パイプラインに知識グラフを統合することで、意図分類および応答生成を向上させる、ローマ・ウルドゥー語用チャットボットフレームワークNUBOTを提案する。LDAに基づく意図クラスタリングおよび意味的知識埋め込みを活用することで、システムは意図分類で96.7%のF1スコア、応答生成で89.1%の信頼度を達成し、低リソース言語環境下でベースラインRASAおよび既存システムを著しく上回る性能を発揮した。
The understanding of the human language is quantified by identifying intents and entities. Even though classification methods that rely on labeled information are often used for the comprehension of language understanding, it is incredibly time consuming and tedious process to generate high propensity supervised datasets. In this paper, we present the generation of accurate intents for the corresponding Roman Urdu unstructured data and integrate this corpus in RASA NLU module for intent classification. We embed knowledge graph with RASA Framework to maintain the dialog history for semantic based natural language mechanism for chatbot communication. We compare results of our work with existing linguistic systems combined with semantic technologies. Minimum accuracy of intents generation is 64 percent of confidence and in the response generation part minimum accuracy is 82.1 percent and maximum accuracy gain is 96.7 percent. All the scores refers to log precision, recall, and f1 measure for each intents once summarized for all. Furthermore, it creates a confusion matrix represents that which intents are ambiguously recognized by approach.
研究の動機と目的
- 自然言語処理応用におけるローマ・ウルドゥー語のような低リソース言語のラベル付き学習データの不足を解決すること。
- 意味的技術および自動データ処理を用いて、ローマ・ウルドゥー語における意図分類および応答生成の正確性を向上させること。
- AIおよびディープラーニングを用いた自動意図生成により、学習データセット作成における人的作業を削減すること。
- 対話履歴と文脈を保持する知識グラフの埋め込みにより、対話管理を強化すること。
- リソース制限のある言語向けにスケーラブルでドメインに柔軟な意味的チャットボットの展開フレームワークを構築すること。
提案手法
- 主題モデルとしてのLDA(潜在ディリクレ配分)を用い、非構造化ローマ・ウルドゥー語クエリをトピックモデリングに基づいて意味的な意図クラスタにグループ化した。
- LDA適用の前段階として、ストップワード除去および短い/長いクエリのフィルタリングを含む自然言語処理の前処理手順を実施した。
- 得られた意図クラスタをRASA NLUパイプラインに統合し、自動的意図分類を実現した。
- ドメイン固有の知識グラフをRASA対話管理モデル(DMM)に埋め込み、会話履歴と文脈を維持した。
- RASAのストーリー基盤対話学習および応答生成フレームワークを用いて、システムを訓練および評価した。
- 意図および応答生成タスクの両方において、精度、再現率、F1スコア、信頼度スコアを用いて性能を評価した。
実験結果
リサーチクエスチョン
- RQ1豊富な手動アノテーションを伴わずに、LDAベースのトピックモデリングが低リソースのローマ・ウルドゥー語テキストの意図生成を効果的に自動化できるか?
- RQ2RASA DMMに知識グラフを統合することで、ローマ・ウルドゥー語チャットボットにおける文脈に配慮した応答生成がどの程度向上するか?
- RQ3提案されたNUBOTフレームワークは、ベースラインRASAおよび既存システムと比較して、意図および応答分類のF1スコアおよび信頼度でどの程度の性能向上を達成するか?
- RQ4意味的知識埋め込みは、ローマ・ウルドゥー語発話における曖昧さをどの程度低減できるか?
- RQ5フレームワークは、スコープ外のクエリに対しても、高い応答信頼度を維持しながら耐障害的に処理できるか?
主な発見
- NUBOTフレームワークは、意図分類で最大96.7%のF1スコアを達成し、ベースラインRASA(82.5%)およびTCNGD(50.2%)を著しく上回った。
- 意図生成の信頼度は85%に達し、130件の固有意図サンプル全体でピーク信頼度96.7%を記録した。
- 応答生成は最小F1スコア82.1%、最大信頼度89.1%を達成し、応答選択の信頼性が非常に高いことを示した。
- 混同行列の結果、意図予測の精度は85%、F1スコアは96.7%であり、優れた識別性能を示した。
- K=10または20のLDAは最適なクラスタ品質をもたらし、明確なトピックラベルと最小限の重複を実現し、効果的な意図ラベリングを可能にした。
- 知識グラフの統合により、文脈保持が向上し、モデルは文脈に配慮した意味的に整合性のある応答を生成できるようになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。