Skip to main content
QUICK REVIEW

[논문 리뷰] NUBOT: Embedded Knowledge Graph With RASA Framework for Generating Semantic Intents Responses in Roman Urdu

Johar Shabbir, Muhammad Umair Arshad|arXiv (Cornell University)|2021. 02. 20.
Topic Modeling참고 문헌 32인용 수 6
한 줄 요약

이 논문은 의도 분류와 응답 생성을 향상시키기 위해 지식 그래프를 RASA NLU 및 대화 관리 파이프라인에 통합한 로마어드우어 챗봇 프레임워크인 NUBOT을 제안한다. LDA 기반 의도 클러스터링과 의미 지식 임bedding을 활용하여, 이 시스템은 의도 분류에서 96.7%의 F1 스코어와 응답 생성에서 89.1%의 신뢰도를 달성하였으며, 자원이 부족한 언어 환경에서 기존 RASA 및 기타 시스템보다 뚜렷하게 뛰어난 성능을 보였다.

ABSTRACT

The understanding of the human language is quantified by identifying intents and entities. Even though classification methods that rely on labeled information are often used for the comprehension of language understanding, it is incredibly time consuming and tedious process to generate high propensity supervised datasets. In this paper, we present the generation of accurate intents for the corresponding Roman Urdu unstructured data and integrate this corpus in RASA NLU module for intent classification. We embed knowledge graph with RASA Framework to maintain the dialog history for semantic based natural language mechanism for chatbot communication. We compare results of our work with existing linguistic systems combined with semantic technologies. Minimum accuracy of intents generation is 64 percent of confidence and in the response generation part minimum accuracy is 82.1 percent and maximum accuracy gain is 96.7 percent. All the scores refers to log precision, recall, and f1 measure for each intents once summarized for all. Furthermore, it creates a confusion matrix represents that which intents are ambiguously recognized by approach.

연구 동기 및 목표

  • 자원이 부족한 언어, 예를 들어 로마어드우어와 같은 언어의 자연어 처리(NLP) 응용 분야에서 레이블이 부여된 학습 데이터의 부족 문제를 해결하기 위해.
  • 의미 기반 기술과 자동화된 데이터 처리를 활용하여 로마어드우어에서 의도 분류 및 응답 생성 정확도를 향상시키기 위해.
  • 인공지능과 딥러닝을 활용한 자동 의도 생성을 통해 학습 데이터셋을 만드는 데 필요한 수동 작업을 줄이기 위해.
  • 대화 기록과 맥락을 유지하기 위해 지식 그래프를 통합하여 대화 관리 성능을 향상시키기 위해.
  • 자원이 제한된 언어에서 사용 가능한 의미 기반 챗봇 배포를 위한 확장 가능하고 도메인에 유연한 프레임워크를 개발하기 위해.

제안 방법

  • 비정형 로마어드우어 쿼리를 주제 모델링 기반으로 의미 있는 의도 클러스터로 분류하기 위해 LDA(Latent Dirichlet Allocation)를 활용하였다.
  • LDA 적용 이전에 불용어 제거 및 짧거나 긴 쿼리 필터링 등의 자연어 처리(NLP) 전처리 단계를 수행하였다.
  • 수신된 의도 클러스터를 자동 의도 분류를 위한 RASA NLU 파이프라인에 통합하였다.
  • 대화 기록과 맥락을 유지하기 위해 도메인 특화 지식 그래프를 RASA 대화 관리 모델(DMM)에 통합하였다.
  • RASA의 스토리 기반 대화 학습 및 응답 생성 프레임워크를 사용하여 시스템을 학습하고 평가하였다.
  • 의도 및 응답 생성 작업 전반에 걸쳐 정밀도, 재현율, F1 스코어 및 신뢰도 스코어를 사용하여 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1정교한 수동 주석 없이 LDA 기반 주제 모델링이 자원이 부족한 로마어드우어 텍스트의 의도 생성을 효과적으로 자동화할 수 있는가?
  • RQ2RASA DMM에 지식 그래프를 통합함으로써 로마어드우어 챗봇의 맥락 인식 응답 생성 성능은 어떻게 향상되는가?
  • RQ3의도 및 응답 분류의 F1 스코어와 신뢰도 측면에서 제안된 NUBOT 프레임워크는 기존 RASA 및 기타 시스템 대비 어떤 성능 향상을 보이는가?
  • RQ4의미 지식 임bedding은 로마어드우어 문장에서 의도 인식의 모호성을 어느 정도 감소시킬 수 있는가?
  • RQ5시스템은 범위를 초월한 쿼리를 어떻게 견고하게 처리하면서도 높은 응답 신뢰도를 유지할 수 있는가?

주요 결과

  • NUBOT 프레임워크는 의도 분류에서 최대 96.7%의 F1 스코어를 달성하였으며, 기준 RASA 프레임워크(82.5%) 및 TCNGD(50.2%)보다 뚜렷하게 뛰어난 성능을 보였다.
  • 의도 생성의 신뢰도는 85%에 달했으며, 130개의 고유 의도 샘플 전반에서 최대 96.7%의 정점 신뢰도를 기록하였다.
  • 응답 생성은 최소 F1 스코어 82.1%와 최대 89.1%의 신뢰도를 기록하여, 응답 선택의 높은 신뢰성을 나타내었다.
  • 혼동 행렬 분석 결과, 의도 예측의 정밀도는 85%였고, F1 스코어는 96.7%로 강력한 분류 성능을 입증하였다.
  • K=10 또는 20일 때 LDA가 최적의 클러스터 품질을 보였으며, 명확한 주제 레이블과 최소한의 겹침을 보여, 효과적인 의도 레이블링을 가능하게 하였다.
  • 지식 그래프 통합으로 맥락 유지 능력이 향상되어, 의미적으로 일관되고 기록 기반의 응답 생성이 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.