Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarking Natural Language Understanding Services for building Conversational Agents

Xingkun Liu, Arash Eshghi|arXiv (Cornell University)|2019. 03. 13.
Topic Modeling참고 문헌 2인용 수 88
한 줄 요약

논문은 25k 음성/발화, 21 도메인 데이터셋에서 네 가지 NLU 서비스(Rasa, Dialogflow, LUIS, Watson)를 대규모 크로스 플랫폼으로 평가하고, 64개 의도와 54개 엔티티 유형으로 주석된 데이터에서 의도 및 엔티티 인식 성능을 비교합니다. Watson은 의도에 우수하나 엔티티 인식에서 저조한 반면, Dialogflow, LUIS, Rasa는 보다 균형 잡힌 결과를 보입니다.

ABSTRACT

We have recently seen the emergence of several publicly available Natural Language Understanding (NLU) toolkits, which map user utterances to structured, but more abstract, Dialogue Act (DA) or Intent specifications, while making this process accessible to the lay developer. In this paper, we present the first wide coverage evaluation and comparison of some of the most popular NLU services, on a large, multi-domain (21 domains) dataset of 25K user utterances that we have collected and annotated with Intent and Entity Type specifications and which will be released as part of this submission. The results show that on Intent classification Watson significantly outperforms the other platforms, namely, Dialogflow, LUIS and Rasa; though these also perform well. Interestingly, on Entity Type recognition, Watson performs significantly worse due to its low Precision. Again, Dialogflow, LUIS and Rasa perform well on this task.

연구 동기 및 목표

  • 대화형 에이전트를 구축하기 위해 인기 있는 NLU 서비스에 대한 폭넓고 편향 없는 평가를 제공한다.
  • 다수의 도메인에 걸친 벤치마킹 가능하게 대규모 주석 데이터셋을 공개한다.
  • 의도 분류와 명명된 엔터티 인식(NER)에 대한 플랫폼 성능을 비교한다.
  • 각 플랫폼의 강점과 약점을 식별하여 개발자가 도구를 선택하는 데 도움을 준다.

제안 방법

  • 21개 도메인에 걸쳐 64개 의도와 54개 엔티티 유형으로 주석된 25,716 음화(utterances)로 대규모 다도메인 데이터셋을 구성한다.
  • Amazon Mechanical Turk를 통한 크라우드소싱과 주석 불일치의 수동 수정으로 데이터 품질을 보장한다.
  • 플랫폼별 학습 구성으로 10-fold 교차 검증을 통해 Rasa, Dialogflow, LUIS, Watson의 네 가지 NLU 서비스를 평가한다.
  • 의도와 엔티티에 대해 마이크로 평균 정밀도, 재현율, F1을 사용하고, 유의성 평가를 위해 쌍별 t-테스트를 수행한다.

실험 결과

연구 질문

  • RQ1네 가지 NLU 서비스가 의도 유형 작업과 엔티티 유형 작업을 결합한 overall F1에서 어떻게 비교되는가?
  • RQ2의도 분류와 엔티티 유형 인식에 대해 각 서비스의 정밀도, 재현율, F1은 어떻게 다른가?
  • RQ3Dialogflow, LUIS, Rasa, Watson 간 의도 및 엔티티에 대한 성능 차이는 통계적으로 어떤 차이가 있는가?
  • RQ4맥락이나 주석 뉘앙스가 플랫폼 성능에 영향을 미치는가, 특히 엔티티 인식에서?
  • RQ5데이터셋의 특징(21 도메인, 64 의도, 54 엔티티)이 각 서비스의 강점/제약을 어떻게 나타내는가?

주요 결과

  • Watson은 네 플랫폼 중 의도 정밀도/재현율/F1에서 최고치를 달성하지만( F1 = 0.882 ), 높은 거짓 양성으로 인해 엔티티 F1은 상당히 낮다.
  • Dialogflow, LUIS, Rasa는 전반적으로 유사한 성능을 보이며 의도 F1에서 세 서비스 간에 유의미한 차이가 없다.
  • Luis가 네 서비스 중 최상위 엔티티 F1 점수(0.777)를 달성한다.
  • Watson의 엔티티 F1은(0.657)로 더 낮고 큰 효과 크기를 보이며, 정밀도 저하에 의해 주도된다.
  • 전반적으로 의도와 엔티티를 모두 묶었을 때 명확한 승자가 없으며, Watson은 의도 성능은 강하지만 엔티티 성능은 약한 트레이드를 한다.
  • 본 카메라 친화 버전에서 Watson의 Contextual Entity 기능에 대한 평가가 수행되지 않았음을 연구는 지적한다.
  • 저자들은 공개용으로 데이터셋과 툴킷을 제공하여 지속적인 벤치마킹을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.