Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring the Novelty of Natural Language Text Using the Conjunctive Clauses of a Tsetlin Machine Text Classifier

Bimal Bhattarai, Ole‐Christoffer Granmo|arXiv (Cornell University)|2020. 11. 17.
Anomaly Detection Techniques and Applications참고 문헌 18인용 수 4
한 줄 요약

이 논문은 Tsetlin Machine(TM)의 결합 문장(conjunctive clauses)을 활용하여 개방형 텍스트 분류를 위한 새로운 해석 가능한 접근법을 제안한다. 입력 텍스트와 일치하는 문장의 수를 세어 신규성 점수를 산출함으로써, 기존 클래스와 새로운 클래스를 구분한다. 이 방법은 다섯 개의 데이터셋 중 세 개에서 일곱 개의 베이스라인을 능가하며, 예측 결과에 대한 투명하고 논리 기반의 설명을 제공한다.

ABSTRACT

Most supervised text classification approaches assume a closed world, counting on all classes being present in the data at training time. This assumption can lead to unpredictable behaviour during operation, whenever novel, previously unseen, classes appear. Although deep learning-based methods have recently been used for novelty detection, they are challenging to interpret due to their black-box nature. This paper addresses \emph{interpretable} open-world text classification, where the trained classifier must deal with novel classes during operation. To this end, we extend the recently introduced Tsetlin machine (TM) with a novelty scoring mechanism. The mechanism uses the conjunctive clauses of the TM to measure to what degree a text matches the classes covered by the training data. We demonstrate that the clauses provide a succinct interpretable description of known topics, and that our scoring mechanism makes it possible to discern novel topics from the known ones. Empirically, our TM-based approach outperforms seven other novelty detection schemes on three out of five datasets, and performs second and third best on the remaining, with the added benefit of an interpretable propositional logic-based representation.

연구 동기 및 목표

  • 감독 텍스트 분류에서 새로운 클래스가 존재할 경우 예측 불가능한 행동을 유도하는 닫힌 세계 가정의 한계를 해결하기 위해.
  • 추론 도중에 이전에 보지 못한 클래스를 식별할 수 있는 해석 가능한 새로운성 탐지 메커니즘을 개발하기 위해.
  • Tsetlin Machine의 문장 논리적 구조를 활용하여 텍스트 분류에서 의미 있고 인간이 읽을 수 있는 패턴 표현을 가능하게 하기 위해.
  • 딥 러닝 모델의 투명하지 않은 성질을 극복하면서도, 텍스트 내 새로운 주제를 견고하게 탐지할 수 있도록 해석 가능성 유지하기 위해.

제안 방법

  • 학습된 Tsetlin Machine의 결합 문장을 사용하여 기존 훈련 데이터에서 빈번하고 중요한 패턴을 표현한다.
  • 입력 텍스트에 의해 활성화된 문장의 수를 세어 신규성 점수를 계산한다.
  • 이 점수는 입력이 기존 클래스와 얼마나 잘 일치하는지를 나타내는 대체 지표가 되며, 낮은 점수일수록 더 높은 신규성으로 간주된다.
  • 신규성 점수에 임계값을 적용하여 입력을 기존 클래스 또는 새로운 클래스로 분류한다.
  • 더 높은 강건성을 확보하기 위해, 신규성 점수를 기반으로 두 번째 기계 학습 분류기를 훈련시는 방법을 사용한다.
  • 다양한 텍스트 데이터셋 다섯 개에서 TF-IDF 벡터화, 주성분 분석(PCA), 및 표준 전처리를 사용하여 프레임워크를 평가한다.

실험 결과

연구 질문

  • RQ1Tsetlin Machine의 결합 문장이 새로운 주제를 효과적으로 표현하여 새로운 주제 탐지가 가능할 수 있는가?
  • RQ2문장 기반의 신규성 점수 기반 메커니즘이 다중 클래스 텍스트 분류에서 기존의 이상치 탐지 및 군집 기반 방법과 비교해 어떻게 성능을 내는가?
  • RQ3Tsetlin Machine의 논리 기반 표현 방식이 제공하는 해석 가능성은 얼마나 새로운성 탐지의 신뢰도를 향상시키는가?
  • RQ4기존 클래스와 새로운 클래스 간 어휘가 겹치는 데이터셋에서도 제안된 방법이 높은 성능을 유지할 수 있는가?

주요 결과

  • TM 기반 프레임워크는 20 Newsgroup 및 BBC Sports 데이터셋에서 각각 82.50%와 89.47%의 정확도로 모든 다른 방법보다 높은 성능을 보였다.
  • CMU Movie 및 Web of Science 데이터셋에서는 각각 두 번째 및 세 번째로 높은 성능을 기록했으며, 정확도는 68.15%와 70.37%였다. 이는 다층 퍼셉트론(MLP)을 제외한 모든 방법보다 높은 성능이었다.
  • One-class SVM, Isolation Forest, K-Means 군집화와 같은 군집 및 이상치 기반 베이스라인 방법들보다 다섯 개의 데이터셋 중 세 개에서 성능이 뛰어났다.
  • 기존 클래스와 새로운 클래스 간 의미적 구분이 뚜렷한 데이터셋에서는 프레임워크가 뛰어난 성능을 보였으며, 이는 신규성 점수가 잘 분리되어 있음을 의미한다.
  • Web of Science 데이터셋에서는 기존 클래스와 새로운 클래스가 많은 공통 단어를 공유하여 거리 기반 방법에 밀렸으며, 이는 어휘 겹침 상황에서의 도전 과제를 보여준다.
  • 문장 활성화 수를 신규성 점수로 사용함으로써, 도식 3에서 볼 수 있듯이 기존 샘플과 새로운 샘플 간에 명확한 군집화가 이루어졌으며, 이는 본 방법의 분류 능력에 대한 지원이 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.