Skip to main content
QUICK REVIEW

[논문 리뷰] DCDistance: A Supervised Text Document Feature extraction based on class labels

Charles Henrique Porto Ferreira, Débora Maria Rossi de Medeiros|arXiv (Cornell University)|2018. 01. 14.
Text and Document Classification Technologies참고 문헌 11인용 수 10
한 줄 요약

DCDistance는 각 문서를 클래스 대표 벡터까지의 거리로 구성된 k차원 벡터로 표현함으로써 차원을 감소시키는 지도 학습 기반 텍스트 특징 추출 방법으로, 기존의 전통적 및 최신 기법들과 비교해 기준 데이터셋에서 분류 정확도를 향상시키면서도 99% 이상의 특징 감소를 달성한다.

ABSTRACT

Text Mining is a field that aims at extracting information from textual data. One of the challenges of such field of study comes from the pre-processing stage in which a vector (and structured) representation should be extracted from unstructured data. The common extraction creates large and sparse vectors representing the importance of each term to a document. As such, this usually leads to the curse-of-dimensionality that plagues most machine learning algorithms. To cope with this issue, in this paper we propose a new supervised feature extraction and reduction algorithm, named DCDistance, that creates features based on the distance between a document to a representative of each class label. As such, the proposed technique can reduce the features set in more than 99% of the original set. Additionally, this algorithm was also capable of improving the classification accuracy over a set of benchmark datasets when compared to traditional and state-of-the-art features selection algorithms.

연구 동기 및 목표

  • 높은 차원성과 희박성의 백오프워즈 표현 방식을 가진 텍스트 분류 문제에서 차원의 저주를 해결하기 위해 고차원적이고 희박한 백오프워즈 표현 방식의 차원을 감소시키는 것.
  • 기존의 텍스트 마이닝 전처리 과정에서 특징 선택 기법의 높은 계산 비용과 파rameter 민감성 문제를 해결하기 위한 것.
  • 클래스 레이블 정보를 활용하여 압축되고 정보적인 표현을 생성하는 지도 학습 기반의 특징 추출 기법을 개발하는 것.
  • 반복적 또는 히우리스틱 기반의 특징 순위 매기기 없이도 극도로 높은 차원 감소와 함께 분류 성능 향상을 달성하는 것.
  • 거리 기반 특징을 클래스별 의미적 내용과 연결함으로써 설명 가능한 표현을 가능하게 하는 것.

제안 방법

  • 각 클래스에 속하는 모든 학습 문서 벡터의 합을 통해 각 클래스의 대표 벡터를 구성한다.
  • 각 테스트 문서에 대해 선택된 거리 측정법(예: 코사인 또는 L2)을 사용해 각 클래스 대표 벡터까지의 거리를 계산한다.
  • 각 문서에 대해 k차원의 특징 벡터를 구성한다. 여기서 k는 서로 다른 클래스 레이블의 수이다.
  • 결과로 도출된 거리 벡터를 최종 입력 표현으로 사용하여 후속 분류 모델에 입력한다.
  • 문서 수에 비례하는 선형 시간 복잡도를 달성하기 위해 효율적인 데이터 구조를 활용한다.
  • 클래스 레이블 정보를 직접 특징 구성에 통합함으로써 방법이 본질적으로 지도 학습임을 보장한다.

실험 결과

연구 질문

  • RQ1거리 기반 특징 추출 기법이 99% 이상의 차원 감소를 달성하면서도 분류 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ2DCDistance의 성능은 기존의 전통적 및 최신 기술적 특징 선택 기법과 비교해 정확도 및 감소율 측면에서 어떻게 다른가?
  • RQ3유도된 거리 기반 특징들이 클래스 주제와 의미 있는 의미 관계를 얼마나 잘 반영하는가?
  • RQ4제안된 방법이 전처리 시간을 줄이고 특징 수의 하이퍼파rameter 튜닝이 필요 없도록 할 수 있는가?
  • RQ5대표 벡터와 그에 연관된 고가중치 단어들이 클래스 의미와 얼마나 해석 가능한가?

주요 결과

  • DCDistance는 평가된 모든 데이터셋에서 원래의 특징 집합을 99% 이상 감소시켜 극도로 높은 차원 감소를 달성한다.
  • 이 방법은 기존의 백오프워즈 표현 방식과 최신 기술적 특징 선택 기법과 비교해 여러 기준 데이터셋(예: 20 Newsgroups, Genes, Cluster)에서 분류 정확도를 향상시켰다.
  • 클래스 대표 벡터의 상위 단어들이 각각의 클래스 주제와 강한 의미적 관련성을 보이며, 의미 있는 특징 학습이 이루어졌음을 시사한다.
  • 알고리즘은 선형 시간 복잡도를 달성해 대규모 텍스트 데이터셋에 대해 확장 가능하고 효율적인 성능을 보였다.
  • 거리 기반 특징은 특징 구성 과정에서 클래스 수준의 정보를 통합함으로써 뛰어난 일반화 성능을 보였다.
  • 모든 테스트 데이터셋에서 네 가지의 경쟁 기법과 원본 특징 집합보다 정확도와 감소율 측면에서 모두 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.