Skip to main content
QUICK REVIEW

[논문 리뷰] Text Classification Using Label Names Only: A Language Model Self-Training Approach

Meng Yu, Yunyi Zhang|arXiv (Cornell University)|2020. 10. 14.
Topic Modeling참고 문헌 45인용 수 10
한 줄 요약

이 논문은 레이블 이름(예: '스포츠', '정치')만을 사용하여 순수하게 비라벨 데이터에서 학습하는 약한 지도 학습 텍스트 분류 모델인 LOTClass를 제안한다. 사전 훈련된 언어 모델을 활용해 카테고리를 나타내는 단어를 식별하고, 문맥화된 단어 수준의 카테고리 예측을 통해 자기 훈련(self-training)을 수행함으로써, AG News 및 IMDB와 같은 벤치마크 데이터셋에서 라벨된 문서를 전혀 사용하지 않고도 약 90%의 정확도를 달성한다. 이는 기존의 약한 지도 학습 방법을 능가하며, 지도 학습 기반 기준과도 맞먹는 성능을 보인다.

ABSTRACT

Current text classification methods typically require a good number of human-labeled documents as training data, which can be costly and difficult to obtain in real applications. Humans can perform classification without seeing any labeled examples but only based on a small set of words describing the categories to be classified. In this paper, we explore the potential of only using the label name of each class to train classification models on unlabeled data, without using any labeled documents. We use pre-trained neural language models both as general linguistic knowledge sources for category understanding and as representation learning models for document classification. Our method (1) associates semantically related words with the label names, (2) finds category-indicative words and trains the model to predict their implied categories, and (3) generalizes the model via self-training. We show that our model achieves around 90% accuracy on four benchmark datasets including topic and sentiment classification without using any labeled documents but learning from unlabeled data supervised by at most 3 words (1 in most cases) per class as the label name.

연구 동기 및 목표

  • 텍스트 분류에서 인간 레이블링 데이터의 높은 비용 문제를 해결하기 위해, 레이블 이름만으로 모델이 학습할 수 있도록 하는 것.
  • 사전 훈련된 언어 모델이 레이블 이름에서 유도된 단어 수준의 지도 정보만으로 효과적인 분류를 수행할 수 있는지 탐색하는 것.
  • 단어 수준의 카테고리 이해를 문서 수준의 분류로 일반화할 수 있는 자기 훈련 프레임워크를 개발하는 것.
  • 원거리 지도 학습 또는 데이터 증강 기법에 의존하는 기존의 약한 지도 학습 방법을 능가하는 것.

제안 방법

  • 사전 훈련된 언어 모델을 사용하여 레이블 이름과 의미적으로 관련된 단어들을 식별함으로써 각 클래스별 카테고리 어휘를 구성한다.
  • 마스크된 카테고리 예측(MCP) 작업을 통해 언어 모델을 훈련시어, 단어의 문맥에 기반해 암시된 카테고리를 예측하도록 한다.
  • 훈련된 모델을 사용하여 비라벨 문서에서 고신뢰도 예측을 생성하고, 이를 자기 훈련에 활용한다.
  • 자기 훈련 과정에서 예측의 타겟 분포를 반복적으로 개선하여 일반화 능력을 향상시킨다.
  • 최근 버전의 모델이 비라벨 데이터에서 생성한 예측을 사용하여 모델를 업데이트하는 자기 훈련 목표를 적용한다.
  • 사전 훈련된 언어 모델의 문맥화된 표현을 활용하여 정확한 분류를 위해 장거리 의미적 종속성을 포착한다.

실험 결과

연구 질문

  • RQ1레이블 이름만 있고 라벨된 문서가 전혀 없는 조건에서 텍스트 분류 모델이 높은 정확도를 달성할 수 있는가?
  • RQ2사전 훈련된 언어 모델이 레이블 이름에서 파생된 단어 수준의 지도 정보만으로 카테고리 간의 차이를 효과적으로 학습할 수 있는가?
  • RQ3레이블 이름만이 지도 정보로 제공될 때, 비라벨 데이터에서 자기 훈련이 성능 향상에 크게 기여하는가?
  • RQ4저자원 환경에서 제안된 방법이 기존의 약한 지도 학습 및 준지도 학습 접근법과 비교해 어떻게 성능을 내는가?

주요 결과

  • LOTClass는 AG News, DBPedia, IMDB, Amazon의 네 가지 벤치마크 데이터셋에서 라벨된 문서를 전혀 사용하지 않고도 약 90%의 정확도를 달성한다.
  • 원거리 지도 학습 또는 데이터 증강 기법에 의존하는 기존의 약한 지도 학습 방법보다 성능이 뛰어나다.
  • 자기 훈련이 성능 향상에 크게 기여하며, 모델이 반복적으로 예측을 개선하면서 정확도가 점진적으로 증가한다.
  • 간단한 레이블 이름 매칭으로 미세조정한 BERT를 뛰어넘는 성능을 보이며, 문맥화된 단어 수준의 지도 학습이 반드시 필요함을 입증한다.
  • 마스크된 카테고리 예측을 통해 카테고리를 나타내는 단어를 학습한 후, 문서 수준의 분류로의 일반화 능력이 뛰어나다.
  • 레이블 이름으로 사용되는 클래스당 단 한 개의 단어만으로도 성능이 유지되며, 이는 레이블 이름이 효과적인 지도 정보임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.