Skip to main content
QUICK REVIEW

[논문 리뷰] X-Class: Text Classification with Extremely Weak Supervision

Zihan Wang, Dheeraj Mekala|arXiv (Cornell University)|2020. 10. 24.
Topic Modeling참고 문헌 19인용 수 7
한 줄 요약

X-Class는 클래스 이름만을 supervision으로 사용하는 텍스트 분류를 위한 새로운 프레임워크를 제안한다. BERT 기반의 적응형 표현과 클러스터링을 활용해 고품질의 가짜 레이블 트레이닝 데이터를 생성하며, 7개의 벤치마크 데이터셋에서 최신 기술을 초월하는 성능을 달성한다. 시드어(시드 단어)나 레이블된 예제가 전혀 필요 없음에도 불구하고, 시드 기반의 약한 지도 학습 방법보다 뛰어난 성능을 보인다.

ABSTRACT

In this paper, we explore text classification with extremely weak supervision, i.e., only relying on the surface text of class names. This is a more challenging setting than the seed-driven weak supervision, which allows a few seed words per class. We opt to attack this problem from a representation learning perspective -- ideal document representations should lead to nearly the same results between clustering and the desired classification. In particular, one can classify the same corpus differently (e.g., based on topics and locations), so document representations should be adaptive to the given class names. We propose a novel framework X-Class to realize the adaptive representations. Specifically, we first estimate class representations by incrementally adding the most similar word to each class until inconsistency arises. Following a tailored mixture of class attention mechanisms, we obtain the document representation via a weighted average of contextualized word representations. With the prior of each document assigned to its nearest class, we then cluster and align the documents to classes. Finally, we pick the most confident documents from each cluster to train a text classifier. Extensive experiments demonstrate that X-Class can rival and even outperform seed-driven weakly supervised methods on 7 benchmark datasets. Our dataset and code are released at https://github.com/ZihanWangKi/XClass/ .

연구 동기 및 목표

  • 오직 클래스 이름만 제공되는 극도로 약한 지도 학습 환경에서 텍스트 분류 문제를 해결하는 것. 시드어나 레이블된 문서가 전혀 없음.
  • 사용자가 지정한 클래스 이름에 적응하는 표현 학습 프레임워크를 개발하여, 클러스터링이 원하는 분류 목표와 잘 일치하도록 하는 것.
  • 클러스터링을 통해 자동으로 고품질의 가짜 트레이닝 데이터를 생성할 수 있음을 입증하여, 최소한의 인간 레이블링으로도 뛰어난 성능을 달성하는 것.
  • 다양한 데이터 유형과 클래스 카테고리(주제, 위치, 감성 등)에 걸쳐 극도로 약한 지도 학습의 기준을 설정하는 것.

제안 방법

  • 불일치가 발생할 때까지 각 클래스에 가장 유사한 단어를 반복적으로 추가하여 클래스 중심의 표현을 추정한다.
  • BERT의 컨텍스트 기반 단어 표현을 가중 평균으로 조합하여 문서 표현을 계산하기 위해 맞춤형 클래스 어텐션 메커니즘의 혼합을 사용한다.
  • 초기 표현 기반으로 문서를 가장 가까운 클래스에 할당한 결과를 바탕으로, 초기 할당을 이용해 클러스터링을 초기화한다 (예: 가우시안 믹스처 모델).
  • 클러스터 수 K를 클래스 수와 동일하게 설정하여 문서를 K개의 클러스터로 분할하며, 초기 사전 정보를 통해 클러스터-클래스의 대응 관계를 유지한다.
  • 각 클러스터에서 가장 신뢰도가 높은 문서를 선별하여, BERT와 같은 지도 학습 분류기의 미세조정을 위한 가짜 레이블 트레이닝 세트를 구성한다.
  • 가짜 레이블 데이터를 기반으로 최종 텍스트 분류기를 훈련하며, 사전 학습된 언어 모델을 활용해 강력한 일반화 성능을 달성한다.

실험 결과

연구 질문

  • RQ1시드어나 레이블 예제가 전혀 없이 오직 클래스 이름만으로 텍스트 분류를 효과적으로 수행할 수 있는가?
  • RQ2문서 표현을 사용자가 지정한 클래스 이름에 적응시켜, 클러스터링이 원하는 분류 목표와 잘 일치하도록 할 수 있는가?
  • RQ3클러스터링 기반의 가짜 레이블링이 고품질의 트레이닝 데이터를 생성할 수 있으며, 이로 인해 제로샷 또는 희소한 샘플 설정에서도 뛰어난 성능을 달성할 수 있는가?
  • RQ4사용자가 제공한 시드가 전혀 없는 상황에서, 제안된 방법의 성능가 시드 기반의 약한 지도 학습 방법과 비교해 어떻게 되는가?

주요 결과

  • X-Class는 WeSTClass와 ConWea를 포함한 7개의 벤치마크 데이터셋에서 시드 기반의 약한 지도 학습 방법을 모두 능가하지만, 시드어가 전혀 필요하지 않다.
  • NYT-Small 데이터셋에서 X-Class-Hier는 세분화된 분류에서 마이크로-F1 92.66, 매크로-F1 80.92를 기록하여 X-Class-End 및 기타 베이스라인을 모두 압도했다.
  • 클래스 이름이 코퍼스에 한 번만 나타나는 경우에도 X-Class는 강건한 성능을 유지한다. 이는 클래스 이름의 빈도나 다양성에 의존하는 기존 방법과는 대조된다.
  • 뉴스 기사와 리뷰와 같은 다양한 데이터 유형과 주제, 위치, 감성과 같은 다양한 클래스 유형에서 뛰어난 성능을 보였다.
  • 여러 데이터셋에 걸쳐 일관되고 안정적인 성능을 보이며, 극도로 약한 지도 학습 조건에서도 일반화 능력이 뛰어남을 입증했다.
  • 세분화된 클래스 간 유사도가 크게 다를 수 있는 계층적 분류 설정에서도 효과적인 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.