Skip to main content
QUICK REVIEW

[논문 리뷰] LightXML: Transformer with Dynamic Negative Sampling for High-Performance Extreme Multi-label Text Classification

Ting Jiang, Deqing Wang|arXiv (Cornell University)|2021. 01. 09.
Text and Document Classification Technologies참고 문헌 23인용 수 14
한 줄 요약

LightXML는 생성적 협력 네트워크를 통한 동적 음성 샘플링을 이용한 엔드 투 엔드, 경량 트랜스포머 기반 모델을 제안한다. 극단적 다중라벨 텍스트 분류(XMC)를 위해 텍스트 표현, 라벨 복귀, 라벨 랭킹을 하나의 통합 프레임워크에서 공동으로 학습함으로써, AttentionXML 및 X-Transformer와 같은 이전 방법들보다 최대 72% 더 작은 모델 크기와 훨씬 낮은 계산 비용으로 다섯 개의 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Extreme Multi-label text Classification (XMC) is a task of finding the most relevant labels from a large label set. Nowadays deep learning-based methods have shown significant success in XMC. However, the existing methods (e.g., AttentionXML and X-Transformer etc) still suffer from 1) combining several models to train and predict for one dataset, and 2) sampling negative labels statically during the process of training label ranking model, which reduces both the efficiency and accuracy of the model. To address the above problems, we proposed LightXML, which adopts end-to-end training and dynamic negative labels sampling. In LightXML, we use generative cooperative networks to recall and rank labels, in which label recalling part generates negative and positive labels, and label ranking part distinguishes positive labels from these labels. Through these networks, negative labels are sampled dynamically during label ranking part training by feeding with the same text representation. Extensive experiments show that LightXML outperforms state-of-the-art methods in five extreme multi-label datasets with much smaller model size and lower computational complexity. In particular, on the Amazon dataset with 670K labels, LightXML can reduce the model size up to 72% compared to AttentionXML.

연구 동기 및 목표

  • 다단계 학습과 정적 음성 샘플링에 의존하는 기존 XMC 방법의 비효율성과 높은 계산 비용을 해결하기 위해.
  • 극단적 다중라벨 환경에서 분류 정확도를 유지하거나 향상시키면서 모델 크기와 계산 복잡도를 줄이기 위해.
  • 라벨 복귀와 랭킹을 하나의 공동 최적화 프레임워크에 통합함으로써 트랜스포머 기반 모델의 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 학습 중에 적응하는 동적 음성 샘플링 전략을 개발하여 모델의 강건성과 수렴 성능를 향상시키기 위해.
  • 단일 GPU에서 최소한의 학습 시간으로 대규모 데이터셋(예: Amazon-670K)에서 높은 성능을 달성하기 위해.

제안 방법

  • LightXML는 입력 텍스트로부터 풍부하고 계층적인 텍스트 표현을 생성하기 위해 다층 트랜스포머 인코더를 사용한다.
  • 라벨 생성기(양성 및 음성 라벨를 복귀하기 위한)와 판별기(라벨를 양성 또는 음성으로 랭킹하기 위한)로 구성된 생성적 협력 네트워크를 도입한다.
  • 학습 중에 동일한 텍스트 표현을 생성기에 입력하여, 판별기가 다양하고 변화하는 음성 라벨 세트에서 학습할 수 있도록 동적 음성 샘플링을 수행한다.
  • 모델은 엔드 투 엔드로 학습되어 텍스트 표현, 라벨 복귀, 라벨 랭킹을 공동 최적화할 수 있으며, 별도의 모델 학습 단계가 필요 없도록 한다.
  • 라벨 생성기는 라벨 클러스터 정보를 사용하여 복귀 품질을 향상시키며, 판별기는 진짜 양성 라벨와 복귀된 라벨를 구분한다.
  • 프레임워크는 효율적인 추론을 지원하며, 50만 개 이상의 라벨를 가진 데이터셋에서 샘플당 예측 시간이 5ms 이내이다.

실험 결과

연구 질문

  • RQ1XMC를 위한 트랜스포머 기반 모델의 엔드 투 엔드 학습이 정확도와 효율성 측면에서 다단계 학습 접근법을 능가할 수 있는가?
  • RQ2협력적 생성-판별 프레임워크에서 학습된 동적 음성 샘플링은 정적 샘플링에 비해 일반화 능력과 수렴 성능를 향상시키는가?
  • RQ3단일 통합 모델이 모델 크기와 계산 비용을 줄이며 극단적 다중라벨 데이터셋에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4트랜스포머 인코더의 다층 텍스트 표현은 XMC에서 수렴 속도와 최종 정확도에 어떤 영향을 미치는가?
  • RQ5AttentionXML 및 X-Transformer와 같은 최신 기술 방법에 비해 LightXML는 모델 크기와 추론 시간을 얼마나 줄일 수 있는가?

주요 결과

  • Amazon-670K 데이터셋에서 LightXML는 AttentionXML 대비 모델 크기를 72% 줄였으며, 메모리 사용량이 훨씬 낮아도 동일하거나 더 높은 성능을 달성한다.
  • Amazon-670K에서 LightXML는 샘플당 4.09ms의 예측 속도를 기록하여 AttentionXML의 8.59ms 대비 52% 향상된 성능를 보였다.
  • Amazon-670K에서 LightXML는 단일 GPU를 사용하면서도 학습 시간을 28.75시간으로 줄였고, AttentionXML의 26.10시간보다 약간 더 길지만 동일한 하드웨어 조건에서의 성능이다.
  • 다층 텍스트 표현을 사용할 경우, 마지막 레이어의 [CLS] 토큰만 사용하는 것보다 최종 P@5 정확도가 1% 이상 향상된다.
  • 정적 샘플링 방식($S$ 및 $BS$)과 비교해도, 동적 음성 샘플링은 정확도와 학습 효율성 측면에서 모두 뛰어나며, 후자보다 더 긴 학습 시간이 걸리더라도 성능이 뛰어나다.
  • Wiki-500K 및 Amazon-670K를 포함한 다섯 개의 벤치마크 데이터셋에서 LightXML는 최소한의 계산 오버헤드와 완전한 단일 GPU 호환성을 유지하면서 최신 기술 수준의 성능를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.