Skip to main content
QUICK REVIEW

[논문 리뷰] HPT: Hierarchy-aware Prompt Tuning for Hierarchical Text Classification

Zihan Wang, Peiyi Wang|arXiv (Cornell University)|2022. 04. 28.
Text and Document Classification Technologies인용 수 4
한 줄 요약

이 논문은 계층적 텍스트 분류를 위한 계층 인지 펌프 튜닝(HPT) 방법을 제안한다. HPT는 소프트 프롬프트에 레이블 계층 지식을 통합하고, 마스크된 언어 모델링 목표와 일치하기 위해 제로 기반 다중 레이블 교차 엔트로피 손실을 사용한다. HPT는 세 가지 벤치마크 데이터셋에서 최신 기술 성능(SOTA)을 달성하며, 레이블 불균형 및 저자원 설정에서도 성능을 크게 향상시킨다.

ABSTRACT

Hierarchical text classification (HTC) is a challenging subtask of multi-label classification due to its complex label hierarchy. Recently, the pretrained language models (PLM)have been widely adopted in HTC through a fine-tuning paradigm. However, in this paradigm, there exists a huge gap between the classification tasks with sophisticated label hierarchy and the masked language model (MLM) pretraining tasks of PLMs and thus the potentials of PLMs can not be fully tapped. To bridge the gap, in this paper, we propose HPT, a Hierarchy-aware Prompt Tuning method to handle HTC from a multi-label MLM perspective. Specifically, we construct a dynamic virtual template and label words that take the form of soft prompts to fuse the label hierarchy knowledge and introduce a zero-bounded multi-label cross entropy loss to harmonize the objectives of HTC and MLM. Extensive experiments show HPT achieves state-of-the-art performances on 3 popular HTC datasets and is adept at handling the imbalance and low resource situations. Our code is available at https://github.com/wzh9969/HPT.

연구 동기 및 목표

  • 사전 훈련된 언어 모델(PLMs)에서 마스크된 언어 모델링 사전 훈련과 계층적 텍스트 분류 미세 훈련 사이의 격차를 해소하기 위해.
  • 깊이와 폭 정보를 사용하여 레이블 계층 구조를 소프트 프롬프트에 통합함으로써 계층과 평탄한 구조 간 격차를 메우기 위해.
  • HTC를 다중 레이블 마스크된 언어 모델링 작업으로 재정의함으로써 다중 레이블과 다중 클래스 간 격차를 해결하기 위해.
  • 불균형 및 저자원 계층적 텍스트 분류 시나리오에서 성능을 향상시키기 위해.

제안 방법

  • 레이블 계층 깊이와 폭 정보를 인코딩하는 동적 가상 템플릿과 레이블 단어를 연속적인 소프트 프롬프트로 구성한다.
  • 소프트 프롬프트 토큰에 구조적 특징(깊이, 폭)을 통합하여 레이블 계층 지식을 프롬프트 설계에 통합한다.
  • 정확한 레이블의 점수를 높이고 잘못된 레이블의 점수를 낮추기 위해 제로 기반 다중 레이블 교차 엔트로피 손실을 사용한다.
  • 계층적 텍스트 분류를 계층 인지 다중 레이블 마스크된 언어 모델링 작업으로 변환하여 PLM 사전 훈련 목표와 더 잘 일치시킨다.
  • 사전 훈련된 언어 모델을 백본으로 사용하고, 전체 미세 훈련 대신 프롬프트 튜닝을 사용하여 사전 훈련 지식을 유지한다.
  • 레이블 예측 헤드를 마스크하고 소프트 프롬프트 파라미터를 최적화함으로써 프롬프트 튜닝된 모델을 최종 HTC 작업에 적용한다.

실험 결과

연구 질문

  • RQ1레이블 계층 구조를 통합함으로써 프롬프트 튜닝이 계층적 텍스트 분류에 효과적으로 적용될 수 있는가?
  • RQ2계층 인지 프롬프트 설계는 불균형 레이블 계층에서 성능을 어떻게 향상시키는가?
  • RQ3제로 기반 다중 레이블 교차 엔트로피 손실이 HTC와 마스크된 언어 모델링의 목표를 더 잘 일치시킬 수 있는가?
  • RQ4HPT는 저자원 및 장꼬리 레이블 시나리오에서 기존의 미세 훈련 및 프롬프트 기반 방법보다 우수한 성능을 보일 수 있는가?
  • RQ5HPT는 계층적 텍스트 분류에서 사전 훈련-미세 훈련 격차를 어느 정도 완화하는가?

주요 결과

  • HPT는 NYT, RCV1-V2, DBPedia와 같은 세 가지 유명한 계층적 텍스트 분류 데이터셋에서 최신 기술 성능(SOTA)을 달성한다.
  • NYT 데이터셋에서 HPT는 일반적으로 베이스라인 모델에서 성능이 떨어지는 중간 깊이 레이블 클러스터(깊이 3 및 4)의 매크로-F1 점수를 향상시킨다.
  • HPT는 저자원 레이블에 대해 성능 격차를 크게 줄여 장꼬리 시나리오에서 강력한 내구성을 보여준다.
  • 학습 데이터의 10%만을 사용하는 저자원 설정에서 HPT는 모든 베이스라인을 앞서며 낮은 표준편차를 유지하여 더 뛰어난 안정성을 보인다.
  • RCV1-V2에서 HPT는 저자원 설정에서 다음으로 우수한 베이스라인보다 매크로-F1 점수를 6.09점 높게 기록했으며, 전체 자원 설정에서는 2.13점의 격차를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.