Skip to main content
QUICK REVIEW

[논문 리뷰] BertGCN: Transductive Text Classification by Combining GCN and BERT

Yuxiao Lin, Yuxian Meng|arXiv (Cornell University)|2021. 05. 12.
Text and Document Classification Technologies참고 문헌 43인용 수 46
한 줄 요약

BertGCN은 이기종 단어-문서 그래프에서 BERT 인코더와 GCN을 공동으로 학습하여 전이 텍스트 분류를 수행하고, 다수 데이터셋에서 최첨단 성능을 달성합니다.

ABSTRACT

In this work, we propose BertGCN, a model that combines large scale pretraining and transductive learning for text classification. BertGCN constructs a heterogeneous graph over the dataset and represents documents as nodes using BERT representations. By jointly training the BERT and GCN modules within BertGCN, the proposed model is able to leverage the advantages of both worlds: large-scale pretraining which takes the advantage of the massive amount of raw data and transductive learning which jointly learns representations for both training data and unlabeled test data by propagating label influence through graph convolution. Experiments show that BertGCN achieves SOTA performances on a wide range of text classification datasets. Code is available at https://github.com/ZeroRin/BertGCN.

연구 동기 및 목표

  • 대규모 사전학습과 텍스트 분류를 위한 전이 학습을 결합할 동기를 제시한다.
  • BERT로 초기화된 문서 임베딩을 GCN 입력으로 사용하는 이기종 단어-문서 그래프를 제안한다.
  • BERT와 GCN 모듈을 공동 학습하고 선택적으로 예측을 보간한다.
  • 메모리 뱅크(memory bank) 접근법으로 대형 그래프에서의 GCN 학습 비효율성을 해결한다.

제안 방법

  • 문서 노드가 BERT 임베딩을 초기 특징으로 사용하는 이기종 단어-문서 그래프를 구성한다.
  • 정규화된 인접 행렬 위에서 정보를 전파하기 위해 두 계층 GCN을 사용한다.
  • 최종 출력을 형성하기 위해 BertGCN 예측과 직접적인 BERT 예측을 보간한다.
  • 레이블이 있는 문서에 대한 교차 엔트로피 손실로 학습하면서 BERT와 GCN 매개변수를 모두 업데이트한다.
  • 학습 중 배치 크기를 그래프 크기에서 분리하기 위해 모든 문서 임베딩을 저장하는 메모리 뱅크를 도입한다.

실험 결과

연구 질문

  • RQ1대규모 사전학습의 이점이 전이 GCN 기반 텍스트 분류에서 활용될 수 있는가?
  • RQ2BERT와 GCN을 함께 학습하는 것이 각 구성요소를 단독으로 사용할 때보다 성능을 향상시키는가?
  • RQ3BERT 및 BertGCN 예측을 보간하는 것이 BertGCN 단독 사용보다 더 나은 결과를 내는가?
  • RQ4대형 그래프에서 BertGCN 학습을 위한 메모리 효율성은 어떻게 달성할 수 있는가?

주요 결과

  • BertGCN은 TextGCN, SGC, BERT, RoBERTa 기준선 대비 여러 데이터셋에서 최첨단 성능을 달성한다.
  • RoBERTa 기반 BertGCN 변형이 모든 테스트 데이터셋에서 최상위를 차지하며, 20NG 및 Ohsumed처럼 긴 문서에서 주목할 만한 향상을 보인다.
  • 20NG에서 RoBERTaGCN의 최상의 성능은 대략 lambda=0.7 근처에서 나타나 GCN과 BERT 구성요소 간의 균형을 시사한다.
  • 메모리 뱅크는 배치 크기를 그래프의 전체 노드 수와 분리하여 효율적 학습을 가능하게 한다.
  • 메모리 뱅크 설정에서 BERT 모듈의 작은 학습률과 학습 전 미세조정은 안정성과 정확도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.