Skip to main content
QUICK REVIEW

[논문 리뷰] The Topological BERT: Transforming Attention into Topology for Natural Language Processing

Ilan Perez, Raphael Reinauer|arXiv (Cornell University)|2022. 06. 30.
Topological and Geometric Data Analysis인용 수 11
한 줄 요약

이 논문은 BERT의 어텐션 맵을 어テン션 그래프로 변환하고, 정점 기반의 데이터 분석 기법—특히 지속성 homology와 지속성 이미지—를 적용하여 구조적 특징을 추출하는 새로운 텍스트 분류기인 Topological BERT를 제안한다. 이는 감성 분석 및 문법성 판단과 같은 NLP 작업에서 BERT와 유사한 성능을 달성하며, 성능 저하 없이 어텐션 헤드를 10개까지 극적으로 잘라내는 것이 가능하고, 악성 공격에 대해 뛰어난 내성을 보인다.

ABSTRACT

In recent years, the introduction of the Transformer models sparked a revolution in natural language processing (NLP). BERT was one of the first text encoders using only the attention mechanism without any recurrent parts to achieve state-of-the-art results on many NLP tasks. This paper introduces a text classifier using topological data analysis. We use BERT's attention maps transformed into attention graphs as the only input to that classifier. The model can solve tasks such as distinguishing spam from ham messages, recognizing whether a sentence is grammatically correct, or evaluating a movie review as negative or positive. It performs comparably to the BERT baseline and outperforms it on some tasks. Additionally, we propose a new method to reduce the number of BERT's attention heads considered by the topological classifier, which allows us to prune the number of heads from 144 down to as few as ten with no reduction in performance. Our work also shows that the topological model displays higher robustness against adversarial attacks than the original BERT model, which is maintained during the pruning process. To the best of our knowledge, this work is the first to confront topological-based models with adversarial attacks in the context of NLP.

연구 동기 및 목표

  • fine-tuned BERT 파라미터에 의존하지 않고 BERT의 어텐션 메커니즘을 활용하는 정점 기반 텍스트 분류기를 개발하는 것.
  • 정점 표현된 어텐션 그래프가 표준 NLP 벤치마크에서 BERT의 성능을 따라하거나 뛰어넘을 수 있는지 조사하는 것.
  • 정점 해석 가능성에 기반한 새로운 어텐션 헤드 프루닝 방법을 설계하여 성능 저하 없이 모델 복잡도를 감소시키는 것.
  • 정점 기반 NLP에서 이전에 탐색되지 않은 분야인 악성 공격에 대한 정점 모델의 내성을 평가하는 것.
  • UMAP 투영에서의 정점 안정성과 클러스터링을 통해 어텐션 헤드의 해석 가능성 탐색

제안 방법

  • 각 레이어와 시퀀스별로 BERT의 멀티헤드 어텐션 맵을 가중치가 있는 방향성 어텐션 그래프로 변환한다.
  • 지속성 호몰로지 분석을 통해 호몰로지 차원 전반에 걸쳐 베티 수와 지속성 이미지와 같은 정점 기반 특징을 계산한다.
  • 지속성 이미지를 완전히 연결된 신경망의 입력 특징으로 사용하여 최종 분류를 수행한다.
  • GradCam 유사 방법을 제안하여 정점 기반 특징에 기여하는 어텐션 헤드의 기여도를 평가하고, 이를 바탕으로 프루닝을 수행한다.
  • 지속성 이미지에 대해 데이터 증강 및 표준화 기법을 적용하며, 이는 회전, 팞딩, 프레임별 정규화 포함이다.
  • 조기 정지와 학습률 스케줄링을 사용하여 작업별 데이터셋에서 정점 분류기를 종단 간(end-to-end)으로 훈련한다.

실험 결과

연구 질문

  • RQ1BERT의 어텐션 그래프에서 추출한 정점 기반 특징이 표준 NLP 벤치마크에서 BERT와 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2정점 기반 관련성에 기반한 어텐션 헤드 프루닝이 분류 정확도와 내성을 유지하거나 향상시키는가?
  • RQ3일반형, 다차원형, 방향성 필터레이션 유형과 대칭 함수의 조합이 정점 모델 성능에 어떤 영향을 미치는가?
  • RQ4지속성 다이어그램의 UMAP 투영과 BERT 기반 어텐션 맵 클러스터링 패턴 간 상관관계가 존재하는가?
  • RQ5정점 모델은 악성 공격에 대해 강건한가? 그리고 프루닝은 이러한 내성에 영향을 미치는가?

주요 결과

  • 정점 모델은 평가된 모든 작업에서 BERT와 유사한 성능을 달성하였으며, IMDB 데이터셋에서는 정확도가 99.8%에 도달했고, SST-2 데이터셋에서는 89.0%를 기록했다.
  • 제안된 정점 기반 점수 기반 프루닝 방법을 사용해 어텐션 헤드를 144개에서 10개로 줄여도 성능 유지가 가능했으며, 정확도 저하가 미미했다 (예: CoLA에서 3개 헤드 시 0.554/81.9, BERT는 0.518/80.6).
  • 20개의 피니튜닝 에포크를 적용했을 때, 정점 모델은 CoLA 데이터셋에서 1개 헤드로 0.591/83.3의 정확도를 기록하여 BERT의 0.518/80.6을 초월했다.
  • 정점 모델은 BERT보다 악성 공격에 훨씬 더 강건한 것으로 나타났으며, 10개 헤드로 프루닝한 후에도 이러한 내성은 유지되었다.
  • 일반형 및 방향성 필터레이션에서 계산된 지속성 이미지, 특히 프루닝 적용 시, 더 복잡한 필터레이션인 MultiDim보다 성능이 뛰어나 CoLA에서 30개 헤드로 82.4%의 정점 정확도를 기록했다.
  • 프루닝 후 선택된 어텐션 헤드는 주로 [SEP] 토큰에 집중되어 있어, 'no-op' 가설에 대한 새로운 통찰을 제공하며, 어텐션 헤드의 기능적 전문화를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.