Skip to main content
QUICK REVIEW

[논문 리뷰] Adapting BERT for Continual Learning of a Sequence of Aspect Sentiment Classification Tasks

Zixuan Ke, Xu Hu|arXiv (Cornell University)|2021. 12. 05.
Domain Adaptation and Few-Shot Learning인용 수 10
한 줄 요약

이 논문은 캡슐 기반 지속적 학습 어댑터(CLA)를 사용하여 전방 및 후방 지식 전이를 가능하게 하면서 치명적 망각을 방지하는 새로운 BERT 기반 지속적 학습 프레임워크인 B-CL을 제안한다. 동적 라우팅을 통한 공유 지식 추출과 작업별 마스크를 통한 고립을 활용함으로써 B-CL은 19개의 ASC 작업 순서에서 새로운 작업과 이전 작업 모두에서 모든 기준보다 유의미한 격차로 최고 성능을 달성한다.

ABSTRACT

This paper studies continual learning (CL) of a sequence of aspect sentiment classification (ASC) tasks. Although some CL techniques have been proposed for document sentiment classification, we are not aware of any CL work on ASC. A CL system that incrementally learns a sequence of ASC tasks should address the following two issues: (1) transfer knowledge learned from previous tasks to the new task to help it learn a better model, and (2) maintain the performance of the models for previous tasks so that they are not forgotten. This paper proposes a novel capsule network based model called B-CL to address these issues. B-CL markedly improves the ASC performance on both the new task and the old tasks via forward and backward knowledge transfer. The effectiveness of B-CL is demonstrated through extensive experiments.

연구 동기 및 목표

  • 지속적 학습에서 도메인 특화된 감성 분류 작업의 시퀀스를 배우는 데 있어 이전 지식을 잊지 않도록 하는 도전 과제를 해결하기 위해.
  • 이전 작업의 데이터에 접근할 수 없더라도, 이전 작업에서의 지식을 전달하여 새로운 작업에서의 학습을 가속화할 수 있도록 전방 지식 전이를 가능하게 하기 위해.
  • 작업별 마스크를 사용하여 작업별 지식를 고립시킴으로써 치명적 망각을 방지하고 이전에 학습한 작업에서의 성능을 유지하기 위해.
  • 캡슐 네트워크와 동적 라우팅을 BERT에 통합한 효과적인 지식 전이 및 유지가 가능한 새로운 지속적 학습 어댑터(CLA)를 제안하기 위해.
  • 세부적으로 작업에 특화된 표현을 가지는 미세조정된 BERT만으로는 지속적 학습에서 실패하며, 이는 B-CL과 같은 새로운 아키텍처가 필요하다는 것을 입증하기 위해.

제안 방법

  • B-CL은 캡슐 네트워크와 동적 라우팅을 기반으로 한 지속적 학습 어댑터(CLA)를 활용하여 이전 작업에서 공유 지식를 식별하고 현재 작업으로 전달한다.
  • CLA는 유사도 기반으로 어텐션 헤드를 그룹화하는 라우팅 메커니즘을 사용하여 이전 작업의 관련 지식를 선택적으로 새로운 작업으로 전달한다.
  • 작업별 모듈(TSM)을 도입하여 작업별로 고유한 표현을 고립시켜 새로운 작업 학습 시 간섭을 방지한다.
  • 지식 공유 모듈(KSM)을 사용하여 다양한 작업 간의 공유 지식를 집계하고 전달함으로써 일반화 능력과 학습 효율성을 향상시킨다.
  • 모델는 다중 작업 손실을 통해 엔드 투 엔드로 훈련되며, 현재 작업과 이전 작업의 성능를 균형 잡고, 특정 지식를 보호하기 위해 작업 마스크를 사용한다.
  • B-CL은 사전 학습된 BERT 기반 아키텍처에 통합되어 전이 학습의 이점을 누리면서도 지속적 학습 능력을 유지한다.

실험 결과

연구 질문

  • RQ1기존의 감성 분류 작업에서 공유 지식를 효과적으로 추출하여 새로운 작업에서의 학습을 가속화할 수 있는가?
  • RQ2작업을 순차적으로 학습할 때 지속적 학습 프레임워크가 치명적 망각을 방지할 수 있는가?
  • RQ3지속적 학습 어댑터에 캡슐 네트워크와 동적 라우팅을 사용할 경우, 표준 미세조정 또는 정규화 방법에 비해 지식 전이 및 유지 능력이 향상되는가?
  • RQ4B-CL은 기존의 지속적 학습 기준들(EWC, OWM, HAT 등)과 비교해 새로운 작업과 이전에 학습한 작업 모두에서 성능 면에서 어떻게 다른가?
  • RQ5제안된 아키텍처는 19개의 다양한 ASC 작업 순서에서 전방 및 후방 지식 전이를 얼마나 잘 지원하는가?

주요 결과

  • B-CL은 19개의 ASC 작업에서 평균 Macro-F1 점수 0.8140을 기록하여, 이어지는 최고의 기준인 OWM(0.7931)보다 유의미하게 높은 성능을 달성한다.
  • B-CL의 전방 지식 전이 성능(0.7993 Macro-F1)은 모든 다른 기준의 전방 지식 전이 결과를 초월하여 강력한 지식 전이 능력을 입증한다.
  • 제거 실험 결과, 지식 공유 모듈(KSM)과 작업별 모듈(TSM)이 모두 필수적임을 확인하였으며, 둘 중 하나를 제거할 경우 Macro-F1 점수가 8% 이상 감소한다.
  • 미세조정된 BERT와 Adapter-BERT는 지속적 학습에서 빈번한 망각로 인해 성능이 저하되며, 각각 Macro-F1 점수가 0.4308과 0.4481로 떨어진다.
  • B-CL의 후방 지식 전이 성능는 0.7993에서 0.8140으로 약간 향상되어 계속된 훈련이 모델의 일반화 능력을 더욱 향상시킨다는 것을 시사한다.
  • 결과는 BERT의 미세조정만으로는 작업에 특화된 지식 때문에 지속적 학습에서 실패하며, 이는 B-CL과 같은 새로운 아키텍처의 필요성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.