Skip to main content
QUICK REVIEW

[논문 리뷰] Plug-Tagger: A Pluggable Sequence Labeling Framework Using Language Models

Xin Zhou, Ruotian Ma|arXiv (Cornell University)|2021. 10. 14.
Topic Modeling참고 문헌 38인용 수 4
한 줄 요약

Plug-Tagger는 분류 대신 레이블 워드 예측을 사용하는 플러그-앤플레이 프레임워크로, 냉각된 사전 훈련된 언어 모델이 경량 입력 벡터를 교환함으로써 여러 작업을 수행할 수 있도록 한다. 자원이 제한된 환경에서 전체 미세조정과 비교해도 유사한 성능를 달성하며, 작업 전용 파라미터 비율은 0.1%에 불과하고, 작업 전환 속도는 최대 70배 빠르다.

ABSTRACT

Plug-and-play functionality allows deep learning models to adapt well to different tasks without requiring any parameters modified. Recently, prefix-tuning was shown to be a plug-and-play method on various text generation tasks by simply inserting corresponding continuous vectors into the inputs. However, sequence labeling tasks invalidate existing plug-and-play methods since different label sets demand changes to the architecture of the model classifier. In this work, we propose the use of label word prediction instead of classification to totally reuse the architecture of pre-trained models for sequence labeling tasks. Specifically, for each task, a label word set is first constructed by selecting a high-frequency word for each class respectively, and then, task-specific vectors are inserted into the inputs and optimized to manipulate the model predictions towards the corresponding label words. As a result, by simply switching the plugin vectors on the input, a frozen pre-trained language model is allowed to perform different tasks. Experimental results on three sequence labeling tasks show that the performance of the proposed method can achieve comparable performance with standard fine-tuning with only 0.1\% task-specific parameters. In addition, our method is up to 70 times faster than non-plug-and-play methods while switching different tasks under the resource-constrained scenario.

연구 동기 및 목표

  • 사전 훈련된 언어 모델(PLM)의 아키텍처나 파라미터를 수정하지 않고도 시퀀스 태깅 작업에 대해 플러그-앤플레이 적응을 가능하게 하기 위해.
  • 기존 플러그-앤플레이 방법(예: 프리픽스 튜닝)이 시퀀스 태깅에서 실패하는 이유인 작업 전용 분류기 요구 사항을 극복하기 위해.
  • 모델 재배포가 비용이 많이 들고 시간이 오래 걸리는 산업 환경에서 빠른 작업 전환을 가능하게 하기 위해.
  • 시퀀스 태깅을 레이블 워드 예측으로 재구성함으로써 PLM의 언어 모델 헤드를 재사용하고, 작업 전용 분류기가 필요 없도록 하기 위해.
  • 동적이고 자원이 제한된 환경에서 최소한의 학습 가능한 파라미터와 낮은 추론 지연으로 높은 성능를 달성하기 위해.

제안 방법

  • 각 클래스에 대해 높은 빈도의 단어를 대표 레이블 워드로 선택하여 시퀀스 태깅을 레이블 워드 예측 작업으로 재구성한다.
  • 작업 전용 연속 벡터(플러그인)를 입력 시퀀스에 삽입하여 냉각된 PLM이 해당 레이블 워드를 예측하도록 유도한다.
  • 작업 전용 분류기가 필요 없도록 PLM의 사전 훈련된 언어 모델 헤드를 예측에 사용한다.
  • 사전 정의된 레이블 워드 매핑 테이블을 통해 예측된 레이블 워드를 실제 레이블로 매핑한다.
  • 학습 중에는 오직 입력 플러그인 벡터만 최적화하고, 모든 PLM 파라미터는 냉각 상태로 유지한다.
  • 추론 시에만 플러그인 벡터를 간단히 교체함으로써 모델 재훈련이나 재구성 없이 작업 전환을 가능하게 한다.

실험 결과

연구 질문

  • RQ1모델 아키텍처나 파라미터를 변경하지 않고 입력 수준의 수정만으로도 시퀀스 태깅을 완전히 플러그-앤플레이로 가능하게 할 수 있는가?
  • RQ2레이블 워드 예측이 전통적인 분류기 헤드를 대체하여 시퀀스 태깅 작업에서 성능을 유지할 수 있는가?
  • RQ3정확도와 파라미터 효율성 측면에서 Plug-Tagger는 표준 미세조정과 비교해 어떤 성능를 보이는가?
  • RQ4다양한 작업 환경에서 Plug-Tagger는 추론 속도와 배포 효율성을 얼마나 향상시키는가?
  • RQ5레이블 워드 선택 전략이 플러그-앤플레이 프레임워크의 강건성과 일반화에 어떤 영향을 미치는가?

주요 결과

  • Plug-Tagger는 세 가지 시퀀스 태깅 작업에서 표준 미세조정과 유사한 성능를 달성하며, 작업 전용 적응을 위한 파라미터 비율은 0.1%에 불과하다.
  • 자원이 제한된 조건에서 작업 전환 시 Plug-Tagger는 비플러그-앤플레이 방법보다 최대 70배 빠른 속도를 기록한다.
  • 고빈도 단어 선택을 통한 레이블 워드 예측은 다양한 레이블 세트 간에 PLM의 언어 모델 헤드를 효과적으로 재사용할 수 있도록 한다.
  • NER, POS 태깅, 체크닝에서 강력한 성능를 유지하며 CoNLL2003과 ACE2005에서 일관된 성능 향상을 보였지만, 인접한 동일 레이블 구간이 잘못 묶이는 현상으로 인해 체크닝 작업에서 성능 저하가 관찰되었다.
  • 정확한 일치 기반의 레이블 워드 선택 전략인 ExactMatch는 레이블 일관성과 단어 빈도가 중요한 경우 GreedyMatch보다 뛰어난 성능를 보였다.
  • 플러그-앤플레이 메커니즘은 전체 모델 재사용을 가능하게 하며, 작업 전환 시 모델 재훈련이나 재배포가 필요 없도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.