Skip to main content
QUICK REVIEW

[논문 리뷰] Clinical Prompt Learning with Frozen Language Models

Niall Taylor, Yi Zhang|arXiv (Cornell University)|2022. 05. 11.
Artificial Intelligence in Healthcare and Education인용 수 6
한 줄 요약

이 논문은 임상 의사결정 과제를 위한 고정된 대규모 언어 모델을 활용한 프롬프트 학습을 조사하며, 기존의 희생적 미세조정 대비 유사하거나 뛰어난 성능을 달성하면서도 훨씬 적은 트레이닝 가능한 파라미터와 더 적은 훈련 데이터를 요구한다는 점을 입증한다. 이 방법은 해석 가능성과 효율성을 향상시키기 위해 혼합 템플릿을 사용하는 소프트 프롬프트 튜닝을 적용하며, 임상 환경에서 대규모 모델을 미세조정하는 데 있어 자원 소모가 적은 실용적인 대안을 제공한다.

ABSTRACT

Prompt learning is a new paradigm in the Natural Language Processing (NLP) field which has shown impressive performance on a number of natural language tasks with common benchmarking text datasets in full, few-shot, and zero-shot train-evaluation setups. Recently, it has even been observed that large but frozen pre-trained language models (PLMs) with prompt learning outperform smaller but fine-tuned models. However, as with many recent NLP trends, the performance of even the largest PLMs such as GPT-3 do not perform well on specialized domains (e.g. medical text), and the common practice to achieve State of the Art (SoTA) results still consists of pre-training and fine-tuning the PLMs on downstream tasks. The reliance on fine-tuning large PLMs is problematic in clinical settings where data is often held in non-GPU environments, and more resource efficient methods of training specialized domain models is crucial. We investigated the viability of prompt learning on clinically meaningful decision tasks and directly compared with more traditional fine-tuning methods. Results are partially in line with the prompt learning literature, with prompt learning able to match or improve on traditional fine-tuning with substantially fewer trainable parameters and requiring less training data. We argue that prompt learning therefore provides lower computational resource costs applicable to clinical settings, that can serve as an alternative to fine-tuning ever increasing in size PLMs. Complementary code to reproduce experiments presented in this work can be found at: https://github.com/NtaylorOX/Public_Clinical_Prompt.

연구 동기 및 목표

  • 고정된 사전학습된 언어 모델(PLM)을 활용한 프롬프트 학습이 임상 의사결정 과제에 실용적인지 평가하기.
  • 성능, 파라미터 효율성, 데이터 효율성 측면에서 프롬프트 학습과 기존의 희생적 미세조정을 비교하기.
  • 낮은 자원 환경에서 프롬프트 학습이 계산적으로 효율적인 미세조정의 대안이 될 수 있는지 평가하기.
  • 특히 혼합 템플릿 설계를 통한 의료 NLP 분야에서 프롬프트 기반 방법의 해석 가능성과 내성에 대해 평가하기.
  • 작은 도메인 특화 PLM과 프롬프트 학습을 조합할 경우 일반 목적의 대규모 모델보다 임상 응용에서 더 뛰어난 성능을 낼 수 있는지 판단하기.

제안 방법

  • 연구는 전체 모델 파라미터의 미세조정을 방지하기 위해 고정된 BERT 기반 PLM(예: BioBERT)을 사용한다.
  • 소프트 프롬프트 튜닝을 적용하여 입력 토큰 앞에 학습 가능한 임베딩 벡터를 삽입함으로써 모델의 예측을 유도한다.
  • 고정된 프롬프트 단어와 학습 가능한 소프트 프롬프트를 조합한 혼합 템플릿을 사용하여 해석 가능성과 최적화의 유연성을 균형 잡는다.
  • MIMIC-III 데이터셋의 네 가지 임상 과제(ICD-9 삼분류, 입원 기간 예측, 사망 예측, 임상 노트 분류)에서 프레임워크를 평가한다.
  • 소수의 샘플, 제로샷, 전체 데이터 훈련 설정에서 프롬프트 학습과 기존의 희생적 미세조정 간의 성능을 비교한다.
  • 하이퍼파라미터 최적화를 위해 검색을 수행하고, 타이핑 설계와 내성에 대한 분석을 통해 추론 능력을 평가한다.
Figure 1 : Illustration of conventional fine-tuning method, with an option to freeze the PLM, shown in dotted line. Here [CLS] and [SEP] tokens are special tokens for BERT-based models that are added to the beginning and end of sequences.
Figure 1 : Illustration of conventional fine-tuning method, with an option to freeze the PLM, shown in dotted line. Here [CLS] and [SEP] tokens are special tokens for BERT-based models that are added to the beginning and end of sequences.

실험 결과

연구 질문

  • RQ1고정된 PLM을 사용한 프롬프트 학습이 임상 NLP 과제에서 기존의 희생적 미세조정과 유사한 성능을 달성할 수 있는가?
  • RQ2임상 환경에서 프롬프트 학습이 희생적 미세조정 대비 트레이닝 가능한 파라미터 수와 데이터 요구량을 줄이는가?
  • RQ3혼합 템플릿의 사용이 임상 의사결정 과제에서 모델 성능과 해석 가능성에 어떤 영향을 미치는가?
  • RQ4낮은 자원 환경에서 프롬프트 학습이 희생적 미세조정보다 하이퍼파라미터 변화에 더 강건한가?
  • RQ5작은 도메인 특화 PLM에 프롬프트 학습을 조합하면 일반 목적의 대규모 모델보다 임상 응용에서 더 뛰어난 성능을 낼 수 있는가?

주요 결과

  • 모든 네 가지 임상 과제에서 고정된 PLM을 사용한 프롬프트 학습이 기존의 희생적 미세조정과 유사하거나 뛰어난 성능을 보였으며, 트레이닝 가능한 파라미터 수가 훨씬 적었다.
  • 훈련에 필요한 데이터와 계산 자원이 크게 줄어들어 낮은 자원 환경에서의 적용에 적합했다.
  • 혼합 템플릿은 완전히 소프트 프롬프트와 유사한 성능을 달성하면서도 인간이 읽을 수 있는 프롬프트 구조를 유지함으로써 해석 가능성을 유지했다.
  • 특히 소수의 샘플 설정에서 프롬프트 학습이 희생적 미세조정보다 하이퍼파라미터 변화에 더 강건한 것으로 나타났다.
  • 의료 분야에 특화된 BERT 모델(BioBERT)을 사용하더라도 프롬프트 학습이 미세조정보다 일관되게 성능 향상을 보였으며, 이는 도메인 적응의 이점이 있음을 시사한다.
  • 강력한 성능 결과에도 불구하고, 입원 기간 및 사망 예측 과제에서는 두 프레임워크 모두 상대적으로 낮은 성능를 보였으며, 이는 과제 특유의 과제 도전 과제임을 시사한다.
Figure 2 : Illustration of manual template and verbalizer in prompt learning.
Figure 2 : Illustration of manual template and verbalizer in prompt learning.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.