[논문 리뷰] Building Chinese Biomedical Language Models via Multi-Level Text Discrimination
이 논문은 토큰 수준과 시퀀스 수준의 대비 학습을 결합한 새로운 다수준 텍스트 구별 프레임워크를 사용하여, 중국어 생물의학 텍스트에서 완전히 새로 시작하여 사전 훈련한 eHealth라는 중국어 생물의학 언어 모델을 소개한다. 이 모델은 외부 지식에 의존하지 않는 자기지도 학습과 도메인 내 어휘를 통해, 11개의 중국어 생물의학 NLP 작업에서 기존의 일반 도메인 및 생물의학 도메인 PLM을 초월하여 뛰어난 성능을 보이며, 구현이 용이하다.
Pre-trained language models (PLMs), such as BERT and GPT, have revolutionized the field of NLP, not only in the general domain but also in the biomedical domain. Most prior efforts in building biomedical PLMs have resorted simply to domain adaptation and focused mainly on English. In this work we introduce eHealth, a Chinese biomedical PLM built from scratch with a new pre-training framework. This new framework pre-trains eHealth as a discriminator through both token- and sequence-level discrimination. The former is to detect input tokens corrupted by a generator and recover their original identities from plausible candidates, while the latter is to further distinguish corruptions of a same original sequence from those of others. As such, eHealth can learn language semantics at both token and sequence levels. Extensive experiments on 11 Chinese biomedical language understanding tasks of various forms verify the effectiveness and superiority of our approach. We release the pre-trained model at \url{https://github.com/PaddlePaddle/Research/tree/master/KG/eHealth} and will also release the code later.
연구 동기 및 목표
- 일반 도메인 대비 모델을 능가하는 공개적으로 이용 가능한 고품질의 중국어 생물의학 사전 훈련 언어 모델(PLM)이 부족한 문제를 해결하기 위해.
- 도메인 특화 어휘와 자기지도 학습 목표를 통해 중국어 생물의학 텍스트 이해를 향상시키기 위해.
- 다수준 텍스트 구별을 통해 토큰 수준과 시퀀스 수준의 의미를 모두 포착하는 사전 훈련 프레임워크를 개발하기 위해.
- 다수의 이전 지식 강화 모델과 달리 외부 지식 기반에 의존하지 않아, 쉽게 구현할 수 있도록 하기 위해.
- 더 넓은 연구 및 응용 사용을 위해 공개적으로 접근 가능한 고성능 중국어 생물의학 PLM을 제공하기 위해.
제안 방법
- ELECTRA를 영감으로 삼은 생성자-판별자 프레임워크를 제안하여, 생성자가 입력 텍스트를 손상시키고, 판별자가 원래 토큰과 손상된 시퀀스를 구별하도록 학습한다.
- 로컬 의미 이해를 향상시키기 위해, 타당한 후보에서 손상된 토큰을 탐지하고 복원하는 토큰 수준의 구별(RTD)을 활용한다.
- 동일한 원본 시퀀스의 손상과 다른 시퀀스의 손상을 구별함으로써 글로벌 맥락 모델링을 향상시키기 위해 대비 학습을 사용하는 시퀀스 수준의 구별(CSP)을 도입한다.
- 중국어 생물의학 텍스트에 특화된 새로운 도메인 내 어휘를 사용하여 판별자 모델을 완전히 새로 시작하여 사전 훈련함으로써, 토큰화 정확도를 향상시킨다.
- 로컬 및 글로벌 의미 표현을 동시에 최적화하기 위해 RTD, MTS(마스킹 토큰 선택) 및 CSP를 조합한 다중 과제 목적 함수를 사용한다.
- 도메인 특화 표현 학습을 보장하기 위해 대규모 익명화된 의료 대화, 전자 의무 기록 및 교과서 데이터를 사용하여 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1도메인 특화 어휘로 완전히 새로 시작하여 사전 훈련한 중국어 생물의학 PLM이 일반 도메인 또는 미세조정된 모델보다 중국어 생물의학 NLP 작업에서 더 뛰어난 성능을 낼 수 있는가?
- RQ2토큰 수준과 시퀀스 수준의 대비 학습을 결합한 다수준 텍스트 구별이, 표준 사전 훈련 목표에 비해 중국어 생물의학 텍스트의 의미 표현을 향상시키는가?
- RQ3일반 도메인 모델에서 계속 사전 훈련하는 것과 비교해, 도메인 내 어휘로 완전히 새로 시작하는 사전 훈련 방식이 성능과 효율성 측면에서 어떻게 다른가?
- RQ4제안된 사전 훈련 과제(RTD, MTS, CSP)가 개별적으로나 종합적으로 최종 모델 성능에 얼마나 기여하는가?
- RQ5자기지도 학습에 기반하고 외부 지식에 의존하지 않는 PLM이 중국어 생물의학 NLP에서 최고 성능을 기록하면서도, 후속 응용에서 쉽게 구현 가능한가?
주요 결과
- eHealth는 텍스트 분류, 매칭, 정보 추출, 질의 응답을 포함한 11개의 중국어 생물의학 NLP 작업에서 최고 성능을 기록하며, 일반 도메인 및 생물의학 도메인 PLM을 모두 능가한다.
- CBLUE 벤치마크에서 표준 ELECTRA 사전 훈련보다 다수준 사전 훈련 설정(RTD + MTS + CSP)이 평균 0.96% 향상된 성능을 기록한다.
- 시퀀스 수준의 대비 학습 과제(CSP)를 제거하면 CBLUE에서 평균 0.45% 성능 저하가 발생하지만, 토큰 수준의 MTS 과제를 제거하면 더 큰 0.87%의 성능 저하가 발생한다.
- 일반 도메인 모델에서 계속 사전 훈련하는 것보다, 도메인 내 어휘로 완전히 새로 시작하는 사전 훈련(R weights + B vocab)이 더 좋은 성능을 낸다. 이는 단지 500K 훈련 스텝으로도 가능하다.
- 도메인 내 어휘와 일반 도메인 어휘 간 성능 격차는 뚜렷하다: 일반 도메인 어휘를 사용할 경우(R weights + E vocab) 전체 CBLUE 점수는 73.52%에서 73.30%로 감소한다.
- eHealth는 모든 평가 벤치마크에서 더 큰 모델들과 기존의 생물의학 PLM인 MC-BERT, PCL-MedBERT, SMedBERT, EMBERT를 모두 능가하며, 그 효과성과 확장성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.