Skip to main content
QUICK REVIEW

[논문 리뷰] SINA-BERT: A pre-trained Language Model for Analysis of Medical Texts in Persian

Nasrin Taghizadeh, Ehsan Doostmohammadi|arXiv (Cornell University)|2021. 04. 15.
Topic Modeling참고 문헌 16인용 수 7
한 줄 요약

Sina-BERT는 280만 건의 공식적이고 비공식적인 페르시아어 의료 텍스트를 사전 훈련하여 페르시아어 의료 자연어 처리 작업에서의 성능을 향상시키기 위해 개발된 BERT 기반 언어 모델이다. 의료 질문 분류, 감성 분석, 질문 검색 등의 주석이 붙은 데이터셋에 맞춤형 훈련을 거쳐 기존의 페르시아어 모델들을 능가하며, 특히 비지도 검색에서 68.87%의 R@1 성능을 기록했다.

ABSTRACT

We have released Sina-BERT, a language model pre-trained on BERT (Devlin et al., 2018) to address the lack of a high-quality Persian language model in the medical domain. SINA-BERT utilizes pre-training on a large-scale corpus of medical contents including formal and informal texts collected from a variety of online resources in order to improve the performance on health-care related tasks. We employ SINA-BERT to complete following representative tasks: categorization of medical questions, medical sentiment analysis, and medical question retrieval. For each task, we have developed Persian annotated data sets for training and evaluation and learnt a representation for the data of each task especially complex and long medical questions. With the same architecture being used across tasks, SINA-BERT outperforms BERT-based models that were previously made available in the Persian language.

연구 동기 및 목표

  • 의료 분야에서 고급 품질의 사전 훈련된 언어 모델이 부족한 문제를 해결한다.
  • 사전 훈련을 위한 대규모이고 다양한 공식적·비공식적 페르시아어 의료 텍스트 코퍼스를 구축한다.
  • 질문 분류, 감성 분석, 질문 검색과 같은 후행 의료 NLP 작업에서의 성능을 향상시킨다.
  • 주석이 붙은 데이터셋과 공개 가능한 모델을 제공하여 향후 페르시아어 의료 텍스트 마이닝 분야의 연구를 지원한다.
  • 도메인 특화 사전 훈련이 복잡하고 긴 의료 질문의 이해에 크게 기여함을 입증한다.

제안 방법

  • 일반 도메인 페르시아어 BERT 모델인 ParsBERT의 사전 훈련된 가중치를 사용하여 Sina-BERT를 초기화한다.
  • 웹사이트, 저널, 포럼, 뉴스 자료 등에서 수집한 280만 건의 페르시아어 의료 텍스트 코퍼스를 기반으로 Sina-BERT를 사전 훈련한다.
  • 의료 질문 분류, 감성 분석, 질문 검색의 세 가지 후행 작업에 대해 작업 전용 주석이 붙은 데이터셋을 사용하여 Sina-BERT를 미세 조정한다.
  • 키워드 인식 기반 재정렬 기법을 활용한 대비 학습 접근법(Sina-BERT_kw_rcnt)을 도입하여 질문 검색 성능을 향상시킨다.
  • BERT 기반 문장 임베딩을 활용하여 검색 작업에서 의료 질문 간 의미적 유사도를 계산한다.
  • TF-IDF, UKP-DistilBERT, UKP-XLMR-paraph와 같은 기준 모델들과 문장 임베딩의 코사인 유사도를 기반으로 비교한다.

실험 결과

연구 질문

  • RQ1대규모 페르시아어 의료 코퍼스를 기반으로 사전 훈련된 BERT 기반 언어 모델이 일반 도메인 모델 대비 후행 의료 NLP 작업에서 성능 향상에 기여하는가?
  • RQ2공식적이고 비공식적인 페르시아어 의료 텍스트에 대해 도메인 특화 사전 훈련을 수행할 경우, 복잡하고 긴 의료 질문의 표현 방식에 어떤 영향을 미치는가?
  • RQ3Sina-BERT는 특히 비지도 설정에서 기존의 페르시아어 언어 모델 대비 의료 질문 검색 성능에서 어느 정도 뛰어나게 되는가?
  • RQ4의료 텍스트의 키워드 기반 특성은 TF-IDF와 같은 모델 대비 문맥 기반 임베딩의 성능에 어떤 영향을 미치는가?
  • RQ5Sina-BERT는 최소한의 작업 특화 적응만으로도 감성 분석 및 질문 분류와 같은 다양한 의료 NLP 작업에 일반화될 수 있는가?

주요 결과

  • Sina-BERT는 동의어 표현 질문 검색 데이터셋에서 68.87%의 R@1 성능을 기록하여, TF-IDF(50.00%)와 UKP-DistilBERT(36.36%)를 크게 앞서며 뛰어난 성능을 보였다.
  • 질문 분류 작업에서는 이전의 페르시아어 BERT 모델들보다 높은 F1 스코어를 기록하여, 정형 의료 텍스트 이해 능력 향상을 입증했다.
  • 의료 감성 분석 작업에서는 주석이 붙은 페르시아어 데이터셋에서 뛰어난 성능을 보였으며, 임상 텍스트 내에서 미묘한 감정 표현을 더 잘 포착함을 시사했다.
  • 질문 검색 작업에서 Sina-BERT_kw_rcnt는 모든 기준 모델을 압도했으며, 특히 노이즈가 높은 상황에서 뛰어난 성능을 보여 실생활 환경에서의 강건성을 입증했다.
  • 비지도 검색에서 성능 격차가 가장 두드러졌으며, 이는 도메인 특화 사전 훈련이 의미적 이해도 향상에 큰 기여함을 시사한다.
  • 수동 평가 결과, 키워드 겹침이 적은 경우에도 Sina-BERT가 의미적으로 유사한 질문을 성공적으로 검색함을 확인하여, 키워드 기반 모델 대비 더 뛰어난 문맥 이해 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.