Skip to main content
QUICK REVIEW

[논문 리뷰] Spanish Biomedical Crawled Corpus: A Large, Diverse Dataset for Spanish Biomedical Language Models

Casimiro Pio Carrino, Jordi Armengol-Estapé|arXiv (Cornell University)|2021. 09. 16.
Topic Modeling참고 문헌 8인용 수 4
한 줄 요약

이 논문은 현재까지 공개된 바이오의학 분야에서 가장 큰 스페인어 코퍼스인 CoWeSe를 소개한다. 이 코퍼스는 3,338개의 정제된 도메인에서 2,766개의 웹사이트를 통해 수집된 4.5GB의 정제된 순수 텍스트(745.7억 토큰)를 포함한다. 코퍼스는 2020년 대규모 웹 크롤링을 통해 도메인 특화 시딩과 맞춤형 전처리 파이프라인을 활용해 제작되었으며, 스페인어 언어 모델 훈련 및 의료 및 바이오의학 분야의 자연어 처리(NLP) 발전을 위해 고품질의 다양한 바이오의학 텍스트를 제공한다.

ABSTRACT

We introduce CoWeSe (the Corpus Web Salud Español), the largest Spanish biomedical corpus to date, consisting of 4.5GB (about 750M tokens) of clean plain text. CoWeSe is the result of a massive crawler on 3000 Spanish domains executed in 2020. The corpus is openly available and already preprocessed. CoWeSe is an important resource for biomedical and health NLP in Spanish and has already been employed to train domain-specific language models and to produce word embbedings. We released the CoWeSe corpus under a Creative Commons Attribution 4.0 International license, both in Zenodo (\url{https://zenodo.org/record/4561971\#.YTI5SnVKiEA}).

연구 동기 및 목표

  • NLP를 위한 대규모 고품질 스페인어 바이오의학 텍스트의 부족 문제를 해결하기 위해 종합적이고 다양한 코퍼스를 구축하는 것.
  • 기존 자원의 한계를 극복하기 위해 과학 문헌 외의 비학술적 실생활 건강 웹사이트에서 데이터를 수집하는 것.
  • 스페인어 바이오의학 및 임상 NLP 응용을 위한 도메인 특화 언어 모델과 워드 임베딩의 개발을 지원하는 것.
  • 재현 가능한 연구 및 스페인어 바이오의학 분야의 모델 훈련을 가능하게 하는 공개 가능한 전처리된 코퍼스를 제공하는 것.

제안 방법

  • 병원, 환자 단체, 공공 보건 기관 등을 포함한 10개의 건강 관련 카테고리에 속하는 3,338개의 정제된 웹사이트를 깊이 5 크롤링 전략을 사용해 크롤링했다.
  • 건강 및 바이오의학 콘텐츠와 관련성이 높은 도메인을 우선순위로 선정하였으며, 스페인의 ISCIII에서 건강 정보 자원으로 지정한 사이트도 포함되었다.
  • 의미 있는 바이오의학 텍스트를 유지하면서 비관련 형식을 제거하기 위해 단락과 헤더 HTML 태그만을 추출했다.
  • 문장 분할, 언어 식별, 중복 제거를 포함한 정제 작업을 수행하기 위해 고성능 컴퓨팅 파이프라인(50노드 클러스터)을 맞춤형으로 적용했다.
  • 표준 모델에서 낮은 신뢰도 점수를 보이는 바이오의학 스페인어를 더 잘 탐지하기 위해 언어 식별 임계치를 상향 조정했다.
  • 원본 문서 경계를 유지하고 콘텐츠 중복 제거를 적용하여 데이터 품질을 확보하고 중복을 방지했다.

실험 결과

연구 질문

  • RQ1대규모 웹 크롤링 코퍼스가 효과적인 스페인어 바이오의학 언어 모델 훈련을 위해 충분한 커버리지와 다양성을 제공할 수 있는가?
  • RQ2비학술적 실생활 건강 웹사이트에서 유래한 코퍼스가 전통적인 과학 문헌 코퍼스와 비교해 언어적 및 도메인 다양성 측면에서 어떻게 다른가?
  • RQ3고처리량 자동 전처리 파이프라인이 대규모 웹 스케일 바이오의학 데이터를 처리하면서도 텍스트 품질을 유지할 수 있는가?
  • RQ4공개 가능한 전처리된 코퍼스가 스페인어 바이오의학 NLP 도구 및 모델 개발을 가속화할 수 있는가?
  • RQ5저자원 환경에서 바이오의학 스페인어 탐지 정확도에 언어 식별 튜닝이 미치는 영향은 어느 정도인가?

주요 결과

  • CoWeSe 코퍼스는 158만 개의 문서와 3,277만 개의 문장에서 유래한 4.5GB의 정제된 순수 텍스트로, 총 745.7억 토큰을 포함한다.
  • 코퍼스는 병원, 환자 단체, 공공 보건 기관 등을 포함한 다양한 건강 도메인에서 온 2,766개의 웹사이트에서 유래했다.
  • 전처리 파이프라인을 통해 원시 WARC 데이터(905GB)를 중복 제거 및 노이즈 필터링을 통해 깔끔하고 사용 가능한 코퍼스 4.5GB로 줄였다.
  • 코퍼스는 스페인어, 카탈로니아어, 갈리시아어, 바스크어를 포함하여 스페인의 다국어 건강 정보를 반영한다.
  • 코퍼스는 크리에이티브 커먼즈 저작자표시 4.0 국제 라이선스 하에 배포되어 공개 접근성과 재사용 가능성을 보장한다.
  • 이미 도메인 특화 언어 모델 훈련과 워드 임베딩 생성에 사용되어 스페인어 바이오의학 NLP 분야에서의 유용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.