[논문 리뷰] Comprehensive Named Entity Recognition on CORD-19 with Distant or Weak Supervision
CORD-NER는 distantly and weakly supervised methods를 사용하여 CORD-19 코퍼스에 대해 포괄적 75-type NER 데이터셋을 생성하고, 주요 생물의학 타입에서 SciSpacy를 능가하며 새로운 문서와 엔티티 타입의 점진적 추가를 가능하게 한다.
We created this CORD-NER dataset with comprehensive named entity recognition (NER) on the COVID-19 Open Research Dataset Challenge (CORD-19) corpus (2020-03-13). This CORD-NER dataset covers 75 fine-grained entity types: In addition to the common biomedical entity types (e.g., genes, chemicals and diseases), it covers many new entity types related explicitly to the COVID-19 studies (e.g., coronaviruses, viral proteins, evolution, materials, substrates and immune responses), which may benefit research on COVID-19 related virus, spreading mechanisms, and potential vaccines. CORD-NER annotation is a combination of four sources with different NER methods. The quality of CORD-NER annotation surpasses SciSpacy (over 10% higher on the F1 score based on a sample set of documents), a fully supervised BioNER tool. Moreover, CORD-NER supports incrementally adding new documents as well as adding new entity types when needed by adding dozens of seeds as the input examples. We will constantly update CORD-NER based on the incremental updates of the CORD-19 corpus and the improvement of our system.
연구 동기 및 목표
- 광범위한 수작업 주석 없이 COVID-19 관련 콘텐츠에 대해 빠르게 적응 가능한 NER의 필요성을 해결한다.
- COVID-19 특이 타입을 포함한 CORD-19 코퍼스용 포괄적 75-type NER 스키마를 생성한다.
- 주석 품질을 극대화하기 위해 여러 NER 소스와 감독 신호를 결합한다.
- 시드 기반 지침으로 새로운 문서와 새로운 엔티티 타입의 점진적 추가를 가능하게 한다.
제안 방법
- 메타데이터를 전체 텍스트와 병합하고 AutoPhrase로 토큰화한 후 Spacy를 거쳐 29,500 CORD-19 문서에서 CORD-NER 코퍼스를 구성한다.
- 네 가지 NER 소스를 융합한다: (i) Spacy의 사전 학습 일반 NER, (ii) SciSpacy의 사전 학습 생의학 NER, (iii) 지식 베이스로 UMLS를 사용하는 KB-guided distantly supervised NER, (iv) seed 확장을 통한 COVID-19 특이 타입의 seed-guided weakly supervised NER.
- 네 소스의 엔티티 타입을 정렬하고 하나의 75항목 CORD-NER 계층 구조로 구성한다(SciSpacy 타입을 UMLS로 매핑하고 말뭉치 관련성을 위해 가지치기).
- 네 가지 방법으로 75개 유형 전체에 대해 NER 주석을 수행한 다음, 방법 기반 주석 품질을 우선시하는 충돌 해결로 결과를 병합한다.
- 메타데이터, 말뭉치, NER 결과를 포함하는 consolidated outputs(CORD-NER.json and CORD-NER-full.json)을 산출하고 말뭉치와 타입의 점진적 업데이트를 지원한다.
실험 결과
연구 질문
- RQ1제안된 CORD-NER 시스템이 일반 생물 의학 엔티티 타입(유전자, 화학 물질, 질병)에 대해 기존 NER 도구와 비교하여 얼마나 잘 작동하는가?
- RQ2distantly supervised 및 seed-guided weak supervision이 최소한의 인간 라벨링으로 COVID-19–특이 엔티티 타입을 효과적으로 인식할 수 있는가?
- RQ3AutoPhrase-preserved 구문 구조를 도입하면 CORD-19에서 distant/weak supervision NER 성능이 향상되는가?
- RQ4한정된 시드 예제로 새로운 문서와 새로운 엔티티 타입을 추가하여 점진적 업데이트를 수행할 수 있는가?
- RQ5다운스트림 COVID-19 텍스트 마이닝 작업에 대해 CORD-NER가 제공하는 질적 이점은 무엇인가?
주요 결과
- CORD-NER는 화학 엔티티 유형과 질병 엔티티 유형에서 SciSpacy를 F1 점수 면에서 상당한 차이로 능가합니다(그들의 평가 표본에서 10% 이상).
- 이 시스템은 표준 생의학 타입을 넘어 COVID-19–특이 개념들(예: coronavirus들, 바이럴 단백질, 면역 반응)을 인식하게 한다.
- 이 접근 방식은 NER 모델을 위한 인간 주석 학습 데이터가 필요 없이 distantly supervised 및 seed-guided weak supervision으로 작동할 수 있다.
- CAND-NER은 보고된 비교에서 일부 완전 감독 베이스라인보다 대상 유형에 대해 더 높은 재현율/정밀도 트레이드오프를 보인다.
- 이 프레임워크는 수십 개의 seed 예시를 제공하여 문서의 점진적 추가와 새로운 엔티티 타입의 추가를 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.