[논문 리뷰] NEMO: Extraction and normalization of organization names from PubMed affiliation strings
NEMO는 PubMed 소속 문자열에서 조직명을 추출하고 정규화하기 위해 다층 규칙 매칭과 사전을 사용하는 규칙 기반 시스템이다. 이는 추출에서 98% 이상의 F-스코어를 달성하고 정규화의 정밀도가 높으며, 생물의학 논문에 대한 표준화된 조직명과 지리정치적 위치를 연결함으로써 저자 간 구분, 인용 색인 및 사회망 분석을 향상시킨다.
We propose NEMO, a system for extracting organization names in the affiliation and normalizing them to a canonical organization name. Our parsing process involves multi-layered rule matching with multiple dictionaries. The system achieves more than 98% f-score in extracting organization names. Our process of normalization that involves clustering based on local sequence alignment metrics and local learning based on finding connected components. A high precision was also observed in normalization. NEMO is the missing link in associating each biomedical paper and its authors to an organization name in its canonical form and the Geopolitical location of the organization. This research could potentially help in analyzing large social networks of organizations for landscaping a particular topic, improving performance of author disambiguation, adding weak links in the co-author network of authors, augmenting NLM's MARS system for correcting errors in OCR output of affiliation field, and automatically indexing the PubMed citations with the normalized organization name and country. Our system is available as a graphical user interface available for download along with this paper.
연구 동기 및 목표
- PubMed 소속 문자열에서 표준화된 조직명 표현의 부족을 해결하기 위해.
- 생물의학 저자들이 그들의 표준 기관 소속과 정확하게 연결되도록 개선하기 위해.
- 생물의학 분야의 사회망 분석을 향상시키기 위해 조직의 지리정보를 제공하기 위해.
- OCR 처리된 소속 필드를 위한 NLM의 MARS 시스템에서 오류 수정을 지원하기 위해.
- 정규화된 조직명과 국가 정보로 PubMed 인용문을 자동 색인화하기 위해.
제안 방법
- 비정형 소속 문자열에서 조직명을 추출하기 위해 다층 규칙 매칭과 다수의 사전을 활용하기 위해.
- 정규화 과정에서 유사한 조직명을 군집화하기 위해 局부 일치 측정 기준을 사용하기 위해.
- 정규화 결과를 개선하기 위해 연결된 성분 분석 기반 국소 학습 기법을 적용하기 위해.
- 규칙 기반 파싱과 군집화 및 학습 구성 요소를 통합하여 정확도와 내성 향상시키기 위해.
- 그래픽 사용자 인터페이스를 통한 검증 및 커뮤니티 사용을 위한 공개 배포를 통해 시스템을 검증하기 위해.
- 기존 생물의학 텍스트의 구조와 이름 패턴을 활용하여 추출 정확도 향상시키기 위해.
실험 결과
연구 질문
- RQ1어떻게 다소 변동성이 크고 노이즈가 많은 PubMed 소속 문자열에서 조직명을 신뢰성 있게 추출할 수 있는가?
- RQ2어떤 기법이 추출된 조직명을 표준 형태로 정밀하게 정규화하는 데 기여하는가?
- RQ3대규모 레이블링된 학습 데이터가 부족한 상황에서 군집화와 국소 학습이 정규화 정확도를 얼마나 향상시킬 수 있는가?
- RQ4NEMO의 접근 방식은 기존 시스템과 비교해 생물의학 소속 정보의 OCR 오류와 이름 변형을 다룰 때 어떻게 다른가?
- RQ5이 시스템은 저자 간 구분과 인용 색인과 같은 후속 응용 분야에서 효과적으로 기여할 수 있는가?
주요 결과
- NEMO는 PubMed 소속 문자열에서 조직명 추출에 대해 98% 이상의 F-스코어를 달성한다.
- 정규화 과정은 높은 정밀도를 보이며, 변형된 이름을 표준 형태로 효과적으로 매핑한다.
- 시스템은 조직을 그 지리정치적 위치와 성공적으로 연결하여 지오스페이셜 분석을 가능하게 한다.
- NEMO는 동일한 기관 소속 정보를 논문 간 일관되게 제공함으로써 저자 간 구분을 향상시킨다.
- 시스템은 공개적으로 사용 가능한 다운로드 가능한 GUI 형태로 제공되어 기존 생물의학 텍스트 처리 파이프라인에 통합될 수 있다.
- 이 방법은 MARS 시스템 맥락에서 기존 방법에 비해 OCR 오류와 이름 변형을 다루는 데에서 향상된 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.