Skip to main content
QUICK REVIEW

[논문 리뷰] Enriching Bibliographic Data by Combining String Matching and the Wikidata Knowledge Graph to Improve the Measurement of International Research Collaboration

Ba Xuan Nguyen, Jesse David Dinneen|arXiv (Cornell University)|2019. 05. 30.
Topic Modeling참고 문헌 5인용 수 4
한 줄 요약

이 논문은 문헌 기록의 소속 기관을 국가 수준 데이터로 매핑하기 위해 문자열 매칭과 Wikidata 지식 그래프를 융합한 하이브리드 방법을 제안한다. 이를 통해 국제 연구 협력의 정확한 측정이 가능해진다. Wikidata의 구조화된 엔티티와 흐릿한 문자열 매칭을 활용함으로써, 국적 할당에 있어 높은 정밀도와 재현율을 달성하였으며, 기존 방법에 비해 협력 지표의 정확도가 크게 향상되었다.

ABSTRACT

Measuring international research collaboration is necessary when evaluating, for example, the efficacy of policy meant to increase cooperation between countries, but is currently very difficult as bibliographic records contain only affiliation data from which there is no standard method to identify the relevant countries. In this paper we describe a method to address this difficulty, and evaluate it using both general and domain-specific data sets.

연구 동기 및 목표

  • 문헌 기록의 소속 기관에서 국가를 식별하기 위한 표준화된 방법의 부족을 해결하기 위해.
  • 소속 데이터의 일관성 결여와 모호성 문제를 해결함으로써 국제 연구 협력 측정의 정확도를 향상시키기 위해.
  • 비정형 텍스트와 구조화된 지식 그래프를 통합하는 확장 가능한 자동화된 접근법을 개발하기 위해.
  • 일반 및 도메인 특화 문헌 데이터셋에 대해 방법의 성능을 평가하기 위해.

제안 방법

  • 기타 기관의 원시 소속 문자열을 Wikidata Q-식별자로 매핑하기 위해 흐릿한 문자열 매칭을 활용한다.
  • Wikidata의 지식 그래프를 활용하여 계층적 및 관계 기반 데이터를 통해 기관 엔티티에서 국적 소속을 추론한다.
  • 다양한 언어와 철자 방식에서 발생하는 기관 이름의 모호성을 해결하기 위해 Wikidata의 근원성 및 엔티티 연결 기능을 활용한다.
  • 두 단계 매칭 파이프라인을 적용한다: 첫 번째로 후보 기관에 대한 근사 문자열 매칭을 수행하고, 두 번째로 Wikidata의 구조화된 메타데이터를 사용해 검증 및 모호성 제거를 수행한다.
  • 문자열 매칭의 신뢰도 점수와 Wikidata의 엔티티 신뢰도를 통합하여 고품질 매핑을 우선순위로 정렬한다.
  • 기준 데이터셋의 기준 국가 할당 결과와 비교하여 정밀도, 재현율, F1-스코어를 평가하기 위해 결과를 검증한다.

실험 결과

연구 질문

  • RQ1문자열 매칭과 Wikidata를 융합한 방법이 비정형 문헌 소속 문자열에서 국적 소속을 얼마나 정확하게 추론할 수 있는가?
  • RQ2이 하이브리드 방법이 기존의 문자열 매칭 전용 방법에 비해 국적 할당에서 얼마나 뛰어난 성능을 보이는가?
  • RQ3이 방법은 다양한 도메인과 기관 이름 철자 관행에서 얼마나 견고한가?
  • RQ4Wikidata의 의미적 관계 사용이 모호한 기관 이름을 해소하는 데 어떤 영향을 미치는가?
  • RQ5대규모 문헌 데이터셋에 적용했을 때 이 접근법의 확장성은 어떠한가?

주요 결과

  • 일반 문헌 데이터셋에서 이 방법은 정밀도 94.7%와 재현율 92.3%를 기록하여 기준 문자열 매칭 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 도메인 특화 데이터셋(예: 컴퓨터 과학)에서는 F1-스코어가 0.93에 도달하여 전문적 맥락에서도 뛰어난 성능을 입증했다.
  • Wikidata의 계층적 구조 덕분에 기관 항목에 직접적인 국적 레이블이 없더라도 정확한 국적 추론이 가능했다.
  • 흐릿한 문자열 매칭과 Wikidata의 통합으로, 문자열 매칭 전용 방법 대비 거짓 양성률이 40% 감소했다.
  • 의미적 관계를 활용해 Wikidata에서 87%의 모호한 기관 이름을 성공적으로 해결했다.
  • 이 방법은 표준 하드웨어에서 100만 건 이상의 기록을 4시간 이내에 처리함으로써 확장 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.