Skip to main content
QUICK REVIEW

[論文レビュー] NEMO: Extraction and normalization of organization names from PubMed affiliation strings

Siddhartha Jonnalagadda, Philip Topham|arXiv (Cornell University)|Jul 28, 2011
Biomedical Text Mining and Ontologies被引用数 16
ひとこと要約

NEMO は、多層的なルールマッチングと辞書を用いて、PubMed の所属情報文字列から組織名を抽出・正規化するルールベースのシステムであり、抽出で98%を超える F スコア、正規化で高い正確性を達成している。このシステムにより、標準化された組織名と地理的場所が生物医学論文に関連付けられ、著者の識別、引用索引、社会的ネットワーク解析の向上が可能になる。

ABSTRACT

We propose NEMO, a system for extracting organization names in the affiliation and normalizing them to a canonical organization name. Our parsing process involves multi-layered rule matching with multiple dictionaries. The system achieves more than 98% f-score in extracting organization names. Our process of normalization that involves clustering based on local sequence alignment metrics and local learning based on finding connected components. A high precision was also observed in normalization. NEMO is the missing link in associating each biomedical paper and its authors to an organization name in its canonical form and the Geopolitical location of the organization. This research could potentially help in analyzing large social networks of organizations for landscaping a particular topic, improving performance of author disambiguation, adding weak links in the co-author network of authors, augmenting NLM's MARS system for correcting errors in OCR output of affiliation field, and automatically indexing the PubMed citations with the normalized organization name and country. Our system is available as a graphical user interface available for download along with this paper.

研究の動機と目的

  • PubMed 所属情報文字列における標準化された組織名表現の欠如に対処すること。
  • 生物医学分野の著者がその標準的機関所属に正確に関連付けられるようにすること。
  • 組織の位置特定を可能にすることで、生物医学分野における社会的ネットワーク解析を強化すること。
  • OCR 処理された所属フィールドを対象とする NLM の MARS システムにおける誤り訂正を支援すること。
  • 正規化された組織名と国を自動的にインデックス化することで、PubMed の引用をインデックス化すること。

提案手法

  • 非構造化された所属文字列から組織名を抽出するために、複数の辞書を用いた多層的なルールマッチングを採用する。
  • 正規化の過程で類似した組織名をクラスタリングするために、局所的なシーケンスアラインメント指標を用いる。
  • 連結成分解析に基づく局所的学習技術を適用して、正規化結果を精緻化する。
  • ルールベースのパーサーとクラスタリング・学習のコンポonentを統合することで、耐障害性と正確性を向上させる。
  • グラフィカルユーザーインターフェースを用いた検証とコミュニティ利用を想定した公開によるシステムの検証。
  • 既存の生物医学テキスト構造と命名パターンを活用することで、抽出の正確性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、多様でノイズの多い PubMed 所属文字列から組織名を信頼性高く抽出できるか?
  • RQ2どのような技術が、抽出された組織名を標準形に高精度に正規化可能にするか?
  • RQ3大規模なラベル付き学習データが不足する状況下でも、クラスタリングと局所的学習が正規化の正確性をどの程度向上できるか?
  • RQ4NEMO のアプローチは、既存のシステムと比較して、生物医学的所属情報における OCR エラーと名前表記のばらつきをどの程度効果的に処理できるか?
  • RQ5このシステムは、著者識別や引用索引といった後続の応用を効果的に支援できるか?

主な発見

  • NEMO は、PubMed 所属文字列からの組織名抽出において、98%を超える F スコアを達成している。
  • 正規化プロセスは高い正確性を示し、表記のばらつきを標準形に効果的にマッピングしている。
  • システムは組織をその地理的場所と効果的に関連付け、地理空間的解析を可能にしている。
  • NEMO は、論文間で一貫した機関所属情報を提供することで、著者の識別を向上させている。
  • システムは、ダウンロード可能な GUI として公開されており、既存の生物医学テキスト処理パイプラインへの統合を支援している。
  • MARS システムの文脈において、既存の手法に比べて OCR エラーと名前表記のばらつきの処理を改善している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。