[論文レビュー] Scholar Name Disambiguation with Search-enhanced LLM Across Language
本論文は、検索エンジンを活用して多言語情報の取得と大規模言語モデル(LLM)の推論を強化することで、多言語の研究者名の曖昧性解消を実現する検索強化型LLMアプローチを提案する。中国語、英語、機関情報の統合により、プロファイルマッチングの再現率が89%に達し、特に英語以外の言語で発表する研究者に対して、単一言語や単一情報源戦略を著しく上回る性能を発揮する。
The task of scholar name disambiguation is crucial in various real-world scenarios, including bibliometric-based candidate evaluation for awards, application material anti-fraud measures, and more. Despite significant advancements, current methods face limitations due to the complexity of heterogeneous data, often necessitating extensive human intervention. This paper proposes a novel approach by leveraging search-enhanced language models across multiple languages to improve name disambiguation. By utilizing the powerful query rewriting, intent recognition, and data indexing capabilities of search engines, our method can gather richer information for distinguishing between entities and extracting profiles, resulting in a more comprehensive data dimension. Given the strong cross-language capabilities of large language models(LLMs), optimizing enhanced retrieval methods with this technology offers substantial potential for high-efficiency information retrieval and utilization. Our experiments demonstrate that incorporating local languages significantly enhances disambiguation performance, particularly for scholars from diverse geographic regions. This multi-lingual, search-enhanced methodology offers a promising direction for more efficient and accurate active scholar name disambiguation.
研究の動機と目的
- 人為的介入に大きく依存する既存の名前曖昧性解消手法が、多言語的・多様なデータに対して困難を抱えるという問題を解決すること。
- 特に英語以外の言語で発表する研究者を含め、多様な地理的・言語的背景を持つ研究者の曖昧性解消の正確性を向上させること。
- 検索エンジンと多言語LLMを活用し、クロスリンガルで最新で文脈に即した情報を含む研究者プロファイルを拡充すること。
- 強化された取得とLLM推論を用いた自動プロファイル構築とマッチングにより、手動アノテーションへの依存を低減すること。
- ローカル言語データ(例:中国語)と機関・連絡先情報の組み合わせが、曖昧性解消の再現率を最大化するのに最適であるかを検証すること。
提案手法
- 本手法は、GPT4o や Llama3.2 などのモデルの言語理解力と、外部検索エンジンによるリアルタイムデータ取得を統合した検索強化型LLMを採用する。
- 名前の変種(例:ピンイン)、機関所属、連絡先、多言語での研究キーワードを用いて、多次元的かつ包括的な研究者プロファイルを構築する。
- Webソース(論文、履歴書、機関ページなど)から自動的に抽出・正規化されたプロファイルデータを処理するパイプラインを構築する。
- ピンイン、中国語、英語の名前変種を、意味的埋め込みとLLMベースの正規化により一致させる。
- 研究者同士の比較にはスコアリングシステムを採用:機関一致で2点、繰り返しの研究・教育経歴で3点、キーワード関連性で1~4点を付与し、同一人物と判断するための閾値は7点とする。
- 検索クエリを統合し、1人あたり最大100件の関連文書を取得。その後、LLMがそれらを要約・比較し、人物の同一性を推論する。

実験結果
リサーチクエスチョン
- RQ1ローカル言語データ(例:中国語)を組み込むことで、研究者名の曖昧性解消における再現率と正確性にどのような影響を与えるか?
- RQ2標準的なLLM(メタデータのみ)と比較して、検索強化型LLMは曖昧性解消性能をどの程度向上できるか?
- RQ3検索取得によるクロスリンガルプロファイル拡充により、人為的介入を伴う曖昧性解消の必要性はどの程度低減できるか?
- RQ4名前、機関、連絡先情報などのデータソースをどのように組み合わせれば、曖昧性解消の再現率を最大化できるか?
- RQ5提示されたスコアリングベースの比較手法は、類似したプロファイルを持つ研究者を区別するのにどの程度有効か?
主な発見
- ピンイン、中国語の機関、連絡先情報を組み合わせた結果、再現率が89%に達し、他の戦略を著しく上回った。
- 中国語の機関情報のみを用いた場合、英語のみのケース(再現率18%)から再現率63%に向上し、ローカル言語データの価値が顕著に示された。
- 連絡先情報が含まれた場合に最高の再現率(89%)が達成されたことから、その情報が強い識別力を持つことが示された。
- 7点の閾値を設けたスコアリングシステムは、人為評価でも100%の正確性を達成し、信頼性が裏付けられた。
- 検索強化型LLMの統合により、手動による曖昧性解消への依存が低下し、多様な情報源からの自動的かつ包括的なプロファイル構築が可能になった。
- 中国語の研究者に対して優れた性能を示し、英語のみの曽見性解消システムでしばしば無視されがちな研究者層にも効果を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。