Skip to main content
QUICK REVIEW

[論文レビュー] H-Index Manipulation by Merging Articles: Models, Theory, and Experiments

René van Bevern, Christian Komusiewicz|Dec 17, 2014
Data Management and Algorithms参考文献 20被引用数 5
ひとこと要約

本稿は、学術論文の戦略的統合によるHインデックスの操作の計算量的複雑性を調査し、論文間の適合性閾値などの現実的な制約を反映するモデルを提案する。任意の統合が許可される場合、Hインデックスの最大化はNP困難であるが、適合性グラフの連結成分が有界である場合には線形時間で効率的なアルゴリズムが存在することを示している。実験では、顕著なHインデックスの上昇を得るには、類似性の低い論文の統合が必要であり、操作が検出可能であることが明らかになった。

ABSTRACT

An author's profile on Google Scholar consists of indexed articles and associated data, such as the number of citations and the H-index. The author is allowed to merge articles; this may affect the H-index. We analyze the (parameterized) computational complexity of maximizing the H-index using article merges. Herein, to model realistic manipulation scenarios, we define a compatibility graph whose edges correspond to plausible merges. Moreover, we consider several different measures for computing the citation count of a merged article. For the measure used by Google Scholar, we give an algorithm that maximizes the H-index in linear time if the compatibility graph has constant-size connected components. In contrast, if we allow to merge arbitrary articles (that is, for compatibility graphs that are cliques), then already increasing the H-index by one is NP-hard. Experiments on Google Scholar profiles of AI researchers show that the H-index can be manipulated substantially only if one merges articles with highly dissimilar titles.

研究の動機と目的

  • 論文の適合性や限定的な統合操作といった制約を考慮した、現実的なHインデックス操作のモデル化。
  • さまざまなキャシネーション集約ルールと統合制約下でのHインデックス最大化の計算量的複雑性の分析。
  • AI研究者のGoogle Scholarプロフィールからの現実世界のデータを用いて、Hインデックス操作の可能性と検出可能性の評価。
  • 一般にはNP困難であるが、現実的な入力サイズにおいても効率的に解けるパラメータ化されたアルゴリズムの同定。
  • 学術的指標における操作の可能性についての認識を高め、採用および助成金決定における評価手法に影響を与えること。

提案手法

  • 統合された論文のための3つのキャシネーション集約モデルを提案:sum-cite(キャシネーションを加算)、union-cite(最大キャシネーション)、max-cite(2つのうちの最大値)。
  • タイトル類似度(ジャカード係数)に基づき、論文間の妥当な統合を表す適合性グラフを導入。
  • パラメータ化された計算量理論を用いてHインデックス最大化問題を分析し、適合性グラフの連結成分が小さい場合に固定パラメータで実行可能なケースを同定。
  • 動的計画法およびクリーク列挙を用いた正確なアルゴリズムを開発し、さまざまな制約下でのHインデックス最大化問題を解く。
  • AI研究者のGoogle Scholarプロフィールから得た現実世界のデータを用い、さまざまな適合性閾値下での統合がHインデックスに与える影響を評価。
  • ボックスプロットおよび統計的分析を用いて、さまざまな適合性閾値およびキャシネーション集約手法におけるHインデックス上昇の比較を行った。

実験結果

リサーチクエスチョン

  • RQ1どのような条件下で著者が論文を統合することでHインデックスを著しく向上させられ、その操作はどの程度検出可能か?
  • RQ2さまざまなキャシネーション集約ルールと統合制約下でのHインデックス最大化の計算量的複雑性はどのように変化するか?
  • RQ3タイトル類似度に基づく適合性に限定して統合を行う場合、Hインデックス操作の可能性にどのような影響を与えるか?
  • RQ4適合性グラフの連結成分のサイズが有界である場合に、Hインデックス最大化のための固定パラメータで実行可能なアルゴリズムを開発できるか?
  • RQ5AI研究者の現実世界のプロフィールは、さまざまな適合性閾値およびキャシネーション集約手法下で、統合に対してどのように反応するか?

主な発見

  • 適合性グラフの連結成分が定数サイズである場合、提案されたアルゴリズムにより線形時間でHインデックスを最大化できる。
  • 任意の統合が許可される場合、Hインデックスを1つ増やすことはNP困難であるため、制限のない統合は操作の重大なリスクを伴う。
  • 適合性閾値t ≥ 0.6の場合、サンプル著者の75%は統合によってHインデックスを向上させることができず、顕著な上昇を得るには著しく類似性の低い論文の統合が必要であることを示唆している。
  • 3つの論文統合で、サンプルに含まれる全著者のHインデックスを少なくとも1つ上昇させることができ、平均して4〜19か月分の研究出力が節約された。
  • sum-citeとunion-citeモデルではHインデックス上昇に差が生じ、特に高い適合性閾値下ではunion-citeがより慎重な上昇を示した。
  • t = 0.1の場合はどのアルゴリズムでもすべてのインスタンスを解けなかったため、低適合性閾値では操作の可能性が著しく制限されることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。