[논문 리뷰] H-Index Manipulation by Merging Articles: Models, Theory, and Experiments
이 논문은 학술 논문을 전략적으로 통합함으로써 H-지수를 조작하는 데 필요한 계산 복잡도를 조사하며, 논문 간 호환성 임계값과 같은 현실적인 제약 조건을 반영하는 모델을 제안한다. 임의의 통합이 허용될 경우 H-지수 최대화 문제가 NP-난이도임을 보여주지만, 호환성 그래프의 연결 성분이 유한한 경우 선형 시간 알고리즘이 존재하며, 실험 결과는 상당한 H-지수 상승을 위해서는 유사성이 낮은 논문을 통합해야 하므로 조작이 감지 가능하다는 것을 시사한다.
An author's profile on Google Scholar consists of indexed articles and associated data, such as the number of citations and the H-index. The author is allowed to merge articles; this may affect the H-index. We analyze the (parameterized) computational complexity of maximizing the H-index using article merges. Herein, to model realistic manipulation scenarios, we define a compatibility graph whose edges correspond to plausible merges. Moreover, we consider several different measures for computing the citation count of a merged article. For the measure used by Google Scholar, we give an algorithm that maximizes the H-index in linear time if the compatibility graph has constant-size connected components. In contrast, if we allow to merge arbitrary articles (that is, for compatibility graphs that are cliques), then already increasing the H-index by one is NP-hard. Experiments on Google Scholar profiles of AI researchers show that the H-index can be manipulated substantially only if one merges articles with highly dissimilar titles.
연구 동기 및 목표
- 논문 간 호환성 및 제한된 통합 작업과 같은 제약 조건을 고려하여 실질적인 H-지수 조작을 모델링하기.
- 다양한 인용 집계 규칙과 통합 제약 조건 하에서 H-지수 최대화의 계산 복잡도 분석하기.
- AI 연구자들의 Google Scholar 프로필에서 수집한 실세계 데이터를 활용하여 H-지수 조작의 가능성과 감지 가능성 평가하기.
- 일般적인 경우에서 NP-난이도임에도 불구하고 실용적인 입력 크기에서 효율적으로 H-지수 최대화 문제를 해결할 수 있는 매개변수 기반 알고리즘 도출하기.
- 학술 지표 조작의 잠재성에 대한 경각심 제고 및 채용 및 자금 지원 결정 시 평가 관행에 영향 주기
제안 방법
- 통합된 논문에 대한 세 가지 인용 집계 모델 제안: sum-cite(인용 수 합산), union-cite(최대 인용 수), max-cite(두 값 중 최대값).
- 제목 유사도(Jaccard 지수)를 기반으로 논문 간 실질적인 통합 가능성을 반영하는 호환성 그래프 도입.
- 매개변수 기반 복잡도 이론을 적용하여 H-지수 최대화 문제 분석하고, 호환성 그래프의 연결 성분이 작을 경우 고정 매개변수로 다룰 수 있는 경우 식별.
- 다양한 제약 조건 하에서 H-지수 최대화 문제를 해결하기 위해 동적 프로그래밍 및 클리크 수열 기반 정확 알고리즘 개발.
- AI 연구자들의 Google Scholar 프로필에서 수집한 실세계 데이터를 활용하여, 다양한 호환성 임계값 하에서 통합이 H-지수에 미치는 영향 평가.
- 박스 플롯 및 통계 분석을 사용하여 다양한 호환성 임계값과 인용 집계 방법 간 H-지수 증가 비교
실험 결과
연구 질문
- RQ1어떤 조건에서 저자가 논문을 통합함으로써 H-지수를 크게 높일 수 있으며, 이러한 조작은 얼마나 감지 가능할까?
- RQ2다양한 인용 집계 규칙과 통합 제약 조건에 따라 H-지수 최대화의 계산 복잡도는 어떻게 변할까?
- RQ3제목 유사도 기반으로만 호환성 있는 논문 간 통합을 제한할 경우 H-지수 조작 가능성에 어떤 영향을 미칠까?
- RQ4호환성 그래프의 연결 성분 크기가 유한할 경우 H-지수 최대화를 위한 고정 매개변수로 다룰 수 있는 알고리즘을 개발할 수 있을까?
- RQ5AI 연구자들의 실세계 프로필은 다양한 호환성 임계값과 인용 집계 방법 하에서 통합에 어떻게 반응할까?
주요 결과
- 호환성 그래프의 연결 성분 크기가 일정할 경우 제안된 알고리즘을 사용해 선형 시간 내에 H-지수를 최대화할 수 있다.
- 임의의 통합이 허용될 경우 H-지수를 한 단계 높이는 것은 NP-난이도이므로, 제한 없이 통합이 허용될 경우 조작 위험이 크다.
- 호환성 임계값 t ≥ 0.6일 경우 샘플 저자 중 75%는 통합을 통해 H-지수를 높일 수 없으며, 이는 상당한 성과를 얻기 위해서는 매우 이질적인 논문을 통합해야 한다는 것을 의미한다.
- 세 개의 논문 통합으로 샘플 내 모든 저자의 H-지수를 최소 한 단계 이상 높일 수 있었으며, 평균적으로 연구 결과를 얻는 데 4~19개월을 절약할 수 있었다.
- sum-cite와 union-cite 모델 간 H-지수 증가 폭이 달랐으며, union-cite는 높은 호환성 임계값 하에서 더 보수적인 성과를 보였다.
- t = 0.1일 경우 어떤 알고리즘도 모든 인스턴스를 해결하지 못했으며, 이는 낮은 호환성 임계값이 조작 가능성을 심각하게 제한한다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.