[논문 리뷰] Journal Impact Factor and Peer Review Thoroughness and Helpfulness: A Supervised Machine Learning Study
이 연구는 의료 및 생명과학 분야 저널 1,644권의 187,240개의 동료 평가 문장을 분석하기 위해 지도 학습 기반 기계 학습을 사용하며, 이를 저널 영향력 지수(JIF) 10등분과 연관지었다. 분석 결과, 높은 JIF 저널은 더 많은 방법론적 세부 정보를 포함한 평가를 하지만, 제안이나 사례 수준의 도움이 되는 피드백은 적어 JIF가 개별 논문 평가 품질을 예측하는 데는 약한 지표임을 시사한다. 이는 내용 분포의 미미한 차이에도 불구하고 여전히 품질 예측에 한계가 있음을 의미한다.
The journal impact factor (JIF) is often equated with journal quality and the quality of the peer review of the papers submitted to the journal. We examined the association between the content of peer review and JIF by analysing 10,000 peer review reports submitted to 1,644 medical and life sciences journals. Two researchers hand-coded a random sample of 2,000 sentences. We then trained machine learning models to classify all 187,240 sentences as contributing or not contributing to content categories. We examined the association between ten groups of journals defined by JIF deciles and the content of peer reviews using linear mixed-effects models, adjusting for the length of the review. The JIF ranged from 0.21 to 74.70. The length of peer reviews increased from the lowest (median number of words 185) to the JIF group (387 words). The proportion of sentences allocated to different content categories varied widely, even within JIF groups. For thoroughness, sentences on 'Materials and Methods' were more common in the highest JIF journals than in the lowest JIF group (difference of 7.8 percentage points; 95% CI 4.9 to 10.7%). The trend for 'Presentation and Reporting' went in the opposite direction, with the highest JIF journals giving less emphasis to such content (difference -8.9%; 95% CI -11.3 to -6.5%). For helpfulness, reviews for higher JIF journals devoted less attention to 'Suggestion and Solution' and provided fewer Examples than lower impact factor journals. No, or only small differences were evident for other content categories. In conclusion, peer review in journals with higher JIF tends to be more thorough in discussing the methods used but less helpful in terms of suggesting solutions and providing examples. Differences were modest and variability high, indicating that the JIF is a bad predictor for the quality of peer review of an individual manuscript.
연구 동기 및 목표
- 의료 및 생명과학 분야 저널에서 영향력 지수(JIF)가 동료 평가의 철저함과 유용성과 관련이 있는지 조사하기.
- 대규모 평가 보고서 데이터셋을 기반으로 지도 학습을 활용해 동료 평가 내용을 표준화된 카테고리로 분류하기.
- 높은 JIF 저널이 낮은 JIF 저널보다 더 포괄적이거나 더 구조적인 피드백을 제공하는지 평가하기.
- 평가 내용의 다양성에 비추어 볼 때, JIF가 개별 논문 평가 품질을 예측하는 데 얼마나 유용한지 평가하기.
제안 방법
- 두 연구자가 수작업으로 10,000개의 동료 평가 보고서에서 무작위로 선정한 2,000개 문장을 10개의 내용 카테고리로 분류했다.
- 나머지 187,240개 문장에 대해 높은 정확도로 이 카테고리를 분류할 수 있도록 지도 학습 모델을 훈련시켰다.
- 평가 길이를 보정한 후, JIF 10등분과 내용 분포 간의 연관성을 분석하기 위해 선형 혼합 효과 모델을 사용했다.
- 내용 카테고리로는 '재료 및 방법', '제안 및 해결책', '예시', '표현 및 보고 방식' 등이 포함되었으며, 주로 철저함과 유용성 지표를 중심으로 분석했다.
- 저널을 10개의 JIF 10등분으로 나누어, 영향력 수준 간 평가 내용을 비교할 수 있도록 하였다.
실험 결과
연구 질문
- RQ1저널 영향력 지수와 평가의 철저함, 특히 방법 및 보고에 대한 논의와의 유의미한 연관성이 있는가?
- RQ2높은 영향력 지수 저널은 향상 제안이나 구체적 사례와 같은 더 많은 도움이 되는 피드백을 제공하는가?
- RQ3다른 영향력 수준의 저널 간에 동료 평가 내용의 분포는 어떻게 달라지며, 이러한 패턴은 얼마나 일관성 있는가?
- RQ4저널 영향력 지수가 개별 논문 평가 품질을 예측하는 데 얼마나 유용한가?
주요 결과
- 최고 JIF 저널의 평가에서 '재료 및 방법'에 대한 내용 비율이 최저 JIF 그룹보다 7.8%p 높았다 (95% 신뢰구간 4.9에서 10.7%p).
- 최고 JIF 저널은 최저 JIF 그룹보다 '표현 및 보고 방식'에 대해 8.9%p 더 적은 비중을 할애했다 (95% 신뢰구간 -11.3에서 -6.5%p).
- 높은 JIF 저널은 낮은 JIF 저널에 비해 '제안 및 해결책' 관련 의견과 '예시' 수가 유의미하게 적어, 피드백의 유용성이 떨어지는 것으로 나타났다.
- 다른 JIF 그룹 내에서도 대부분의 내용 카테고리에서 문장 비율의 변동 폭이 커, 그룹 내 변동성이 높음을 보여주었다.
- '명료성 및 언어' 또는 '윤리적 고려사항'과 같은 다른 카테고리에서는 유의미한 차이를 관찰하지 못했다.
- 종합적으로 이 연구는 JIF가 개별 논문 평가 품질을 예측하는 데에 매우 부적절한 지표임을 결론 내렸다. 이는 효과 크기가 미미하고 평가 내용의 변동성이 높기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.