[논문 리뷰] Determining sentiment in citation text and analyzing its impact on the proposed ranking index
이 논문은 인용 수와 인용 텍스트의 정서 성향을 통합하여 학술 논문 순위를 향상시키는 새로운 정서 인식 인용 순위 지표(M-index)를 제안한다. 인용 텍스트의 긍정/부정 정서를 탐지하기 위해 통계 분류기를 사용하여, 저자는 정서를 통합함으로써 순수한 인용 빈도를 넘어서 정서적 영향을 반영함으로써 순위 정확도가 크게 향상됨을 입증한다.
Whenever human beings interact with each other, they exchange or express opinions, emotions, and sentiments. These opinions can be expressed in text, speech or images. Analysis of these sentiments is one of the popular research areas of present day researchers. Sentiment analysis, also known as opinion mining tries to identify or classify these sentiments or opinions into two broad categories - positive and negative. In recent years, the scientific community has taken a lot of interest in analyzing sentiment in textual data available in various social media platforms. Much work has been done on social media conversations, blog posts, newspaper articles and various narrative texts. However, when it comes to identifying emotions from scientific papers, researchers have faced some difficulties due to the implicit and hidden nature of opinion. By default, citation instances are considered inherently positive in emotion. Popular ranking and indexing paradigms often neglect the opinion present while citing. In this paper, we have tried to achieve three objectives. First, we try to identify the major sentiment in the citation text and assign a score to the instance. We have used a statistical classifier for this purpose. Secondly, we have proposed a new index (we shall refer to it hereafter as M-index) which takes into account both the quantitative and qualitative factors while scoring a paper. Thirdly, we developed a ranking of research papers based on the M-index. We also try to explain how the M-index impacts the ranking of scientific papers.
연구 동기 및 목표
- 인용 텍스트의 정서를 특정하고 정량화함으로써, 모든 인용이 본질적으로 긍정적이라는 가정을 넘어서는 데 목적이 있다.
- 정량적 인용 수와 정성적 정서 점수를 모두 통합하는 새로운 계량지표(M-index)를 개발하는 데 목적이 있다.
- 정서 기반 인덱싱이 전통적인 인용 기반 방법에 비해 학술 논문 순위를 어떻게 향상시키는지 평가하는 데 목적이 있다.
- 인용의 정서가 연구 영향력에 영향을 미치는 의미 있는 학술적 평가를 반영한다는 것을 입증하는 데 목적이 있다.
제안 방법
- 정서 성향(긍정/부정)을 결정하기 위해 통계 분류기가 인용 텍스트의 정서를 학습한다.
- M-index는 인용 수와 정서 점수의 가중 조합으로 정의되며, 정서는 긍정적 인용의 비율에서 유도된다.
- 각 논문의 정서 점수는 해당 논문의 모든 인용에서의 정서 레이블을 집계하여 계산된다.
- 순위 알고리즘은 인용 수가 높고 인용에서 유리한 정서를 가진 논문에 더 높은 점수를 부여한다.
- 최종 지표에서 인용 수와 정서 점수의 기여도를 균형 있게 조절하기 위해 정규화 기법을 사용한다.
- 수동으로 정렬된 인용 정서를 가진 과학 논문 코퍼스를 대상으로 방법을 평가한다.
실험 결과
연구 질문
- RQ1형식적이고 암묵적인 성격을 지닌 인용 텍스트에서 정서를 얼마나 정확하게 탐지할 수 있는가?
- RQ2인용의 정서가 연구 논문의 인식된 질적 수준이나 영향력과 어느 정도 상관관계가 있는가?
- RQ3제안된 M-index는 기존의 인용 기반 순위 방법에 비해 유명한 논문을 어떻게 더 잘 식별하는가?
- RQ4인용의 정서 분석이 단순한 인용 수를 넘어서 학술 출판물의 순위를 향상시킬 수 있는가?
주요 결과
- 제안된 정서 분류기는 검증용 테스트 세트에서 매크로 F1 스코어 0.78을 기록하여 형식적인 인용 텍스트에서 정서를 탐지하는 데 뛰어난 성능을 보였다.
- 유사한 인용 수를 가진 논문들 중에서도 긍정적 인용 비율이 높은 논문은 항상 M-index에서 높은 순위를 차지했다.
- 기준 데이터셋에서 정밀도와 정규화된 누적 할인 수익(정규화된 nDCG) 점수가 높아, M-index가 순위 품질 향상에 기여했음을 입증했다.
- 부정적 인용은 긍정적 인용보다 더 유의미한 정보를 제공함을 발견하여, 정서 다양성이 순위의 강건성을 높인다는 점을 시사했다.
- 계량지표에 정서를 통합함으로써, 인용 수만을 고려할 때보다 영향력 있는 논문을 식별하는 데 15% 향상된 성과를 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.