Skip to main content
QUICK REVIEW

[논문 리뷰] Article citation study: Context enhanced citation sentiment detection

Vishal Vyas, Kumar Ravi|arXiv (Cornell University)|2020. 05. 10.
Topic Modeling참고 문헌 28인용 수 4
한 줄 요약

이 논문은 어휘 임bedding, 품사 태그, 의존 구문 분석에서 유도된 앙상블 특징을 사용하여 맥락을 고려한 인용 감성 분석 방법을 제안한다. 실험 결과, 대규모 데이터셋에서는 딥 러닝 모델이 전통적인 Bag-of-Words보다 성능이 뛰어나며, 소규모 데이터셋에서는 서포트 벡터 머신(SVM)이 더 우수한 성능을 보였다. 또한 맥락을 고려한 샘플은 맥락을 고려하지 않은 접근 방식보다 여덟 개의 수동으로 주석 처리된 데이터셋(세 가지 감성 극성)에서 유의미하게 성능 향상을 이끌어냈다.

ABSTRACT

Citation sentimet analysis is one of the little studied tasks for scientometric analysis. For citation analysis, we developed eight datasets comprising citation sentences, which are manually annotated by us into three sentiment polarities viz. positive, negative, and neutral. Among eight datasets, three were developed by considering the whole context of citations. Furthermore, we proposed an ensembled feature engineering method comprising word embeddings obtained for texts, parts-of-speech tags, and dependency relationships together. Ensembled features were considered as input to deep learning based approaches for citation sentiment classification, which is in turn compared with Bag-of-Words approach. Experimental results demonstrate that deep learning is useful for higher number of samples, whereas support vector machine is the winner for smaller number of samples. Moreover, context-based samples are proved to be more effective than context-less samples for citation sentiment analysis.

연구 동기 및 목표

  • 과학적 인용 분석 분야에서 다루지 않은 바가 많은 인용 감성 분석 작업을 해결하기 위해.
  • 세 가지 감성 극성(긍정, 부정, 중립)을 가진 여덟 개의 수동으로 주석 처리된 인용 데이터셋을 구축하기 위해.
  • 맥락 정보가 인용 감성 분류 성능에 미치는 영향을 조사하기 위해.
  • 딥 러닝과 전통적인 기계 학습(예: SVM) 접근 방식을 인용 감성 분류에 대해 비교하기 위해.
  • 어휘 임bedding, 품사 태그, 의존 구문 분석을 조합한 앙상블 특징의 효과를 평가하기 위해.

제안 방법

  • 저자는 여덟 개의 인용 감성 분류 데이터셋을 구축하였으며, 그 중 세 개는 전체 맥락 정보를 포함하여 주석 처리되었다.
  • 사전에 학습된 어휘 임bedding, 품사 태그(POS), 의존 구문 관계를 조합한 앙상블 특징을 추출하였다.
  • 이 특징들은 딥 러닝 모델(예: BiLSTM, CNN)의 입력으로 사용되었으며, Bag-of-Words 기준선과 비교되었다.
  • 감성 분류 작업은 딥 러닝 모델과 전통적인 기계 학습 모델(예: SVM)을 모두 사용하여 훈련 및 평가되었다.
  • 다양한 데이터셋 크기와 맥락 가용성 조건에서 성능을 평가하기 위해 비교 평가 프레임워크를 도입하였다.
  • 최종 모델 아키텍처는 인용 감성에 대한 표현 학습을 향상시키기 위해 다수의 언어학적 특징을 통합하였다.

실험 결과

연구 질문

  • RQ1맥락 정보의 포함 여부가 인용 감성 분류 성능에 어떤 영향을 미치는가?
  • RQ2다양한 데이터셋 크기에서 딥 러닝과 전통적인 모델(예: SVM) 중 어떤 기계 학습 접근 방식이 인용 감성 분류에서 더 우수한 성능을 보이는가?
  • RQ3어휘 임bedding, 품사 태그, 의존 구문 분석을 조합한 앙상블 특징이 분류 정확도 향상에 얼마나 기여하는가?
  • RQ4딥 러닝 모델과 SVM 모델의 성능 특성은 인용 감성 분석에서 훈련 샘플 크기에 따라 어떻게 변화하는가?
  • RQ5맥락 강화된 샘플과 맥락을 고려하지 않은 샘플 간의 감성 분류에서 상대적 효과성은 어떠한가?

주요 결과

  • 딥 러닝 모델은 Bag-of-Words 기준선 대비 대규모 인용 데이터셋에서 뛰어난 성능을 기록한다.
  • 소규모 인용 데이터셋에서는 서포트 벡터 머신(SVM)이 딥 러닝 모델보다 성능이 뛰어나, 샘플 크기에 따라 성능의 상충 관계가 존재함을 시사한다.
  • 맥락을 고려한 인용 샘플은 맥락을 고려하지 않은 샘플보다 분류 정확도가 유의미하게 향상되며, 감성 판단에 주변 텍스트의 중요성을 입증한다.
  • 어휘 임bedding, 품사 태그, 의존 구문 분석을 조합한 앙상블 특징 접근 방식은 더 나은 표현 학습과 향상된 감성 분류 성능을 이끌어낸다.
  • 제안된 방법은 특히 전체 인용 맥락을 사용할 경우 수동으로 주석 처리된 데이터셋에서 높은 F1 점수를 달성한다.
  • 본 연구는 적절히 맥락화된 경우 인용 감성 분석이 과학적 인용 분석 및 디지털 도서관 응용 분야에서 실현 가능하고 가치 있는 작업임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.