Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Two-stage Framework for Extracting Opinionated Sentences from News Articles

Rajkumar Pujari, Swara Desai|arXiv (Cornell University)|2021. 01. 24.
Sentiment Analysis and Opinion Mining참고 문헌 25인용 수 9
한 줄 요약

이 논문은 국소적 특징 기반 Naïve Bayes 분류기를 사용해 문장의 초기 점수를 부여하고, 전반적인 문장 간 관계를 활용하기 위해 HITS 알고리즘을 적용하는 새로운 이단계 프레임워크를 제안한다. 이 방법은 기준 분류기 대비 정밀도를 크게 향상시키며, P@3 점수 0.72와 M@3 점수 1.5를 기록한다. 또한 기사 내에서 의견과 근거가 되는 사실의 구조적 조직을 드러낸다.

ABSTRACT

This paper presents a novel two-stage framework to extract opinionated sentences from a given news article. In the first stage, Naive Bayes classifier by utilizing the local features assigns a score to each sentence - the score signifies the probability of the sentence to be opinionated. In the second stage, we use this prior within the HITS (Hyperlink-Induced Topic Search) schema to exploit the global structure of the article and relation between the sentences. In the HITS schema, the opinionated sentences are treated as Hubs and the facts around these opinions are treated as the Authorities. The algorithm is implemented and evaluated against a set of manually marked data. We show that using HITS significantly improves the precision over the baseline Naive Bayes classifier. We also argue that the proposed method actually discovers the underlying structure of the article, thus extracting various opinions, grouped with supporting facts as well as other supporting opinions from the article.

연구 동기 및 목표

  • 제품 리뷰나 포럼과는 달리 더 명시적으로 의견이 표현되지 않는 뉴스 기사에서 의견 문장을 식별하는 데 도전하는 것.
  • 기사 전체의 구조적 특성을 활용하여 기준 분류기 방법을 초월해 의견 문장 추출의 정밀도를 향상시키는 것.
  • 의견 문장을 추출할 뿐 아니라, 그에 해당하는 사실적 근거나 의견 기반 맥락을 드러내는 방법을 개발하는 것.
  • 기사 전체에서의 의견 문장 비율 대비 상위 결과에서의 비율에 중점을 두는 새로운 평가 지표를 도입하는 것.
  • 의견 문장 추출을 위한 실용적 응용, 예를 들어 토론 질문 생성이나 매체 보도의 시간에 따른 변화 추적을 가능하게 하는 것.

제안 방법

  • 첫 번째 단계에서, 국소적 특징에 기반해 각 문장에 대해 의견 문장일 가능성이 있는지에 대한 사전 확률 점수를 Naïve Bayes 분류기가 할당한다.
  • 두 번째 단계에서, 기사의 문장 간 그래프에 HITS(Hyperlink-Induced Topic Search) 알고리즘을 적용하며, 의견 문장을 허브로, 그들의 지지가 되는 사실적 또는 의견 기반 문장을 권위로 간주한다.
  • HITS 알고리즘은 다음 공식을 통해 반복적으로 허브 점수와 권위 점수를 갱신한다: $ H_i^{(k+1)} = \sum_{j \in \text{links to } i} A_j^{(k)} $ 와 $ A_i^{(k+1)} = \sum_{j \in \text{links from } i} H_j^{(k)} $, 여기서 링크는 의미적 유사도와 의존성 파싱에 의해 결정된다.
  • 의존성 파싱과 어휘적 특징(예: 극성 어휘, 부사 수식어)을 사용해 문장 간의 유사도와 링크 가중치를 계산한다.
  • 웹 인터페이스는 의견 문장(노란색), 지지 사실(薰색), 극성 어휘(초록/빨강)를 강조 표시하고, 허브-권위 구조를 보여주는 그래프를 제공한다.
  • 이 방법은 기사 전체에서의 의견 문장 비율 대비 상위 순위 결과에서의 비율에 중점을 두는 새로운 평가 지표를 통합한다.

실험 결과

연구 질문

  • RQ1국소적 분류와 전반적 구조 분석을 조합한 이단계 프레임워크가 뉴스 기사에서 의견 문장 추출의 정밀도를 향상시킬 수 있는가?
  • RQ2문장 수준의 관계에 HITS 알고리즘을 적용했을 때, 기준 분류기 대비 의견 문장의 순위를 얼마나 효과적으로 향상시키는가?
  • RQ3제안된 방법이 뉴스 기사 내에서 의견과 그 지지 사실의 잠재적 구조적 조직을 어느 정도 드러내는가?
  • RQ4비율 기반 성능에 중점을 두는 제안된 평가 지표가 기존의 P@3나 M@3와 같은 표준 지표보다 실제 응용에서의 유용성을 더 잘 반영하는가?
  • RQ5허브-권위 구조를 활용해 의견의 다양성을 향상시키고, 매체의 감성 변화를 장기적으로 추적하는 데 기여할 수 있는가?

주요 결과

  • 이단계 프레임워크는 기준 Naïve Bayes 분류기 대비 정밀도를 크게 향상시키며, P@3에서 35.8% 향상되고 M@3에서 30.8% 향상되었다.
  • 시스템은 P@3 점수 0.72와 M@3 점수 1.5를 기록하여, 평균적으로 반환된 상위 3개 문장 중 2개가 의견 문장임을 나타낸다.
  • HITS 기반 보정 단계는 초기 Naïve Bayes 점수와 HITS 결과 간 상관관계가 높더라도, 전반적인 문장 간 관계를 활용해 의견 문장을 효과적으로 재순위 매김한다.
  • 이 방법은 의견 문장을 식별할 뿐 아니라, 그에 해당하는 사실적 근거나 의견 기반 맥락도 성공적으로 식별하여 기사의 잠재적 구조적 조직을 드러낸다.
  • 오류 분석 결과, 다수의 극성 어휘나 강한 의존성 구조를 가진 사실 문장을 잘못 분류해 의견 문장으로 오인하는 경우가 있어, 보다 정교한 특징 엔지니어링의 필요성이 드러났다.
  • 웹 인터페이스는 의견 군집, 지지 사실, 극성 어휘 주석을 시각화해 편집자가 토론에 적합한 콘텐츠를 신속히 식별할 수 있도록 실용적인 사용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.