Skip to main content
QUICK REVIEW

[논문 리뷰] Confirmatory Aspect-based Opinion Mining Processes

Jongho Im, Taikgun Song|arXiv (Cornell University)|2019. 07. 30.
Sentiment Analysis and Opinion Mining참고 문헌 43인용 수 6
한 줄 요약

이 논문은 고객 리뷰를 문장으로 분해하고, 품사 태깅 및 문법 분석을 통해 주제-평가 이항어를 추출하며, 사전에 지정된 도메인 주제에 매칭하여 감성 점수를 산출하는 확증적 소품기반 감성 분석 프레임워크인 DiSSBUS를 제안한다. 하와이의 트립어드바이저 레스토랑 리뷰에 적용된 이 방법은 음식, 서비스, 가격과 같은 고정된 주제에 대한 리뷰어의 의견을 높은 정확도로 효과적으로 식별하며, 문서 또는 문장 수준의 접근 방식에 비해 정보 손실를 줄이고 해석 가능성을 향상시킨다.

ABSTRACT

A new opinion extraction method is proposed to summarize unstructured, user-generated content (i.e., online customer reviews) in the fixed topic domains. To differentiate the current approach from other opinion extraction approaches, which are often exposed to a sparsity problem and lack of sentiment scores, a confirmatory aspect-based opinion mining framework is introduced along with its practical algorithm called DiSSBUS. In this procedure, 1) each customer review is disintegrated into a set of clauses; 2) each clause is summarized to bi-terms-a topic word and an evaluation word-using a part-of-speech (POS) tagger; and 3) each bi-term is matched to a pre-specified topic relevant to a specific domain. The proposed processes have two primary advantages over existing methods: 1) they can decompose a single review into a set of bi-terms related to pre-specified topics in the domain of interest and, therefore, 2) allow identification of the reviewer's opinions on the topics via evaluation words within the set of bi-terms. The proposed aspect-based opinion mining is applied to customer reviews of restaurants in Hawaii obtained from TripAdvisor, and the empirical findings validate the effectiveness of the method. Keywords: Clause-based sentiment analysis, Customer review, Opinion mining, Topic modeling, User-generate-contents.

연구 동기 및 목표

  • 구조화되지 않은 사용자 생성 콘텐츠(UGC)를 분석할 때 발생하는 데이터 희소성과 모호한 주제 식별 문제와 같은 기존 감성 분석 방법의 한계를 해결하기 위해.
  • 후행 주제 추출이 아닌 사전 지정된 도메인 특화 주제를 사용하여 소품기반 감성 분석의 정확성과 해석 가능성을 향상시키기 위해.
  • 전체 문서나 문장 수준에서 감성을 집계하는 것 대신 개별 문장 수준에서 분석하여 세분화된 감성 표현을 유지함으로써 정보 손실를 줄이기 위해.
  • 언어적 구문 분석, 주제 매칭, 감성 점수 산정을 통합한 체계적이고 재현 가능한 소품기반 감성 분석 파이프라인을 개발하기 위해.
  • 실제 트립어드바이저 레스토랑 리뷰에 대한 실증적 적용을 통해 방법의 효과성을 검증하기 위해.

제안 방법

  • 각 고객 리뷰를 개별 문장으로 분해하여 별개의 감성 단위를 고립시킨다.
  • 각 문장을 품사 태거(POS tagger)와 문법 분석(예: Google SyntaxNet)을 사용하여 주제어어와 평가어로 구성된 이항어로 요약한다.
  • 빈도가 높은 이항어의 일부를 선별하고 도메인 지식을 활용하여 수작업으로 사전에 지정된 주제(예: 음식, 서비스, 가격)에 매칭한다.
  • 선별되지 않은 이항어는 백킹(배깅) 과정을 통해 동일한 주제에 매칭되어 각 주제의 대표 이항어 집합을 확장한다.
  • 리포지터리 기반 접근 방식(예: R 패키지 'tidytext' 감성 어휘 사전)을 사용하여 각 이항어에 감성 점수를 할당하며, 점수 범위는 -1.00(부정)에서 +1.00(긍정)이다.
  • 최종 출력은 이항어를 주제별로 군집화하고 감성 성향을 할당하여 특정 측면에 대한 리뷰어 의견을 체계적으로 분석할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1문장 수준 또는 문서 수준 접근 방식에 비해 문장 수준 분석이 소품기반 감성 분석의 정확성과 해석 가능성에 어떻게 기여하는가?
  • RQ2사전 지정된 주제를 사용할 경우 감성 분석에서 주제 식별의 정확성과 모호성 감소에 어느 정도 기여하는가?
  • RQ3이항어 기반 표현(주제어어 + 평가어)이 짧은 텍스트 리뷰에서 특정 측면에 대한 리뷰어 감성을 얼마나 효과적으로 포착할 수 있는가?
  • RQ4DiSSBUS 파이프라인은 실제 레스토랑 리뷰에서 고정된 주제에 대한 의견을 식별하고 점수를 매기는 데 얼마나 효과적인가?
  • RQ5이 방법은 구조화되지 않은 UGC에서 흔히 발생하는 데이터 희소성과 감성 점수 산정 과제를 어떻게 다루는가?

주요 결과

  • DiSSBUS 알고리즘은 레스토랑 리뷰를 문장으로 분해하고, 음식, 서비스, 가격, 환경과 같은 사전 지정된 주제에 높은 정밀도로 이항어를 할당하는 데 성공했다.
  • 메서드는 일관된 감성 점수를 기록했으며, 평가어가 긍정적 감성을 나타낼 경우 10개의 예시 문장 모두가 긍정 감성 점수(성향 = 1.00)를 받았다.
  • 부정 감성은 '주차 공간이 제한되어 있다'와 같은 문장에서 올바르게 포착되었으며, 환경 주제에 대해 -1.00의 감성 점수를 기록했다.
  • 문서나 문장 수준에서 감성을 집계하는 것 대신 개별 문장 수준에서 분석함으로써 정보 손실를 줄였다.
  • 트립어드바이저 리뷰에서의 실증 결과는 이 방법이 레스토랑 도메인에서 특정로 사전 정의된 측면에 리뷰어의 의견을 효과적으로 연결함을 보여주었다.
  • 이 연구는 문장 수준의 이항어와 도메인 특화 주제를 활용한 확증적 소품기반 감성 분석이 기존의 주제 모델링 또는 소품기반 분석보다 더 정확하고 해석 가능한 결과를 도출함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.