Skip to main content
QUICK REVIEW

[논문 리뷰] Sentence based semantic similarity measure for blog-posts

Mehwish Aziz, Muhammad Rafi|arXiv (Cornell University)|2012. 01. 10.
Sentiment Analysis and Opinion Mining참고 문헌 11인용 수 7
한 줄 요약

이 논문은 사용자 생성 웹 콘텐츠에서 짧고 비공식적이며 맥락이 부족한 콘텐츠의 과제를 해결하기 위해 블로그 게시물에 특화된 새로운 문장 기반 의미 유사도 측정 방법을 제안한다. 어휘적, 문법적, 의미적 특징을 가중치를 적용한 융합 방식으로 조합함으로써, 파키스탄 블로거스피어에서 정치적 블로그 게시물의 군집화와 영향력 있는 블로거 식별에 성능 향상을 이룩하였으며, 이 분야에 특화된 작업에서 표준 유사도 측정 방법보다 뛰어난 성능을 보였다.

ABSTRACT

Blogs-Online digital diary like application on web 2.0 has opened new and easy way to voice opinion, thoughts, and like-dislike of every Internet user to the World. Blogosphere has no doubt the largest user-generated content repository full of knowledge. The potential of this knowledge is still to be explored. Knowledge discovery from this new genre is quite difficult and challenging as it is totally different from other popular genre of web-applications like World Wide Web (WWW). Blog-posts unlike web documents are small in size, thus lack in context and contain relaxed grammatical structures. Hence, standard text similarity measure fails to provide good results. In this paper, specialized requirements for comparing a pair of blog-posts is thoroughly investigated. Based on this we proposed a novel algorithm for sentence oriented semantic similarity measure of a pair of blog-posts. We applied this algorithm on a subset of political blogosphere of Pakistan, to cluster the blogs on different issues of political realm and to identify the influential bloggers.

연구 동기 및 목표

  • 짧고 비공식적이며 맥락이 부족한 블로그 게시물 분석에서 표준 텍스트 유사도 측정 방법의 한계를 해결하기 위해.
  • 정치적 블로거스피어의 고유한 언어적 및 구조적 특성에 맞춰 특화된 도메인 전용 의미 유사도 측정 방법을 개발하기 위해.
  • 의미 유사도를 활용하여 정치적 이슈 중심의 블로그 게시물 군집화를 효과적으로 수행하기 위해.
  • 의미 유사도 패턴을 바탕으로 정치적 블로거스피어 내에서 영향력 있는 블로거를 식별하기 위해.

제안 방법

  • 이 방법은 어휘적, 문법적, 의미적 특징을 통합하는 문장 수준의 의미 유사도 측정 방식을 사용한다.
  • 단어 쌍 간의 동의어 관계와 하위개념 관계를 계산하기 위해 WordNet 기반 의미 유사도를 활용한다.
  • 의존성 파싱 트리를 사용하여 문장의 구조를 비교함으로써 문법적 유사도를 측정한다.
  • TF-IDF 가중치를 적용한 터미널 매칭을 통해 어휘적 겹침을 측정하여 터미널의 중요도를 반영한다.
  • 세 가지 유사도 점수(어휘적, 문법적, 의미적)를 도메인 특화된 가중치를 사용한 가중치 융합 모델로 통합한다. 이 가중치는 경험적 분석을 통해 유도된다.
  • 최종 유사도 점수는 블로그 게시물 군집화와 정치적 논의 내에서 블로거의 영향력 순위 매기기 목적으로 사용된다.

실험 결과

연구 질문

  • RQ1맥락이 풍부하지 않은 짧고 비공식적인 블로그 게시물에서 의미 유사도를 효과적으로 측정하는 방법은 무엇인가?
  • RQ2어휘적, 문법적, 의미적 특징의 어떤 조합이 정치적 블로그 콘텐츠에 대해 가장 정확한 유사도 측정을 가능하게 하는가?
  • RQ3문장 기반의 유사도 측정 방법은 기존 방법에 비해 정치적 이슈에 관한 블로그 게시물 군집화에 있어 성능을 향상시킬 수 있는가?
  • RQ4의미 유사도를 얼마나 활용하여 정치적 블로거스피어 내에서 영향력 있는 블로거를 식별할 수 있는가?

주요 결과

  • 제안된 의미 유사도 측정 방법은 정치적 블로거스피어에서 블로그 게시물 군집화 작업에서 표준 어휘적 및 벡터 공간 기반의 유사도 측정 방법보다 뚜렷한 성능 향상을 보였다.
  • 문법적 및 의미적 특징의 통합은 어휘적 겹침에만 의존하는 방법에 비해 군집화 정확도 향상에 기여하였다.
  • 이 방법은 핵심 정치적 이슈를 성공적으로 식별하였으며, 주제적 콘텐츠의 높은 일관성으로 관련 블로그 게시물을 효과적으로 그룹화하였다.
  • 블로그 네트워크 내에서 높은 연결성과 의미적 중심성 확보를 바탕으로 영향력 있는 블로거를 효과적으로 탐지할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.