Skip to main content
QUICK REVIEW

[논문 리뷰] Distance Based Source Domain Selection for Sentiment Classification

Lex Razoux Schultz, Marco Loog|arXiv (Cornell University)|2018. 08. 28.
Sentiment Analysis and Opinion Mining참고 문헌 32인용 수 9
한 줄 요약

이 논문은 감성 분류를 위한 거리 기반 소스 도메인 선택 방법을 제안하며, 지구 이동 거리와 쿨백-라이블러 발산과 같은 분포 거리 측도의 선형 조합을 사용하여 후보 소스 도메인 중 최적의 소스 도메인을 예측하고 선택한다. 이 방법은 무작위 선택에 비해 이방향 분류 오차를 크게 감소시키며, 이는 이질적인 데이터셋에서 특히 두드러진다. 또한 높은 잠재력을 지닌 서브셋을 선택하여 중복 도메인을 걸러낼 수 있다.

ABSTRACT

Automated sentiment classification (SC) on short text fragments has received increasing attention in recent years. Performing SC on unseen domains with few or no labeled samples can significantly affect the classification performance due to different expression of sentiment in source and target domain. In this study, we aim to mitigate this undesired impact by proposing a methodology based on a predictive measure, which allows us to select an optimal source domain from a set of candidates. The proposed measure is a linear combination of well-known distance functions between probability distributions supported on the source and target domains (e.g. Earth Mover's distance and Kullback-Leibler divergence). The performance of the proposed methodology is validated through an SC case study in which our numerical experiments suggest a significant improvement in the cross domain classification error in comparison with a random selected source domain for both a naive and adaptive learning setting. In the case of more heterogeneous datasets, the predictability feature of the proposed model can be utilized to further select a subset of candidate domains, where the corresponding classifier outperforms the one trained on all available source domains. This observation reinforces a hypothesis that our proposed model may also be deployed as a means to filter out redundant information during a training phase of SC.

연구 동기 및 목표

  • 소스 도메인과 타겟 도메인이 감성 표현 방식에서 다를 때 발생하는 도메인 이동 문제를 해결한다.
  • 라벨이 없는 타겟 데이터를 활용하지 않고도 다수의 후보 중 가장 적합한 소스 도메인을 선택하여 이방향 분류 성능을 향상시킨다.
  • 소스 도메인과 타겟 도메인의 분포 통계 자료만을 사용하여 이방향 분류 오차를 추정하는 예측 모델을 개발한다.
  • 수동 선택이나 전체 데이터 학습에 의존하지 않고 자동으로 비지도 방식으로 소스 도메인을 선택할 수 있도록 한다.
  • 학습 과정에서 중복되거나 성능이 낮은 소스 도메인을 제거하는 필터링 메커니즘으로서의 방법의 잠재력을 탐색한다.

제안 방법

  • 소스 도메인과 타겟 도메인의 확률 분포 간 기존의 거리 함수들인 지구 이동 거리와 쿨백-라이블러 발산을 포함한 선형 조합으로 예측 측도를 정의한다.
  • 결합된 거리 측도를 사용하여 각 후보 소스 도메인으로 학습된 분류기의 기대 이방향 분류 오차를 예측하는 대체 지표로 활용한다.
  • 고정된(단순한) 및 적응형 학습 설정 모두에 이 방법을 적용하며, 이는 선택 이전에 소스 데이터를 재가중하거나 변환하는 것을 포함한다.
  • 소스 도메인의 예측 일반화 오차 기반으로 도메인을 순위 매기는 CMEK 모델을 제안하며, 타겟 도메인과 분포적 이질성이 가장 작은 도메인을 우선시한다.
  • 예측 오차가 낮은 도메인에 더 큰 영향을 주는 방식으로 다수의 소스 도메인을 가중 조합할 수 있도록 모델을 확장한다.
  • 모든 후보 도메인에 대해 전체 학습을 수행할 경우 성능이 떨어지는 경우, 특히 이질적인 데이터 설정에서 높은 잠재력을 지닌 소스 도메인 서브셋을 선택하는 데 이 모델을 활용한다.

실험 결과

연구 질문

  • RQ1주어진 소스 도메인으로 학습된 감성 분류기의 이방향 분류 오차를 신뢰성 있게 추정할 수 있는 거리 기반 예측 측도는 가능한가?
  • RQ2타겟 도메인과의 분포 유사성에 기반해 소스 도메인을 선택할 경우, 무작위 선택보다 분류 오차가 낮아지는가?
  • RQ3중복되거나 유사성이 낮은 도메인을 걸러내는 방식으로, 모든 이용 가능한 소스 도메인으로 학습하는 것보다 성능이 뛰어나지 않는가?
  • RQ4도메인 이동이 더 두드러진 이질적인 데이터셋에서 이 방법의 효과는 어떠한가?
  • RQ5예측 오차 기반으로 소스 도메인에 가중치를 할당하는 방식으로 다수의 선택된 소스 도메인에 대한 가중 조합 학습을 지원할 수 있는가?

주요 결과

  • 제안된 거리 기반 소스 도메인 선택 방법은 단순 학습 및 적응형 학습 설정 모두에서 무작위 소스 도메인 선택에 비해 이방향 분류 오차를 크게 감소시킨다.
  • 이질적인 데이터셋에서는 모든 이용 가능한 소스 도메인으로 학습하는 모델보다 높은 잠재력을 지닌 도메인 서브셋을 선택함으로써 성능이 뛰어나며, 이는 필터링 메커니즘으로서의 유용성을 입증한다.
  • CMEK 모델은 이질적인 데이터셋에서 이방향 오차의 하한값 0.252를 기록하며, 이는 여전히 최적 성능의 절반 수준에 도달했다는 것을 의미한다.
  • 동질적인 데이터셋에서는 방법의 성능이 최적에 가깝게 나타나, 소스 도메인과 타겟 도메인이 더 유사할 경우 이방향 오차 예측의 정확도가 더 높다는 것을 시사한다.
  • 감정 어휘나 문서 길이 분포와 같은 도메인 특화 특징을 통합함으로써 모델의 예측 능력이 향상되며, 이는 거리 추정에 도움이 될 수 있다.
  • 예측 오차 기반으로 소스 도메인에 가중치를 할당하는 방식으로 모델을 확장하면 앙상블 학습에 유망한 성과를 보이지만, 계산 복잡도가 증가하는 단점이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.