Skip to main content
QUICK REVIEW

[논문 리뷰] APPReddit: a Corpus of Reddit Posts Annotated for Appraisal

Marco Antonio Stranisci, Simona Frenda|arXiv (Cornell University)|2022. 05. 31.
Sentiment Analysis and Opinion Mining인용 수 5
한 줄 요약

이 논문은 로즈먼의 다차원 평가 이론을 사용하여 평가 차원에 대해 주석 처리된 최초의 대규모 Reddit 게시물 코퍼스인 APPReddit를 소개한다. 비실험적 소셜미디어 데이터가 평가 차원에 대해 신뢰성 있게 주석 처리될 수 있음을 입증하며, APPReddit를 실험적 enISEAR 코퍼스와 융합함으로써 네 가지 평가 차원 중 세 가지에서 SVM 기반 예측 성능이 향상됨을 보여준다.

ABSTRACT

Despite the large number of computational resources for emotion recognition, there is a lack of data sets relying on appraisal models. According to Appraisal theories, emotions are the outcome of a multi-dimensional evaluation of events. In this paper, we present APPReddit, the first corpus of non-experimental data annotated according to this theory. After describing its development, we compare our resource with enISEAR, a corpus of events created in an experimental setting and annotated for appraisal. Results show that the two corpora can be mapped notwithstanding different typologies of data and annotations schemes. A SVM model trained on APPReddit predicts four appraisal dimensions without significant loss. Merging both corpora in a single training set increases the prediction of 3 out of 4 dimensions. Such findings pave the way to a better performing classification model for appraisal prediction.

연구 동기 및 목표

  • 정서 모델링을 위한 평가 이론에 대한 관심이 증가하고 있음에도 불구하고, 비실험적이고 평가 주석 처리가 된 코퍼스가 부족한 문제를 해결한다.
  • 비공식적이고 사용자 생성된 소셜미디어 텍스트에서 평가 차원에 대한 신뢰성 있는 주석 처리 체계를 개발한다.
  • 비실험적 데이터(예: Reddit)에서의 평가 주석이 실험적 데이터(예: enISEAR)의 주석과 의미적으로 매핑될 수 있는지 조사한다.
  • 실험적 및 비실험적 데이터를 융합함으로써 평가 차원의 계산 기반 모델링 성능 향상 여부를 평가한다.
  • 평가 기반 특징을 통해 감성 분석, 태도 탐지, 폭력적 언어 식별 등의 작업을 향상시키기 위한 기초 자원을 제공한다.

제안 방법

  • 로즈먼의 평가 모델을 사용하여 1,091개의 Reddit 게시물을 주석 처리하였으며, 핵심 평가 차원 네 가지에 초점을 맞췄다: 목표 유도성, 동기, 확신도, 자극 유도성.
  • 전문 주석자와 이주석자 간 일致성 검사를 포함한 다단계 주석 처리 과정을 통해 신뢰성을 확보했다.
  • 다른 평가 이론을 사용하는 enISEAR 코퍼스와의 호환성을 평가하기 위해 APPReddit 주석 체계를 enISEAR 코퍼스에 매핑했다.
  • SVM 모델을 APPReddit에서 훈련하여 평가 차원을 예측하고, 표준 지표를 사용해 성능을 평가했다.
  • APPReddit와 enISEAR를 하나의 훈련 세트로 융합하고, 재훈련된 SVM 모델을 통해 성능 향상을 평가했다.
  • 통계적 분석을 통해 다양한 훈련 설정에서의 모델 성능를 비교하고 향상의 유의미성을 평가했다.

실험 결과

연구 질문

  • RQ1로즈먼의 평가 모델에 따라 비실험적 환경(예: Reddit)에서 생성된 텍스트가 신뢰성 있게 이해되고 주석 처리될 수 있는가?
  • RQ2로즈먼의 평가 이론 기반 주석 체계를 다른 평가 이론을 사용하는 enISEAR 코퍼스에 매핑할 수 있는가?
  • RQ3비실험적 데이터와 실험적 데이터가 상호보완적으로 작용하여 평가 차원의 계산 기반 모델링 성능을 향상시킬 수 있는가?

주요 결과

  • APPReddit는 비실험적이고 비공식적인 Reddit 게시물이 로즈먼의 모델을 사용하여 평가 차원에 대해 안정적으로 주석 처리될 수 있음을 성공적으로 입증한다.
  • 데이터 유형과 주석 체계의 차이에도 불구하고 APPReddit와 enISEAR 간 의미 있는 매핑이 달성되어 이론 간 호환성이 있음을 시사한다.
  • APPReddit에서만 훈련된 SVM 모델이 네 가지 평가 차원 모두에서 유의미한 성능을 보였으며, 실험적 데이터로 훈련된 모델에 비해 유의미한 성능 손실가 없었다.
  • APPReddit와 enISEAR를 하나의 훈련 세트로 융합함으로써 네 가지 평가 차원 중 세 가지에서 예측 성능 향상이 이루어졌다.
  • 통합된 코퍼스는 강력한 평가 예측 모델을 훈련하기 위한 더 좋은 기반을 제공하며, 이는 비실험적 데이터가 기존 실험적 자원을 의미 있게 향상시킬 수 있음을 시사한다.
  • 결과는 소셜미디어 데이터를 평가 기반 NLP 작업에 활용하는 것이 실현 가능하고 유용하며, 이용 가능한 언어학적 자원의 범위를 넓힌다는 것을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.