[論文レビュー] APPReddit: a Corpus of Reddit Posts Annotated for Appraisal
本稿では、Rosemanの多次元的評価理論を用いてアノテーションされたReddit投稿の大型スケールコーパスであるAPPRedditを紹介する。非実験的ソーシャルメディアデータが評価次元について信頼性を持ってアノテーション可能であることが示され、APPRedditを実験的enISEARコーパスと統合することで、4つの評価次元のうち3つにおいてSVMベースの予測性能が向上することを示している。
Despite the large number of computational resources for emotion recognition, there is a lack of data sets relying on appraisal models. According to Appraisal theories, emotions are the outcome of a multi-dimensional evaluation of events. In this paper, we present APPReddit, the first corpus of non-experimental data annotated according to this theory. After describing its development, we compare our resource with enISEAR, a corpus of events created in an experimental setting and annotated for appraisal. Results show that the two corpora can be mapped notwithstanding different typologies of data and annotations schemes. A SVM model trained on APPReddit predicts four appraisal dimensions without significant loss. Merging both corpora in a single training set increases the prediction of 3 out of 4 dimensions. Such findings pave the way to a better performing classification model for appraisal prediction.
研究の動機と目的
- NLP分野における感情モデリングのための評価理論への関心が高まる一方で、非実験的かつ評価アノテーション済みコーパスの不足に取り組む。
- 非公式でユーザー生成のソーシャルメディアテキストにおける評価次元の信頼性の高いアノテーションスキームを開発する。
- 非実験的データ(Reddit)からの評価アノテーションが、実験的データ(enISEAR)からのものと意味的にマッピング可能かどうかを調査する。
- 実験的および非実験的データを統合することで、評価次元の計算モデリングが改善されるかどうかを評価する。
- 感情分析、スタンス検出、いじめ言語同定などのタスクを、評価に基づく特徴量を用いて進展させる基盤リソースを提供する。
提案手法
- Rosemanの評価モデルを用いて、1,091件のReddit投稿をアノテーションし、4つの核心的評価次元(目的適合性、動機、確実性、誘発性)に焦点を当てる。
- 専門のアノテーターを用いた段階的アノテーションプロセスと、アノテーター間一貫性のチェックを実施し、信頼性を確保する。
- 異なる評価理論を用いるenISEARコーパスに対して、APPRedditのアノテーションスキームをマッピングし、コーパス間の互換性を評価する。
- SVM(サポートベクターマシン)モデルをAPPReddit上で学習させ、標準的な指標を用いて性能を評価する。
- APPRedditとenISEARを統合した単一のトレーニングセットを作成し、SVMモデルを再学習させ、性能向上を評価する。
- 統計的分析を用いて、異なるトレーニング設定間でのモデル性能を比較し、改善の有意性を評価する。
実験結果
リサーチクエスチョン
- RQ1Redditのような非実験的環境で生成されたテキストが、Rosemanの評価モデルに従って信頼性を持って理解され、アノテーション可能であるか?
- RQ2Rosemanの評価理論に基づくアノテーションスキームを、異なる評価理論を用いるenISEARコーパスにマッピング可能か?
- RQ3非実験的データと実験的データが、評価次元の計算モデリングを向上させるために互いに補完し合えるか?
主な発見
- APPRedditは、非実験的かつ非公式なReddit投稿がRosemanモデルに基づいて信頼性を持って評価次元ごとにアノテーション可能であることを示している。
- データタイプやアノテーションスキームの違いにもかかわらず、APPRedditとenISEARの間で意味的なマッピングが達成された。これは、異なる理論間の互換性があることを示している。
- APPRedditのみで学習したSVMモデルは、4つの評価次元の予測において顕著な性能を示し、実験的データで学習したモデルと比較して顕著な性能低下がなかった。
- APPRedditとenISEARを統合したトレーニングセットを用いることで、4つの評価次元のうち3つにおいて予測性能が向上した。
- 統合されたコーパスは、頑健な評価予測モデルを学習するためのより強固な基盤を提供しており、非実験的データが既存の実験的リソースを意味的に強化できることを示唆している。
- 結果は、ソーシャルメディアデータを評価に基づくNLPタスクに活用することが実現可能で有用であることを支持しており、利用可能な言語的リソースの範囲を拡大することを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。