Skip to main content
QUICK REVIEW

[論文レビュー] Bleaching Text: Abstract Features for Cross-lingual Gender Prediction

Rob van der Goot, Nikola Ljubešić|IT University Of Copenhagen (IT University of Copenhagen)|May 8, 2018
Authorship Attribution and Profiling参考文献 22被引用数 22
ひとこと要約

本稿では、文字の形状、母音・子音のパターン、標点の種別といった、語彙に依存しない抽象的特徴にテキストを変換することで、多言語間での性別予測の性能を向上させる手法を提案する。生の語彙を一般化された表現に置き換えることで、語彙を超えた性別特有のスタイル的パターンを捉え、人間と同等の性能を達成し、多言語環境下で語彙ベースのモデルを上回る結果を得た。

ABSTRACT

Gender prediction has typically focused on lexical and social network features, yielding good performance, but making systems highly language-, topic-, and platform-dependent. Cross-lingual embeddings circumvent some of these limitations, but capture gender-specific style less. We propose an alternative: bleaching text, i.e., transforming lexical strings into more abstract features. This study provides evidence that such features allow for better transfer across languages. Moreover, we present a first study on the ability of humans to perform cross-lingual gender prediction. We find that human predictive power proves similar to that of our bleached models, and both perform better than lexical models.

研究の動機と目的

  • 語彙に依存しない抽象的特徴が、言語を超えて性別を効果的に予測できるかどうかを調査すること。
  • トピックや語彙のバイアスにより言語間で一般化できない語彙ベースのモデルの限界を是正すること。
  • 人間が言語を知らない状態でも多言語間での性別予測が可能かどうか、およびその性能が機械学習モデルと比べてどの程度かを検討すること。
  • 言語に依存しない特徴表現を開発し、語彙的コンテンツを薄めつつも予測に有用な信号を保持すること。

提案手法

  • 語彙的内容を一般化されたパターンに置き換えることで、テキストを抽象的特徴に変換する:周波数は大きさで区間分け、文字長、標点クラス(PunctC/PunctA)、形状(U/L/D/X)、母音・子音(V/C/O)、およびすべての抽象化を組み合わせた(AllAbs)。
  • Twitterデータを用いて、これらの抽象的特徴上で教師ありモデル(例:SVM、ロジスティック回帰)を訓練し、性別予測を実行する。
  • 言語内および多言語間の両設定において、変換済みモデルと語彙ベースのモデル、多言語埋め込みの性能を比較する。
  • 200件のツイートをユーザーごとに使用し、さまざまな言語ペアを用いて、人間による評価実験を実施し、多言語間での性別予測精度を評価する。
  • 変換済みモデルでは5-gram特徴ウィンドウを用い、局所的なパターンを捉えつつ語彙的特異性を避ける。
  • 語彙の周波数に区間分けを適用することで、スパarsityを軽減し、言語間での一般化を向上させる。

実験結果

リサーチクエスチョン

  • RQ1どれだけの範囲で、テキストから得られる語彙に依存しない抽象的特徴のみを用いて性別を予測できるか(RQ1)?
  • RQ2変換済みモデルは、語彙ベースや埋め込みベースのモデルと比べて、どの程度言語間で一般化できるか(RQ2)?
  • RQ3人間は言語を知らない状態でも多言語間での性別予測が可能か。その性能はモデルと比べてどの程度か(RQ3)?

主な発見

  • 変換済みモデルは多言語間での性別予測で61.5%の精度を達成し、語彙ベースのモデルを上回り、人間の性能と同等となった(例:PT → EN)。
  • 多言語間設定において、人間の平均精度は60.0%にのぼり、語彙ベースのモデルを顕著に上回り、変換済みモデルと同等の性能を示した。
  • 変換済みモデルの言語内性能(ENでは58.7%)は人間の言語内精度(70.5%)をわずかに下回るが、多言語間への一般化ではこの差が縮まった。
  • 語彙ベースのモデルは言語内設定では変換済みモデルを上回るが、言語間での一般化に失敗しており、言語特異的なバイアスが顕著に現れた。
  • ユーザー1人あたりのツイート数を200件から20件に減らした場合、性能が12ポイント低下した。これは、変換済みモデルがデータのスパarsityに敏感であることを示している。
  • AllAbs特徴の組み合わせが、言語を問わず一貫して最高の結果をもたらした。これは、複数の抽象的パターンを組み合わせることで一般化性能が向上することを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。