Skip to main content
QUICK REVIEW

[論文レビュー] Feature Selection for Gender Classification in TUIK Life Satisfaction Survey

Adil Çoban, İlhan Tarımer|arXiv (Cornell University)|Jul 12, 2018
Psychological Well-being and Life Satisfaction参考文献 7被引用数 3
ひとこと要約

本研究では、TUİKの人生満足度調査における性別分類の性能を向上させるための特徴選択手法を提案する。属性選択アルゴリズムと機械学習モデルを用いて、カイ二乗検定(Chi2)、情報ゲイン、ReliefFを用いて特徴量をランク付けした。ランダムフォレストを用いた際、3つの特徴量のみで73%の精度が達成された。

ABSTRACT

As known, attribute selection is a method that is used before the classification of data mining. In this study, a new data set has been created by using attributes expressing overall satisfaction in Turkey Statistical Institute (TSI) Life Satisfaction Survey dataset. Attributes are sorted by Ranking search method using attribute selection algorithms in a data mining application. These selected attributes were subjected to a classification test with Naive Bayes and Random Forest from machine learning algorithms. The feature selection algorithms are compared according to the number of attributes selected and the classification accuracy rates achievable with them. In this study, which is aimed at reducing the dataset volume, the best classification result comes up with 3 attributes selected by the Chi2 algorithm. The best classification rate was 73% with the Random Forest classification algorithm.

研究の動機と目的

  • TUİK人生満足度調査のデータセット次元を低減しつつ、分類性能を維持すること。
  • 複数の特徴選択アルゴリズム(カイ二乗検定、情報ゲイン、ReliefF)が性別分類に適した属性を特定する有効性を評価すること。
  • 選択された特徴量を用いて、さまざまなアルゴリズム(ナイーブベイズ、ランダムフォレスト)の分類精度を比較すること。
  • 調査データにおける性別予測の最適な特徴選択手法と分類器の組み合わせを特定すること。

提案手法

  • 人生満足度の全体的満足度に関連する属性に焦点を当て、TUİK人生満足度調査から新たなデータセットを構築した。
  • 性別に対する関連性に基づいて特徴量をランク付けするため、3つの属性選択アルゴリズム(カイ二乗検定、情報ゲイン、ReliefF)を適用した。
  • 各アルゴリズムで上位にランク付けされた特徴量を、ナイーブベイズおよびランダムフォレストにおける分類の入力として使用した。
  • 分類精度を主な指標として用いて性能を評価した。
  • 精度と使用された特徴量の数に基づいて、最も優れた性能を示した特徴量サブセットを選択した。
  • 特徴量数と分類精度のトレードオフを比較することで、プロセスの最適化を図った。

実験結果

リサーチクエスチョン

  • RQ1どの特徴選択アルゴリズム(カイ二乗検定、情報ゲイン、ReliefF)が最高の性別分類精度をもたらすか?
  • RQ2このデータセットで高い分類性能を達成するために必要な最適な特徴量の数は何か?
  • RQ3ナイーブベイズおよびランダムフォレストの分類モデルは、選択された特徴量で学習させた場合と、全特徴量を使用した場合とで、どのように性能が異なるか?
  • RQ4最小限の特徴量のセットを用いても、高い性別分類精度を維持できるか?

主な発見

  • カイ二乗検定(Chi2)特徴選択アルゴリズムが最も優れた分類性能を示し、わずか3つの特徴量を選択した場合に73%の精度を達成した。
  • ランダムフォレストがナイーブベイズを上回り、テストされた分類器の中で最高の精度を示した。
  • カイ二乗検定による特徴選択とランダムフォレストによる分類の組み合わせが、特徴量数と精度の最適なバランスを実現した。
  • 本研究では、調査の属性の小さな、慎重に選択されたサブセットを用いても、性別分類が可能であることを示した。
  • 選択された特徴量の数が性能に顕著な影響を与え、ある閾値を超えると利得が減少した。
  • 結果から、属性選択が分類品質を損なわず、データセットサイズを効果的に削減できることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。