[논문 리뷰] Feature Selection for Gender Classification in TUIK Life Satisfaction Survey
이 연구는 TÜİK 생활만족도 조사에서 성별 분류 성능을 향상시키기 위해 특성 선택 기법과 기계학습 모델을 활용한 특성 선택 접근법을 제안한다. 카이제곱, 정보량 증가량, ReliefF를 적용하여 특성 순위를 매겨, 랜덤 포레스트를 사용할 경우 단 3개의 특성으로도 73%의 정확도를 달성하였다.
As known, attribute selection is a method that is used before the classification of data mining. In this study, a new data set has been created by using attributes expressing overall satisfaction in Turkey Statistical Institute (TSI) Life Satisfaction Survey dataset. Attributes are sorted by Ranking search method using attribute selection algorithms in a data mining application. These selected attributes were subjected to a classification test with Naive Bayes and Random Forest from machine learning algorithms. The feature selection algorithms are compared according to the number of attributes selected and the classification accuracy rates achievable with them. In this study, which is aimed at reducing the dataset volume, the best classification result comes up with 3 attributes selected by the Chi2 algorithm. The best classification rate was 73% with the Random Forest classification algorithm.
연구 동기 및 목표
- TÜİK 생활만족도 조사의 데이터셋 차원을 줄이되 분류 성능를 유지하기 위해.
- 다양한 특성 선택 알고리즘(카이제곱, 정보량 증가량, ReliefF)이 성별 분류에 적합한 특성들을 식별하는 데 효과적인지 평가하기 위해.
- 선택된 특성들을 사용할 때 다양한 알고리즘(Naive Bayes, 랜덤 포레스트) 간의 분류 정확도를 비교하기 위해.
- 설문 조사 데이터에서 성별 예측을 위한 최적의 특성 선택 방법과 분류기 조합을 규명하기 위해.
제안 방법
- 전반적인 만족도 관련 특성에 중점을 두어 TÜİK 생활만족도 조사에서 새로운 데이터셋을 구축하였다.
- 성별에 대한 관련성 기반으로 특성 순위를 매기기 위해 세 가지 특성 선택 알고리즘(카이제곱, 정보량 증가량, ReliefF)을 적용하였다.
- 각 알고리즘에서 상위 순위를 받은 특성들을 사용하여 Naive Bayes와 랜덤 포레스트를 활용한 분류를 수행하였다.
- 주로 정확도를 성능 평가 지표로 사용하여 성능을 평가하였다.
- 정확도와 사용된 특성 수를 기반으로 최고 성능을 보인 특성 조합을 선별하였다.
- 특성 수와 분류 정확도 사이의 트레이드오���을 비교함으로써 프로세스를 최적화하였다.
실험 결과
연구 질문
- RQ1카이제곱, 정보량 증가량, ReliefF 중 어느 특성 선택 알고리즘이 가장 높은 성별 분류 정확도를 제공하는가?
- RQ2이 데이터셋에서 높은 분류 성능를 달성하기 위해 필요한 최적의 특성 수는 얼마인가?
- RQ3선택된 특성들을 사용할 때, 분류 모델(Naive Bayes와 랜덤 포레스트)은 전체 특성 세트를 사용할 때와 비교해 어떻게 성능을 내는가?
- RQ4최소한의 특성 조합으로도 높은 성별 분류 정확도를 유지하면서 데이터셋의 복잡성을 줄일 수 있는가?
주요 결과
- 카이제곱 특성 선택 알고리즘이 가장 높은 분류 성능를 보였으며, 단 3개의 특성으로도 73%의 정확도를 달성하였다.
- 랜덤 포레스트가 나이브 베이즈를 능가하여 테스트된 분류기 중에서 가장 높은 정확도를 기록하였다.
- 카이제곱 선택과 랜덤 포레스트 분류의 조합이 특성 수와 정확도 사이의 최적 균형을 이룩하였다.
- 이 연구는 소량의 정교하게 선택된 설문 조사 특성 조합을 통해 성별 분류가 가능하다는 것을 입증하였다.
- 선택된 특성 수가 성능에 상당한 영향을 미쳤으며, 특정 임계값을 초과하면 수익 감소 현상이 나타났다.
- 결과는 특성 선택 기법이 분류 품질을 훼손하지 않으면서도 데이터셋 크기를 효과적으로 줄일 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.