[논문 리뷰] Text Classification Using Hybrid Machine Learning Algorithms on Big Data
이 논문은 웨카와 자바를 사용하여 소셜 미디어 텍스트 데이터셋에서 단일 Naïve Bayes(61.45%) 및 SVM(69.21%)보다 유의하게 높은 96.76%의 정확도를 달성하면서, 텍스트 마이닝 기법을 통합한 하이브리드 기계학습 모델을 제안한다. 이 모델은 계산 복잡도를 감소시키고 빅데이터 환경에서 텍스트 분류의 정확성과 효율성을 향상시킨다.
Recently, there are unprecedented data growth originating from different online platforms which contribute to big data in terms of volume, velocity, variety and veracity (4Vs). Given this nature of big data which is unstructured, performing analytics to extract meaningful information is currently a great challenge to big data analytics. Collecting and analyzing unstructured textual data allows decision makers to study the escalation of comments/posts on our social media platforms. Hence, there is need for automatic big data analysis to overcome the noise and the non-reliability of these unstructured dataset from the digital media platforms. However, current machine learning algorithms used are performance driven focusing on the classification/prediction accuracy based on known properties learned from the training samples. With the learning task in a large dataset, most machine learning models are known to require high computational cost which eventually leads to computational complexity. In this work, two supervised machine learning algorithms are combined with text mining techniques to produce a hybrid model which consists of Naïve Bayes and support vector machines (SVM). This is to increase the efficiency and accuracy of the results obtained and also to reduce the computational cost and complexity. The system also provides an open platform where a group of persons with a common interest can share their comments/messages and these comments classified automatically as legal or illegal. This improves the quality of conversation among users. The hybrid model was developed using WEKA tools and Java programming language. The result shows that the hybrid model gave 96.76% accuracy as against the 61.45% and 69.21% of the Naïve Bayes and SVM models respectively.
연구 동기 및 목표
- 빅데이터 소스인 소셜 미디어 플랫폼에서 유래한 비정형이자 고속의 텍스트 데이터를 분석하는 데 도전하는 것.
- 대규모 데이터셋에서 텍스트 분류 작업의 계산 복잡도와 비용을 감소시키는 것.
- Naïve Bayes와 SVM을 융합하여 개별 기계학습 모델보다 높은 분류 정확도를 달성하는 것.
- 사용자 댓글을 법적 또는 비법적으로 분류하기 위한 개방형 플랫폼을 개발하여 대화 품질을 향상시키는 것.
제안 방법
- 텍스트 분류를 위해 Naïve Bayes와 Support Vector Machine(SVM) 분류기의 통합을 통해 하이브리드 모델을 구축한다.
- 원시 비정형 텍스트 데이터에서 특징을 추출하기 위해 텍스트 마이닝 기법을 적용하여 전처리를 수행한다.
- 모델은 웨카 기계학습 툴킷과 자바 프로그래밍 언어를 사용하여 구현된다.
- 성능 평가를 위해 훈련 및 테스트를 소셜 미디어 텍스트 데이터셋에서 수행한다.
- 하이브리드 접근법은 두 알고리즘의 장점을 활용한다: Naïve Bayes는 확률적 분류에 유리하고, SVM은 고차원 특징 공간에서 유리하다.
- 정확도를 주요 평가 지표로 삼아 하이브리드 모델을 개별 모델과 비교 평가한다.
실험 결과
연구 질문
- RQ1Naïve Bayes와 SVM을 융합하면 단일 모델을 사용하는 것보다 빅데이터 환경에서 텍스트 분류 정확도를 향상시킬 수 있는가?
- RQ2하이브리드 모델은 대규모 텍스트 분류에서 계산 복잡도와 비용을 어떻게 감소시키는가?
- RQ3하이브리드 모델은 소셜 미디어 플랫폼에서 사용자 생성 콘텐츠를 법적 또는 비법적 콘텐츠로 효과적으로 분류할 수 있는가?
- RQ4텍스트 마이닝 기법의 통합은 특징 표현과 분류 성능 향상에 기여하는가?
주요 결과
- 하이브리드 모델은 96.76%의 분류 정확도를 달성하여 단일 Naïve Bayes(61.45%) 및 SVM(69.21%)보다 뚜렷이 높은 성능을 보였다.
- 하이브리드 접근법은 두 알고리즘의 상호보완적 강점을 활용하여 계산 복잡도를 감소시켰다.
- 텍스트 마이닝 기법의 통합은 특징 추출 및 모델 입력 품질을 향상시켰다.
- 시스템은 소셜 미디어에서 사용자 댓글을 자동으로 분류하기 위한 확장 가능한 개방형 플랫폼을 제공한다.
- 결과는 하이브리드 모델이 볼륨, 속도, 다양성, 신뢰성의 4V 특성을 갖는 빅데이터를 효과적으로 처리하면서도 높은 정확도를 유지할 수 있음을 보여준다.
- 본 연구는 확률 기반 모델과 커널 기반 모델을 융합함으로써 비정형 데이터에서의 텍스트 분류 작업 성능을 향상시킬 수 있음을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.