Skip to main content
QUICK REVIEW

[논문 리뷰] Web-based Application for Detecting Indonesian Clickbait Headlines using IndoBERT

Muhammad Noor Fakhruzzaman, Sie Wildan Gunawan|arXiv (Cornell University)|2021. 02. 21.
Spam and Phishing Detection참고 문헌 14인용 수 7
한 줄 요약

이 논문은 클라우드 서버에 호스팅된 RESTful API를 활용하여 최소한의 클라이언트 리소스로 실시간 예측이 가능한 경량 웹 기반 클릭베이트 감지 애플리케이션을 제안한다. 인도네시아어 뉴스 헤드라인을 대상으로 IndoBERT Lite Base를 사용하며, 평균 ROC-AUC가 89%에 도달하여 인도네시아에서 가짜정보 확산을 억제하고 디지털 리터러시를 향상시키는 실용적이고 접근 가능한 도구를 제공한다.

ABSTRACT

With increasing usage of clickbaits in Indonesian Online News, newsworthy articles sometimes get buried among clickbaity news. A reliable and lightweight tool is needed to detect such clickbaits on-the-go. Leveraging state-of-the-art natural language processing model BERT, a RESTful API based application is developed. This study offloaded the computing resources needed to train the model on the cloud server, while the client-side application only needs to send a request to the API and the cloud server will handle the rest. This study proposed the design and developed a web-based application to detect clickbait in Indonesian using IndoBERT as a language model. The application usage is discussed and available for public use with a performance of mean ROC-AUC of 89%.

연구 동기 및 목표

  • 인도네시아 온라인 뉴스에서 증가하는 클릭베이트 헤드라인 문제를 해결하기 위해, 독자를 오도하고 디지털 격차를 심화시킬 수 있음을 다루기 위해.
  • 기술 전문 지식이나 높은 계산 자원이 필요 없이도 사용자가 클릭베이트를 감지할 수 있도록 경량이고 접근 가능한 도구를 개발하기 위해.
  • 학술적 클릭베이트 감지 연구와 실용적 응용 간 격차를 메우기 위해 기능성 있고 공개 가능한 웹 기반 시스템을 제공하기 위해.
  • 사용자 친화적인 도구를 제공하여 독자가 클릭베이트와 정당한 뉴스 헤드라인을 구분할 수 있도록 하여 인도네시아의 디지털 리터러시를 향상시키기 위해.
  • 강력한 예측 성능를 유지하면서도 더 작은 효율적인 언어 모델(IndoBERT Lite Base)을 사용하여 서버 비용과 메모리 사용량을 줄이기 위해.

제안 방법

  • 시스템은 확장성과 보안을 위해 Gunicorn과 Nginx를 리버스 프록시로 사용하여 DigitalOcean 드롭렛에 배포된 Flask로 구축된 RESTful API 아키텍처를 사용한다.
  • 핵심 모델은 12개의 레이어와 약 1170만 개의 파라미터를 가진 다국어 BERT의 정제된 버전인 IndoBERT Lite Base이며, 균형 잡힌 6,000개의 인도네시아어 헤드라인 애너테이션 데이터셋으로 미세조정되었다.
  • 예측은 /predict 엔드포인트로의 POST 요청을 통해 이루어지며, 입력 텍스트를 처리하고 JSON 형식으로 이진 분류 결과(클릭베이트 또는 비클릭베이트)를 반환한다.
  • 예측에 대한 사용자 피드백은 향후 재학습을 위해 MySQL 데이터베이스에 수집 및 저장되어 모델의 강건성 향상에 기여한다.
  • 스팸 및 DoS 공격을 방지하기 위해 HTTPS와 백엔드에서의 요청 제한(분당 2회)을 사용하여 애플리케이션을 보호한다.
  • 프론트엔드는 GitHub Pages에 호스팅되어 HTTPS를 통해 백엔드 API와 통신하며, 로컬 모델 배포가 필요 없이 원활한 클라이언트 사이드 상호작용을 가능하게 한다.

실험 결과

연구 질문

  • RQ1경량화된 클라우드 호스팅 NLP 애플리케이션은 높은 정확도와 낮은 리소스 소비로 인도네시아어 클릭베이트 헤드라인을 효과적으로 감지할 수 있는가?
  • RQ2인도네시아어 클릭베이트 감지 맥락에서 Multilingual BERT와 비교해 IndoBERT Lite Base의 성능은 어떠한가?
  • RQ3공개 가능한 웹 애플리케이션이 디지털 리터러시 향상과 오락성 뉴스 헤드라인 식별에 얼마나 기여할 수 있는가?
  • RQ4사용자 피드백 수집이 클릭베이트 감지 모델의 장기적 신뢰성과 재학습 가능성에 어떤 영향을 미치는가?
  • RQ5RESTful API 아키텍처는 향후 브라우저 확장 프로그램이나 미디어 대시보드와 같은 도구와의 통합을 보장할 수 있는가?

주요 결과

  • 웹 기반 애플리케이션이 평균 ROC-AUC 점수 89%를 달성하여 인도네시아어 클릭베이트와 비클릭베이트 헤드라인을 효과적으로 구분하는 데 강력한 성능을 보였다.
  • Multilingual BERT에서 IndoBERT Lite Base로 전환함으로써 약 800MB의 메모리 사용량이 감소하여 서버 리소스 요구량과 운영 비용이 크게 낮아졌다.
  • 성능의 약간의 희생이 있었음에도 불구하고, 더 가벼운 모델은 여전히 높은 예측 능력을 유지했으며, IndoBERT Lite Base 모델의 f1-score 평균은 85%였다.
  • 시스템은 사용자 피드백을 MySQL 데이터베이스에 성공적으로 통합하여 실제 예측 기반으로 향후 재학습과 모델 향상이 가능하도록 하였다.
  • 애플리케이션은 https://ruzcmc.github.io/ClickbaitIndo-textclassifier 에서 공개 가능하며, 전체 소스 코드, 모델, 데이터셋은 GitHub에서 이용 가능하다.
  • HTTPS 사용, 요청 제한, 보안 설계된 API를 통해 스팸 및 무단 액세스로부터의 보호가 가능하여 시스템의 신뢰성과 보안성이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.