Skip to main content
QUICK REVIEW

[论文解读] Web-based Application for Detecting Indonesian Clickbait Headlines using IndoBERT

Muhammad Noor Fakhruzzaman, Sie Wildan Gunawan|arXiv (Cornell University)|Feb 21, 2021
Spam and Phishing Detection参考文献 14被引用 7
一句话总结

本文提出了一种轻量级、基于网络的印尼语新闻标题点击诱饵检测应用,采用IndoBERT Lite Base模型,通过在云服务器上托管的RESTful API实现实时预测,客户端资源消耗极低。该系统实现了89%的平均ROC-AUC,提供了一种实用且易访问的工具,有助于应对印尼的虚假信息问题并提升数字素养。

ABSTRACT

With increasing usage of clickbaits in Indonesian Online News, newsworthy articles sometimes get buried among clickbaity news. A reliable and lightweight tool is needed to detect such clickbaits on-the-go. Leveraging state-of-the-art natural language processing model BERT, a RESTful API based application is developed. This study offloaded the computing resources needed to train the model on the cloud server, while the client-side application only needs to send a request to the API and the cloud server will handle the rest. This study proposed the design and developed a web-based application to detect clickbait in Indonesian using IndoBERT as a language model. The application usage is discussed and available for public use with a performance of mean ROC-AUC of 89%.

研究动机与目标

  • 为应对印尼在线新闻中日益严重的点击诱饵标题问题,此类标题可能误导读者并加剧数字鸿沟。
  • 开发一种轻量级、易访问的工具,使用户无需技术专长或高算力资源即可检测点击诱饵。
  • 通过提供一个功能完整且公开可用的基于网络的系统,弥合学术点击诱饵检测研究与实际应用之间的差距。
  • 通过提供用户友好的工具,帮助读者区分点击诱饵与真实新闻标题,从而提升印尼的数字素养。
  • 通过使用更小且高效的语言模型(IndoBERT Lite Base),在保持强大预测性能的同时,降低服务器成本和内存使用。

提出的方法

  • 系统采用Flask构建的RESTful API架构,部署在DigitalOcean的droplet上,使用Gunicorn作为WSGI服务器,并通过Nginx作为反向代理,以确保可扩展性和安全性。
  • 核心模型为IndoBERT Lite Base,是多语言BERT的蒸馏版本,包含12层,约1170万个参数,已在包含6000个标注印尼语标题的平衡数据集上进行微调。
  • 通过向 /predict 端点发送POST请求进行预测,系统处理输入文本并以JSON格式返回二元分类结果(点击诱饵或非点击诱饵)。
  • 用户对预测结果的反馈被收集并存储在MySQL数据库中,用于未来模型再训练,从而逐步提升模型的鲁棒性。
  • 通过HTTPS和后端速率限制(每分钟最多2次请求)实现安全防护,防止垃圾信息和拒绝服务攻击。
  • 前端托管在GitHub Pages上,通过HTTPS与后端API通信,实现无缝的客户端交互,无需在本地部署模型。

实验结果

研究问题

  • RQ1轻量级、云托管的NLP应用是否能以高准确率和低资源消耗有效检测印尼语点击诱饵标题?
  • RQ2在印尼语点击诱饵检测背景下,IndoBERT Lite Base与更大的模型(如Multilingual BERT)相比表现如何?
  • RQ3公开可访问的网络应用在多大程度上能提升数字素养,并帮助用户识别误导性新闻标题?
  • RQ4用户反馈收集对点击诱饵检测模型的长期可靠性及再训练潜力有何影响?
  • RQ5基于RESTful API的架构如何确保可扩展性、安全性,并便于未来与浏览器扩展或媒体仪表板等工具集成?

主要发现

  • 该网络应用实现了89%的平均ROC-AUC得分,表明其在区分印尼语点击诱饵与非点击诱饵标题方面表现优异。
  • 从Multilingual BERT切换到IndoBERT Lite Base后,内存使用量减少了约800MB,显著降低了服务器资源需求和运营成本。
  • 尽管存在性能权衡,但轻量化模型仍保持了高水平的预测能力,其IndoBERT Lite Base模型的f1-score平均达到85%。
  • 系统成功将用户反馈集成至MySQL数据库,支持未来再训练,基于真实预测结果实现模型持续改进。
  • 该应用可通过 https://ruzcmc.github.io/ClickbaitIndo-textclassifier 公开访问,完整源代码、模型和数据集均已在GitHub上发布。
  • 通过使用HTTPS、速率限制和安全的API设计,系统有效防范垃圾信息和未授权访问,显著提升了系统的可靠性与安全性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。