Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Hierarchical Hybrid Networks for Clickbait Detection

Feng Liao, Hankz Hankui Zhuo|arXiv (Cornell University)|2019. 06. 03.
Misinformation and Its Impacts참고 문헌 15인용 수 5
한 줄 요약

이 논문은 원시 데이터를 공유하지 않고도 서로 다른 당사자들 사이에 분산된 제목과 내용을 기반으로 클릭베이트 검출 모델을 공동으로 훈련하는 페더레이티드 러닝 프레임워크인 페더럴 히에라르키컬 하이브리드 네트워크(FedHHN)를 제안한다. 제목과 내용 간의 계층적 관계를 하이브리드 신경망 아키텍처를 통해 활용함으로써 FedHHN는 최신 기술 수준의 성능을 달성하며, AUC-ROC는 0.66835, F1 스코어는 0.52898를 기록한다. 이는 원칙적으로 중심화된 환경에서 훈련된 모델과 거의 동일한 성능이다.

ABSTRACT

Online media outlets adopt clickbait techniques to lure readers to click on articles in a bid to expand their reach and subsequently increase revenue through ad monetization. As the adverse effects of clickbait attract more and more attention, researchers have started to explore machine learning techniques to automatically detect clickbaits. Previous work on clickbait detection assumes that all the training data is available locally during training. In many real-world applications, however, training data is generally distributedly stored by different parties (e.g., different parties maintain data with different feature spaces), and the parties cannot share their data with each other due to data privacy issues. It is challenging to build models of high-quality federally for detecting clickbaits effectively without data sharing. In this paper, we propose a federated training framework, which is called federated hierarchical hybrid networks, to build clickbait detection models, where the titles and contents are stored by different parties, whose relationships must be exploited for clickbait detection. We empirically demonstrate that our approach is effective by comparing our approach to the state-of-the-art approaches using datasets from social media.

연구 동기 및 목표

  • 개인정보 제약으로 인해 훈련 데이터가 여러 당사자들 사이에 분산되어 있는 실제 환경에서 클릭베이트 검출 문제를 해결한다.
  • 데이터 사일로 문제로 인해 실현 가능성이 떨어지는 중심화된 데이터에 의존하는 기존 모델의 한계를 극복한다.
  • 데이터 공유 없이도 서로 다른 소스의 제목 및 내용 특징을 효과적으로 활용할 수 있는 페더레이티드 러닝 프레임워크를 개발한다.
  • 제목과 해당 기사 내용 간의 의미적 연결을 모델링하여 오락성이나 모호한 제목을 식별하는 데 필수적인 요소인 제목과 내용 간의 관계를 이해함으로써 클릭베이트 검출 성능을 향상시킨다.
  • 데이터가 공유되지 않고 당사자들 사이에 분산되어 있는 조건에서도 중심화된 훈련과 유사한 성능을 달성할 수 있음을 입증한다.

제안 방법

  • 원시 데이터를 공유하지 않고도 두 당사자(예: 제목 소유자 및 내용 소유자) 간에 모델 훈련이 가능한 '클릭베이트 페더럴 러닝'이라고 불리는 페더레이티드 훈련 프레임워크를 제안한다.
  • 제목과 내용의 국소적 특징과 그들의 복잡한 상호의존성을 어텐션 메커니즘과 표현의 연결을 통해 포괄하는 히에라르키컬 하이브리드 네트워크(HHN)를 설계한다.
  • 데이터 프라이버시를 유지하면서도 양 당사자로부터 온 모델 업데이트를 평균화하는 데 사용하는 페더럴 어웨이징(FedAvg) 전략을 적용한다.
  • TextCNN, TextRNN, 또는 FastText와 같은 아키텍처를 사용해 제목과 내용에 대해 별도의 인코더를 훈련한 후, 계층적인 방식으로 그 표현을 융합한다.
  • 융합된 표현에 대해 공통의 분류기 헤드를 적용하여 클릭베이트 레이블을 예측하고, 손실 값을 페더럴 러닝 파이프라인을 통해 역전파한다.
  • 다른 지역 모델 아키텍처(예: 서로 다른 인코더)를 허용하면서도 통합된 글로벌 모델을 유지함으로써 당사자 간의 모델 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1제목과 내용이 별개의 협력하지 않는 당사자들 사이에 분산되어 있는 상황에서, 페더레이티드 러닝 프레임워크가 클릭베이트 검출 모델을 효과적으로 훈련시킬 수 있는가?
  • RQ2제목과 내용을 별개로 모델링하는 것과 비교해, 제목과 내용 간의 의미적 연결을 모델링함으로써 클릭베이트 검출 성능이 얼마나 향상되는가?
  • RQ3데이터 아일랜드 제약 조건 하에서 훈련된 페더럴 모델이 전체 데이터 접근이 가능한 중심화된 모델의 성능을 어느 정도 따라올 수 있는가?
  • RQ4제목과 내용 표현의 히에라르키컬 융합이 단순 연결 또는 별도 모델링보다 더 나은 검출 성능을 내는가?
  • RQ5제안된 페더럴 프레임워크는 제목 및 내용 인코더에 대해 다양한 신경망 아키텍처에 대해 일반화 가능한가?

주요 결과

  • FedHHN는 AUC-ROC 0.66835와 F1 스코어 0.52898를 기록하며, 모든 기준 페더럴 모델을 능가하고 일부 중심화된 모델을 초월한다.
  • FedHHN로 훈련된 모델은 이상적인 중심화된 모델(HHN)과 거의 동일한 성능을 보이며, AUC-ROC 차이가 뿐다 0.00389, F1 스코어 차이가 0.00257에 불과하다.
  • 제목만으로도 내용만으로도 클릭베이트 검출에 더 유용한데, 예를 들어 TextCNN(𝒯)로만 훈련된 모델이 TextCNN(𝑪)로만 훈련된 모델보다 성능이 뛰어나다.
  • 제목 및 내용 특징을 모두 포함함으로써 성능 향상이 뚜렷하게 이루어지며, 이는 둘 간의 연결 고리가 오락성 또는 모호한 제목을 식별하는 데 필수적임을 확인한다.
  • 클릭베이트 페더럴 러닝은 공유되지 않은 데이터를 가진 당사자들 간의 효과적인 협업을 가능하게 하며, 프라이버시 제약을 위반하지 않고도 높은 수준의 모델 품질을 달성한다.
  • FedHHN는 FedCNN, FedRNN, FedSAN과 같은 다른 페더럴 모델보다 뛰어난 성능을 보이며, 이는 크로스모달 의존성을 효과적으로 포착하는 히에라르키컬 하이브리드 아키텍처의 유효성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.