[논문 리뷰] How Curiosity can be modeled for a Clickbait Detector
이 논문은 심리학적 및 인지 이론을 기반으로 하여 독자적 관심을 측정하기 위한 새로운 계산 모델을 제안한다. 이 모델은 새로움, 놀라움, 정보 격차와 관련된 수작업 특징을 활용하여 비지도 학습과 지도 학습을 조합하여 클릭베이트 헤드라인을 분류한다. 이는 인간의 관심을 주의의 동력으로 모델링함으로써 클릭베이트 헤드라인을 97.17%의 정확도로 분류하며, 디지털 콘텐츠 탐지에서 관심을 정량화한 최초의 尝시다.
The impact of continually evolving digital technologies and the proliferation of communications and content has now been widely acknowledged to be central to understanding our world. What is less acknowledged is that this is based on the successful arousing of curiosity both at the collective and individual levels. Advertisers, communication professionals and news editors are in constant competition to capture attention of the digital population perennially shifty and distracted. This paper, tries to understand how curiosity works in the digital world by attempting the first ever work done on quantifying human curiosity, basing itself on various theories drawn from humanities and social sciences. Curious communication pushes people to spot, read and click the message from their social feed or any other form of online presentation. Our approach focuses on measuring the strength of the stimulus to generate reader curiosity by using unsupervised and supervised machine learning algorithms, but is also informed by philosophical, psychological, neural and cognitive studies on this topic. Manually annotated news headlines - clickbaits - have been selected for the study, which are known to have drawn huge reader response. A binary classifier was developed based on human curiosity (unlike the work done so far using words and other linguistic features). Our classifier shows an accuracy of 97% . This work is part of the research in computational humanities on digital politics quantifying the emotions of curiosity and outrage on digital media.
연구 동기 및 목표
- 디지털 콘텐츠에서 인간의 관심을 위한 계산 모델의 부족을 해결하기 위해 심리학적 및 인지 이론에 기반한 접근을 제안한다.
- 언어나 어휘적 특징에만 의존하지 않고, 관심을 유도하는 능력에 기반해 클릭베이트 헤드라인을 식별하는 이진 분류기를 개발한다.
- 특히 지적적 관심과 청각적 관심 형태가 정량화 가능하며, 이를 통해 온라인 콘텐츠에서의 사용자 참여도를 예측할 수 있음을 검증한다.
- 헤드라인의 스타일적, 의미적, 구조적 특징이 정보 격차, 새로움, 놀라움을 통해 어떻게 관심을 유도하는지 탐구한다.
- 특히 관심과 분노를 포함한 정서 인식 분석을 가능하게 하여, 디지털 미디어 분석에 있어 정서 인식 기반의 컴퓨팅 인문학 기여를 한다.
제안 방법
- 심리학적 관심 이론에서 유래한 특징(새로움, 놀라움, 정보 격차)을 기반으로 하여 비지도 학습과 지도 학습을 조합하여 클릭베이트 헤드라인을 분류한다.
- 인지 및 신경 과학 연구에 기반한 수작업 특징: 새로움은 일상적인 주제에서의 의미적 이질성으로 모델링되며, 놀라움은 비정상적인 어순 또는 문법적 혼란으로 정의된다. 정보 격차는 지식이 불완전하다는 것을 암시하는 수사적 신호로 정의된다.
- 주제 모델(LDA)을 적용하여 헤드라인의 주제적 새로움을 식별하며, 최적의 주제 수(N=68)를 선택하기 위해 일관성 점수를 사용한다. 이는 클릭베이트 헤드라인이 정체성, 자기 자신, 대중 문화에 중점을 둔다는 것을 확인한다.
- SVM 및 로지스틱 회귀 분류기를 사용하며, 1:4 비율의 훈련-테스트 분할을 통해 학습하고, 정확도, F1 점수, 평균 제곱 오차(MSE)를 사용해 성능을 평가한다.
- I&D 모델(Litman, 2005)의 결과를 통합하여, I-관심(지적적)과 D-결핍(청각적) 관심이 서로 다른데도 상호 보완적인 참여 유도 요소로 간주한다.
- 기대 위반과 지식 격차를 통한 인지적 각성 능력을 평가하며, 도파민 반응과 같은 신경 기반 지표와 결과를 일치시킨다.
실험 결과
연구 질문
- RQ1디지털 헤드라인에서 인간의 관심—특히 지적적 및 청각적 형태—을 어떻게 계산적으로 모델링할 수 있는가?
- RQ2새로움, 놀라움, 정보 격차와 같은 특징이 전통적인 언어적 특징보다 클릭베이트 효과를 더 잘 예측할 수 있는가?
- RQ3관심 기반 특징으로 훈련된 기계 학습 분류기가 기존 방법보다 더 뛰어난 성능을 보일 수 있는가?
- RQ4클릭베이트 헤드라인의 주제 분포는 일반 뉴스 헤드라인과 비교해 의미적 새로움과 자기 정체성과의 관련성 측면에서 어떻게 다를까?
- RQ5의미적 새로움, 문법적 놀라움, 수사적 정보 격차 중 어느 것이 독자의 관심을 더 강하게 이끌는가?
주요 결과
- 모든 수작업 특징(새로움, 놀라움, 정보 격차)을 사용한 제안된 모델은 97.17%의 분류 정확도를 달성하였으며, 순수하게 새로움 또는 놀라움에 기반한 모델보다 유의미하게 뛰어난 성능을 보였다.
- 모델의 최고 정확도(99.17%)는 오직 새로움 특징을 사용했을 때 도달되었으며, 이는 일상적인 주제에서의 의미적 이질성이 클릭베이트 잠재력의 가장 강력한 예측 변수임을 시사한다.
- 주제 모델은 클릭베이트 헤드라인이 정치나 전쟁 같은 일반 뉴스 주제보다는 정체성, 자기 자신, 유명인, 대중 문화(예: 별자리, 미용, 웰빙)와 관련된 주제를 훨씬 더 많이 다룬다는 것을 확인했다.
- 클릭베이트 헤드라인은 번호 사용, 수사적 질문, 완전하지 않은 문장과 같은 스타일적 특징을 통해 강력한 정보 격차를 생성하여 독자가 정보를 보완하려는 욕구를 자극한다.
- 놀라움 기반 특징은 정확도가 낮았지만(F1 점수 0.9674), 이는 문법적 또는 어휘적 예측 불가능성이 높은 신호임을 시사하지만, 의미적 새로움만큼은 강력한 신호로 작용하지는 않는다.
- 결과는 청각적 관심(기피 유도형)과 지적적 관심(기쁨 유도형)이 서로 다른데도 보완적인 메커니즘임을 지지하며, 지적적 관심이 뛰어난 클릭베이트 특징과 더 잘 일치함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.