[논문 리뷰] Cats and Captions vs. Creators and the Clock: Comparing Multimodal Content to Context in Predicting Relative Popularity
이 논문은 소셜 미디어에서 상대적 인기도를 예측하는 데에 다중모달 콘텐츠(이미지 및 캡션)가 아니면 사회적 요인(창작자 신원, 시기)이 더 효과적인지 조사한다. 30초 이내에 동일한 커뮤니티에 게시된 레딧 포스트 쌍을 비교함으로써, '고양이와 캡션'—시각적 및 텍스트적 특징의 조합—가 사회적 및 시기적 기준을 뛰어넘어 성능을 발휘함을 발견하였으며, 다중모달 모델이 여섯 개의 서브레딧 중 다섯 곳에서 업보트 순위 예측 정확도가 가장 높았다.
The content of today's social media is becoming more and more rich, increasingly mixing text, images, videos, and audio. It is an intriguing research question to model the interplay between these different modes in attracting user attention and engagement. But in order to pursue this study of multimodal content, we must also account for context: timing effects, community preferences, and social factors (e.g., which authors are already popular) also affect the amount of feedback and reaction that social-media posts receive. In this work, we separate out the influence of these non-content factors in several ways. First, we focus on ranking pairs of submissions posted to the same community in quick succession, e.g., within 30 seconds, this framing encourages models to focus on time-agnostic and community-specific content features. Within that setting, we determine the relative performance of author vs. content features. We find that victory usually belongs to "cats and captions," as visual and textual features together tend to outperform identity-based features. Moreover, our experiments show that when considered in isolation, simple unigram text features and deep neural network visual features yield the highest accuracy individually, and that the combination of the two modalities generally leads to the best accuracies overall.
연구 동기 및 목표
- 소셜 미디어 포스트 인기도를 예측할 때 시기 및 사용자 신원과 같은 혼동 요인들로부터 콘텐츠의 영향을 분리하는 것.
- 온라인 커뮤니티에서 상대적 인기도를 예측하는 데에 다중모달 콘텐츠(이미지 및 캡션)가 아니면 사회적/맥락적 특징(작성자 상태, 게시 시간)이 더 예측력이 있는지 조사하는 것.
- 유사한 포스트 간의 콘텐츠 특징을 공정하게 비교할 수 있도록 시간 제어가 된 쌍별 순위 지정 프레임워크를 개발하는 것.
- 소셜 및 시간 기반 기준과 비교하여 시장에서 이용 가능한 시각적 및 텍스트적 특징의 상대적 성능을 평가하는 것.
- 향후 소셜 미디어에서 다중모달 콘텐츠 선호도에 관한 연구를 위해 공개된 데이터셋과 벤치마크를 제공하는 것.
제안 방법
- 30초 이내에 동일한 서브레딧에 게시된 다중모달 레딧 포스트(이미지 + 캡션) 쌍을 수집하여 시간적 및 커뮤니티 수준의 통제를 확보한다.
- 두 유사한 포스트 중 어느 쪽이 더 많은 업보트를 받을지를 예측하는 쌍별 순위 설정을 사용하여 시기 및 사용자 신원의 영향을 최소화한다.
- 시장에서 이용 가능한 특징을 활용: 예를 들어 ResNet 등의 딥 네트워크 시각 임베딩 및 유니그램 텍스트 특징(TF-IDF 또는 보그 방식)을 콘텐츠 모델링에 사용한다.
- 콘텐츠 특징(시각적, 텍스트적, 다중모달)의 예측 성능을 사회 기준(사용자 카르마, 게시 시간) 및 시간 기준과 비교한다.
- 이중 분류기 모델을 훈련하고 평가하여 쌍 내에서 어느 포스트가 더 많은 업보트를 받을지를 예측하며, 정확도를 주요 평가 지표로 사용한다.
- 인간 평가 연구를 수행하여 순위 차이가 숨겨진 정렬 또는 인터페이스 효과가 아니라 콘텐츠 차이 때문임을 검증한다.
실험 결과
연구 질문
- RQ1소셜 미디어에서 시각적 및 텍스트적 콘텐츠 특징이 사회적 및 시간적 요인보다 상대적 인기도를 얼마나 잘 예측할 수 있는가?
- RQ2시각적 및 텍스트적 특징을 결합하면 각각의 모odal을 별도로 사용할 때보다 예측 정확도가 향상되는가?
- RQ3게시 시간 및 사용자 신원을 통제할 때, 다양한 특징 유형(예: 유니그램 텍스트, 딥 시각 특징) 간의 예측 정확도는 어떻게 비교되는가?
- RQ4어떤 커뮤니티에서 콘텐츠가 사회적 지위나 시기보다 포스트 인기도를 결정하는 데 더 우세한가?
- RQ5rich-get-richer 효과가 존재하는 현실의 소셜 미디어 환경에서도 콘텐츠 전용 모델이 상대적 인기도를 신뢰성 있게 예측할 수 있는가?
주요 결과
- 검토한 여섯 서브레딧 중 다섯 곳에서, 다중모달 특징(시각적 + 텍스트적)이 개별 모달 및 사회/시기 기준을 모두 뛰어넘어 상대적 인기도 예측에서 뛰어난 성능을 보였다.
- 개별적으로 고려할 때, 딥 네트워크 시각 특징이 가장 높은 개별 정확도를 기록하였으며, 그 다음으로 유니그램 텍스트 특징이 뒤를 이었다.
- 시각적 및 텍스트적 특징의 조합이 가장 높은 총합 예측 정확도를 기록하여 두 모달 간의 상호보완적 효과를 입증하였다.
- 연구에서 사용한 시간 제어 쌍화 방법은 게시 시간 및 사용자 신원의 영향을 효과적으로 최소화하였으며, 대부분의 경우 콘텐츠의 차이가 인기도에 영향을 준다는 가정을 검증하였다.
- 인간 평가를 통해 콘텐츠의 차이—예를 들어 캡션의 유머감각이나 이미지 품질—이 업보트 차이의 주요 원인임이 확인되었으며, 숨겨진 인터페이스나 정렬 편향은 주요 원인이 아니었다.
- 한 서브레딧(r/RedditLaqueristas)에서는 사회적 특징(예: 사용자 상태)이 콘텐츠 특징보다 더 예측력이 높았으며, 이는 사회적 요소의 지배력이 맥락에 따라 달라질 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.