Skip to main content
QUICK REVIEW

[논문 리뷰] Twitter User Geolocation using Deep Multiview Learning

Tien Huu, Duc Minh Nguyen|arXiv (Cornell University)|2018. 05. 11.
Human Mobility and Location-Based Analysis참고 문헌 25인용 수 7
한 줄 요약

이 논문은 텍스트, 네트워크, 메타데이터 특징을 통합하는 딥 멀티뷰 신경망 MENET을 제안하며, GeoText 및 UTGeo2011 데이터셋에서 국가 수준에서 64.8%의 정확도를 기록하고, 상태 수준의 지도 오차 지표를 향상시켜 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Predicting the geographical location of users on social networks like Twitter is an active research topic with plenty of methods proposed so far. Most of the existing work follows either a content-based or a network-based approach. The former is based on user-generated content while the latter exploits the structure of the network of users. In this paper, we propose a more generic approach, which incorporates not only both content-based and network-based features, but also other available information into a unified model. Our approach, named Multi-Entry Neural Network (MENET), leverages the latest advances in deep learning and multiview learning. A realization of MENET with textual, network and metadata features results in an effective method for Twitter user geolocation, achieving the state of the art on two well-known datasets.

연구 동기 및 목표

  • 제한된 레이블이 부여된 지도 태그가 있는 데이터와 노이즈가 많은 사용자 콘텐츠가 있는 트위터 사용자 지도 위치 특정의 과제를 해결한다.
  • 콘텐츠 중심 또는 네트워크 중심 접근 방식의 한계를 극복하기 위해 다양한 데이터 소스를 통합한다.
  • 다양한 유형의 특징을 통합할 수 있는 일반적이고 확장 가능한 딥 러닝 프레임워크를 개발한다.
  • 지역, 주 수준, 좌표 기반 지도 위치 특정 작업을 위한 표준 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • TF-IDF 텍스트 특징, 트윗 의미를 위한 doc2vec 임베딩, 사회적 네트워크 구조를 위한 node2vec 임베딩, 타임스탬프 기반 메타데이터를 포함한 네 가지 별도의 특징 시각을 처리하는 멀티입력 신경망 아키텍처인 MENET을 제안한다.
  • 각 특징 시각에서 독립적으로 계층적 표현을 학습하기 위해 딥 신경망을 사용한 후, 공통된 분류 헤드에서 융합한다.
  • TF-IDF 특징 공학을 적용하며, GeoText에서는 최소 빈도 40, UTGeo2011에서는 500을 사용하고, 300차원의 node2vec 및 doc2vec 임베딩을 적용한다.
  • 학습 시 ADAM 최적화 기법을 사용하며, 학습률은 0.0001로 설정하고, 출력층에 L2 정규화(λ = 0.1)를 적용한다.
  • 멀티뷰 특징 융합을 통해 콘텐츠, 사용자 상호작용, 시간 패턴에서 상호보완적인 신호를 모델이 포착할 수 있다.
  • 거리 오차 계산에 Haversine 공식을 사용하고, 평균/중위수 거리 오차 및 accuracy@161km와 같은 지표를 보고한다.

실험 결과

연구 질문

  • RQ1통합된 딥 러닝 모델이 텍스트, 네트워크, 메타데이터 특징을 효과적으로 융합하여 트위터 사용자 지도 위치 특정 정확도를 향상시킬 수 있는가?
  • RQ2콘텐츠, 사회적 그래프, 타임스탬프와 같은 다중 특징 시각의 통합은 단일 모odal 접근 방식보다 지도 위치 예측에서 어떻게 비교되는가?
  • RQ3딥 신경망을 사용한 멀티뷰 학습이 표준 벤치마크에서 기존 최신 기술 수준의 방법보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4모델은 지역 분류, 주 수준 분류, 좌표 회귀와 같은 다양한 지도 위치 특정 작업에서 어떻게 성능을 발휘하는가?
  • RQ5관리 구역 기반의 경계와 데이터 기반 지apartitioning을 사용할 경우, 모델의 일반화 능력과 오차 지표에 어떤 영향을 미치는가?

주요 결과

  • GeoText 데이터셋에서 MENET는 미국 주 수준에서 64.8%의 정확도를 기록했으며, 이는 [4]에서 기존 최신 기술 수준(41%)보다 23.8个百分点 향상된 성능이다.
  • 지역 분류 작업에서는 [4]에서의 최신 기술 수준 방법보다 9% 높은 정확도를 기록했으며, GeoText 데이터셋에서 59.1%의 정확도를 달성했다.
  • 지오좌표 예측에서는 GeoText에서 평균 거리 오차 474km, 중위수 오차 157km를 기록했으며, 평균 오차에서는 [8]을 능가하고, accuracy@161km에서는 동일한 성능을 기록했다.
  • UTGeo2011 데이터셋에서는 모든 비교 방법 중에서 가장 낮은 평균 거리 오차를 기록했지만, [24]와 [8]은 최적화된 지도 분할 기법 덕분에 다른 지표에서 더 나은 성능을 냈다.
  • 모델의 성능은 데이터 기반 클러스터링이 아닌 관리 구역 기반 경계 의존성으로 인해 제한을 받고 있으며, 이는 적응형 분할 기법을 도입할 경우 향상 가능성을 시사한다.
  • 제거 실험 결과, 텍스트, 의미, 네트워크, 시간 특징의 네 가지 유형을 모두 통합할 경우 최고의 성능을 기록함을 확인했으며, 이는 멀티뷰 학습 접근 방식의 타당성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.