[논문 리뷰] The Social Dynamics of Language Change in Online Networks
이 연구는 600만 명의 트위터 사용자 데이터셋을 사용하여 온라인 네트워크 내에서의 언어 변화를 사회적 영향력으로 모델링하며, 매개변수화된 하크스 프로세스를 적용하여 유대 강도—특히 높은 통합성을 가진 연결성—이 언어적 수용을 크게 증폭시킴을 보여주며, 특히 발음 철자법과 '넷스피크' 약어에서 그렇다. 반면 지리적 국소성은 미미한 역할을 한다.
Language change is a complex social phenomenon, revealing pathways of communication and sociocultural influence. But, while language change has long been a topic of study in sociolinguistics, traditional linguistic research methods rely on circumstantial evidence, estimating the direction of change from differences between older and younger speakers. In this paper, we use a data set of several million Twitter users to track language changes in progress. First, we show that language change can be viewed as a form of social influence: we observe complex contagion for phonetic spellings and "netspeak" abbreviations (e.g., lol), but not for older dialect markers from spoken language. Next, we test whether specific types of social network connections are more influential than others, using a parametric Hawkes process model. We find that tie strength plays an important role: densely embedded social ties are significantly better conduits of linguistic influence. Geographic locality appears to play a more limited role: we find relatively little evidence to support the hypothesis that individuals are more influenced by geographically local social ties, even in their usage of geographical dialect markers.
연구 동기 및 목표
- 온라인 환경에서 사회적 네트워크 구조가 언어 혁신의 확산에 어떻게 영향을 미치는지 조사하기 위해.
- 강한 또는 지리적으로 근접한 연결성과 같은 특정 유형의 사회적 유대가 언어 변화의 더 강력한 매개체로 작용하는지 테스트하기 위해.
- 통계적 방법을 사용하여 다양한 네트워크 특성 간의 영향을 정량화함으로써 언어 변화를 정보 확산의 한 형태로 모델링하기 위해.
- 복잡한 전염(다중 노출이 수용 확률을 증가시킴)이 발음 철자법과 어휘적 방언 표시와 같은 다양한 언어 형태에 적용되는지 여부를 판단하기 위해.
- 언어 이벤트 데이터의 희소성 패턴을 활용하여 대규모 사회 네트워크에 대해 확장 가능한 매개변수 추정 방법을 개발하기 위해.
제안 방법
- 미국 기반 600만 명의 사용자로부터 수집된 공개 메시지, 사회적 네트워크 유대, 지리적 위치 메타데이터를 포함한 대규모 트위터 데이터셋을 사용하며, 재트윗는 제외한다.
- 사용자의 언어 변수 최초 사용 시점을 이벤트 시간으로 하는 매개변수화된 하크스 프로세스를 사용하여 언어 수용를 점진적 프로세스로 모델링한다.
- 두 가지 핵심 네트워크 특성을 공변량으로 포함한다: F3(유대 강도, 상호 상호작용 빈도로 측정), F4(지리적 국소성, 사용자 위치 간의 거리 기반).
- F3/F4가 포함된 모델과 포함되지 않은 모델을 비교하기 위해 우도 비율 검정을 사용하여 네트워크 특성이 언어 수용을 설명하는 데 통계적으로 유의미한지 평가한다.
- 32개의 단어-특성 조합(16개 단어 × 2개 특성)에 걸쳐 다중 가설 검정을 수행할 경우를 고려하여 벤자민-하크버그 절차를 적용하여 유의성 수준을 보정한다.
- 언어 이벤트 데이터의 희소성에 유의한 방법을 사용하여 하크스 프로세스 모델을 수백만 명의 사용자가 포함된 네트워크에 확장하며, 계산 효율성을 향상시킨다.
실험 결과
연구 질문
- RQ1발음 철자법과 '넷스피크' 약어가 복잡한 전염을 보이며, 다수의 노출이 수용 가능성 증가에 기여하는가?
- RQ2밀도 높은 사회적 유대(강한 유대)가 약한 또는 무작위 유대보다 언어 혁신을 더 효과적으로 퍼뜨리는가?
- RQ3사용자 간의 지리적 근접성이 언어적 영향력 증가에 유의미하게 기여하는가?
- RQ4비표준 어휘 항목, 발음 철자법, '넷스피크'와 같은 다양한 언어 유형이 사회적 영향 메커니즘 측면에서 다르게 행동하는가?
- RQ5매개변수화된 하크스 프로세스 모델이 실시간 온라인 네트워크 내 언어 변화에 대한 사회적 네트워크 구조의 영향을 효과적으로 포착하고 정량화할 수 있는가?
주요 결과
- 발음 철자법과 '넷스피크' 약어(예: 'lol', 'hella')는 다수의 노출이 수용 확률을 크게 증가시키는 복잡한 전염을 보이며, 이는 그들의 확산이 다중 노출에 의해 강화됨을 시사한다.
- 높은 유대 강도를 가진 밀도 높은 사회적 유대는 약하거나 덜 통합된 유대보다 언어 혁신을 더 효과적으로 퍼뜨리는 데 유의미하게 영향을 미치며, 이는 H1을 지지한다.
- 지리적 국소성(F4)을 추가했을 때 모델 적합도가 통계적으로 유의미하게 향상된 단어는 총 3개뿐이었다: 'asl', 'jawn', 'lls'로, 이는 H2에 대한 지원이 제한적임을 시사한다.
- 10,000회 미만의 사용 빈도를 가진 단어의 경우, 네트워크 구조 특성(F3 및 F4)이 모델 적합도를 유의미하게 향상시키지 못한다.
- 유대 강도(F3)를 포함한 하크스 프로세스 모델은 'ard', 'asl', 'cookout', 'hella', 'jawn', 'mfs', 'tfti' 등 총 7개의 단어에서 모델 적합도가 유의미하게 향상된다.
- 이 연구는 언어적 영향력이 네트워크 전반에 균일하게 분포하지 않으며, 사회적 평가에 기반한 유대 강도의 판단에 의해 전략적으로 매개됨을 보여주며, 온라인 커뮤니케이션에서 정체성 기반 언어 선택의 중요성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.