[논문 리뷰] Computational Language Acquisition with Theory of Mind
이 논문은 화자 에이전트가 내부 이성모델(ToM) 청취자 모델을 사용하여 이미지 기반 참조 게임에서 언어의 정확성과 적절성을 향상시키기 위해 발화를 재정렬하는 계산적 언어 습득 프레임워크를 제안한다. 이론적 사고(ToM) 구성요소를 통합함으로써 청취자가 목표 이미지를 선택할 확률을 예측함으로써, 모델은 더 높은 정확도를 달성하고 더 유창하고 정확한 언어를 생성하며, 환경의 난이도가 증가할수록 이러한 성능 향상이 더욱 두드러진다.
Unlike current state-of-the-art language models, young children actively acquire language through interactions with their surrounding environment and caretakers. One mechanism that has been argued to be critical to language learning is the ability to infer the mental states of other agents in social environments, coined Theory of Mind (ToM) by Premack & Woodruff (1978). Drawing inspiration from the modern operationalized versions of ToM implemented in Rabinowitz et al. (2018) and Zhu et al. (2021), we build language-learning agents equipped with ToM, and measure its effects on the learning process. We model ToM by giving the speaker agent an internal listener model that is trained alongside the speaker and used to rerank potential utterances. We experiment with varying task difficulty, hypothesizing that models will acquire more complex language to adapt to stronger environmental pressures. We find that training speakers with a highly weighted ToM listener component leads to performance gains in our image referential game setting. We also find some evidence that increasing task difficulty in the training process results in more fluent and precise utterances in evaluation. This suggests the potential utility of further incorporating ToM, as well as other insights from child language acquisition, into computational models of language acquisition.
연구 동기 및 목표
- 계산적 에이전트가 상호작용적이고 기반된 환경에서 언어 습득에 이론적 사고(ToM) 메커니즘이 어떻게 영향을 미치는지 조사하기.
- 더 많은 의미적·시각적으로 유사한 간섭 이미지가 포함된 환경 난이도 증가가 학습된 언어의 복잡성과 품질에 어떤 영향을 미치는지 검토하기.
- 발달 심리학에서의 인간 언어 습득 통찰을 사회인지 및 담론적 추론을 통합함으로써 계산 모델과 연결하기.
- ToM과 환경적 압력이 함께 작용할 때 더 인간다운, 유창하고 정확한 언어 생성이 어떻게 발생하는지 평가하기.
제안 방법
- 화자 에이전트에 청취자 신뢰도를 목표 이미지 선택에 대해 예측할 수 있도록 훈련된 내부 이성모델(ToM) 청취자 모델을 탑재한다.
- 내부 ToM 청취자 모델의 확률 점수를 활용해 후보 발화를 재정렬하고, 청취자 기대에 가장 부합할 가능성이 높은 발화를 우선 선택한다.
- 화자 에이전트를 참조 게임 환경에서 훈련하여, 간섭물이 있는 목표 이미지를 설명할 수 있는 영어 발화를 생성하고, 청취자의 정확도와 신뢰도에 따라 보상을 받는다.
- CLIP, RoBERTa, TF-IDF 임베딩 기반으로 이미지 표현 분포에서 간섭물 샘플링을 통해 작업 난이도를 조절하여 시각적·의미적 유사도를 제어한다.
- 커리큘럼 스타일 훈련을 통해 간섭물 유사도를 조절하여 환경적 압력을 시뮬레이션한다.
- 정확한 목표 선택률을 성능 측정 지표로 사용하고, 자동화된 지표와 인간 평가를 통해 생성된 발화의 유창성과 정확성 평가를 실시한다.

실험 결과
연구 질문
- RQ1RQ1: 내부 이론적 사고(ToM) 청취자 구성요소의 통합이 언어 학습 에이전트의 성능과 언어 품질에 어떤 영향을 미치는가?
- RQ2RQ2: 더 유사한 간섭 이미지가 포함된 환경 난이도 증가에 따라 모델은 언어 출력을 어떻게 조정하는가?
- RQ3RQ3: ToM와 환경적 압력의 조합이 더 유창하고 정확하며 인간다운 언어 생성을 이끌어내는가?
- RQ4RQ4: 다양한 작업 조건 하에서 ToM를 탑재한 모델이 비-ToM 모델보다 얼마나 더 우수한 담론적 언어 생성 성능을 보이는가?
주요 결과
- ToM 구성요소를 탑재한 화자 모델은 최종 정확도와 생성된 발화의 유창성 측면에서 비-ToM이 없는 기준 모델보다 일관되게 뛰어난 성능을 보였다.
- 더 시각적·의미적으로 유사한 간섭물이 포함된 훈련 환경에서는 성능 향상이 항상 관찰되지 않더라도, 더 길고 정확하며 유창한 발화가 생성되었다.
- ToM 청취자 모델은 청취자가 정확히 이해할 가능성이 높은 발화를 선택함으로써 화자가 더 정확한 발화를 생성할 수 있도록 가능하게 했다.
- 환경 난이도 증가는 더 복잡한 언어 발달을 초래하며, 이는 환경의 압력이 언어의 정교함을 이끄는 것을 시사한다.
- 성능 향상에도 불구하고, 생성된 언어는 여전히 인간 수준의 캡션에 비해 유창성과 자연스러움에서 크게 뒤져 있다.
- ToM와 환경적 압력의 통합은 계산적 언어 습득에서 더 정교한 담론 인지 능력과 인간다운 언어 모델 개발에 잠재력을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.