Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Learning of Emoji-based Representations for Resource-Poor Languages

Nurendra Choudhary, Rajat Singh|arXiv (Cornell University)|2018. 04. 03.
Natural Language Processing Techniques참고 문헌 21인용 수 5
한 줄 요약

이 논문은 자원이 부족한 언어(Hindi, Telugu)와 자원이 풍부한 언어(영어, 스페인어)를 함께 학습하여 공통의 임베딩 공간에서 유사한 이모티콘을 가진 문장을 정렬함으로써, 시アン드롬 네트워크 기반의 대비 학습 프레임워크인 CESNA를 제안한다. 이모티콘 기반의 감독 신호와 대비 손실 함수를 활용함으로써, 공유 파rameter가 없는 상태에서 분포론적 의미론, 어휘집, 정렬되지 않은 딥 러닝 모델에 기반한 방법들을 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

The introduction of emojis (or emoticons) in social media platforms has given the users an increased potential for expression. We propose a novel method called Classification of Emojis using Siamese Network Architecture (CESNA) to learn emoji-based representations of resource-poor languages by jointly training them with resource-rich languages using a siamese network. CESNA model consists of twin Bi-directional Long Short-Term Memory Recurrent Neural Networks (Bi-LSTM RNN) with shared parameters joined by a contrastive loss function based on a similarity metric. The model learns the representations of resource-poor and resource-rich language in a common emoji space by using a similarity metric based on the emojis present in sentences from both languages. The model, hence, projects sentences with similar emojis closer to each other and the sentences with different emojis farther from one another. Experiments on large-scale Twitter datasets of resource-rich languages - English and Spanish and resource-poor languages - Hindi and Telugu reveal that CESNA outperforms the state-of-the-art emoji prediction approaches based on distributional semantics, semantic rules, lexicon lists and deep neural network representations without shared parameters.

연구 동기 및 목표

  • 자원이 부족한 언어에서의 언어적 자원의 제한 문제를 해결하기 위해 이모티콘을 교차 언어 감독 신호로 활용하는 것.
  • 이모티콘 유사성에 기반하여 자원이 풍부한 언어와 자원이 부족한 언어의 문장에 대해 공통의 저차원 표현을 학습하는 것.
  • 언어 간 공유 모델 파rameter가 필요 없이 자원이 부족한 언어에서의 이모티콘 예측 성능을 향상시키는 것.
  • 이모티콘 기반의 대비 학습이 제로샷 또는 피처샷 설정에서 효과적으로 지식을 전이할 수 있음을 보여주는 것.

제안 방법

  • 자원이 부족한 언어와 자원이 풍부한 언어의 문장을 모두 인코딩하기 위해 공유 가중치를 가진 쌍둥이 Bi-LSTM 순환 신경망을 사용한다.
  • 문장 쌍 간의 유사도 측정 기반의 대비 손실 함수를 사용하며, 동일한 이모티콘을 공유하는 쌍에는 높은 유사도를 할당한다.
  • 손실 함수는 동일한 이모티콘을 가진 문장의 임베딩을 임베딩 공간에서 더 가까이, 다른 이모티콘을 가진 문장의 임베딩을 더 멀리 떨어지게 한다.
  • 학습 데이터는 영어, 스페인어, 히누, 텔루구어로 구성된 병렬 문장 쌍이며, 각각 해당 이모티콘으로 주석이 달려 있다.
  • 이 모델은 모든 언어 쌍에 대해 공동으로 학습되어 이모티콘 기반 감독을 통해 교차 언어 정렬을 가능하게 한다.
  • 최종 표현 공간은 공통 임베딩 공간에서 최소 거리 검색을 통해 자원이 부족한 언어에서 제로샷 이모티콘 예측을 가능하게 한다.

실험 결과

연구 질문

  • RQ1이모티콘 기반의 대비 학습이 자원이 부족한 언어와 자원이 풍부한 언어 간의 문장 표현을 효과적으로 정렬할 수 있는가?
  • RQ2자원이 풍부한 언어와의 공동 학습이 자원이 부족한 언어에서의 이모티콘 예측 성능을 향상시키는가?
  • RQ3제안된 CESNA 모델은 분포론적 의미론, 어휘집, 정렬되지 않은 신경망 기반 최신 기술 수준의 방법들과 비교해 어떻게 성능을 내는가?
  • RQ4어떤 정도까지 이모티콘 유사성이 자원이 부족한 환경에서 의미 유사성의 대체 지표로 작용할 수 있는가?

주요 결과

  • CESNA는 공유 파arameter가 없는 분포론적 의미론, 의미 규칙, 어휘집 목록, 딥 러닝 네트워크 기반의 최신 기술 수준의 이모티콘 예측 방법들을 능가한다.
  • 모델은 히누어와 텔루구어에서 이모티콘 예측 정확도에 상당한 향상을 이룩하여 이모티콘을 통한 교차 언어 정렬의 효과성을 입증한다.
  • 공유 시앙드롬 네트워크를 가진 대비 학습 목표는 고립적으로 학습된 모델에 비해 자원이 부족한 환경에서 더 나은 일반화 성능을 제공한다.
  • 이모티콘을 감독 신호로 사용함으로써, 병렬 단어 수준의 데이터가 필요 없이 자원이 부족한 언어로 효과적인 제로샷 전이 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.