Skip to main content
QUICK REVIEW

[논문 리뷰] Data Augmentation for Improving Emotion Recognition in Software Engineering Communication

Mia Mohammad Imran, Yashasvi Jain|arXiv (Cornell University)|2022. 08. 10.
Sentiment Analysis and Opinion Mining인용 수 4
한 줄 요약

이 논문은 소프트웨어 공학 커뮤니케이션에서 정서 인식 성능을 햖스키기 위해 극성 기반 데이터 증강 기법을 제안한다. BART 기반 텍스트 생성을 활용해 정서 극성을 유지하는 합성 훈련 데이터를 생성하며, GitHub 이슈 및 풀 리퀘스트 커멘트에서 평균 9.3% 향상된 마이크로 F1 스코어를 기록한다.

ABSTRACT

Emotions (e.g., Joy, Anger) are prevalent in daily software engineering (SE) activities, and are known to be significant indicators of work productivity (e.g., bug fixing efficiency). Recent studies have shown that directly applying general purpose emotion classification tools to SE corpora is not effective. Even within the SE domain, tool performance degrades significantly when trained on one communication channel and evaluated on another (e.g, StackOverflow vs. GitHub comments). Retraining a tool with channel-specific data takes significant effort since manually annotating large datasets of ground truth data is expensive. In this paper, we address this data scarcity problem by automatically creating new training data using a data augmentation technique. Based on an analysis of the types of errors made by popular SE-specific emotion recognition tools, we specifically target our data augmentation strategy in order to improve the performance of emotion recognition. Our results show an average improvement of 9.3% in micro F1-Score for three existing emotion classification tools (ESEM-E, EMTk, SEntiMoji) when trained with our best augmentation strategy.

연구 동기 및 목표

  • 도메인 특화 언어와 제한된 주석 데이터로 인해 일반 목적의 정서 분류기 성능이 열 劣한 소프트웨어 공학(SE) 커뮤니케이션 문제를 해결하기 위해.
  • 새로가운 GitHub 데이터셋을 기반으로 오류 분석을 수행해 기존 SE 정서 인식 도구의 잘못된 분류 원인을 규명하기 위해.
  • 수동 주석이 광범위하게 필요하지 않은 소프트웨어 공학 텍스트에 특화된 데이터 증강 전략을 개발하고 평가하여 모델의 일반화 및 성능 향상에 기여하기 위해.
  • 일반적인 어휘 교체가 아닌 정서 극성에 초점을 맞춘 증강 전략이 정서 분류 성능 향상에 가장 효과적임을 입증하기 위해.
  • 소프트웨어 공학 정서 인식 분야의 데이터 부족 문제를 해결하기 위한 확장 가능한 자동화된 솔루션을 제공하여 개발자 복지 및 팀 생산성 분석 도구의 향상에 기여하기 위해.

제안 방법

  • 6개의 주요 정서(Shaver et al., 1987)와 GoEmotions의 보조/제3차 분류를 포함한 2,000개의 GitHub 이슈 및 풀 리퀘스트 커멘트로 구성된 새로운 데이터셋을 정제하였다.
  • 세 가지 기존 도구(ESEM-E, EMTk, SEntiMoji)의 예측 결과를 분석하여 잘못된 분류 패턴을 규명하였으며, 오류의 주요 원인으로 어휘적 신호 인식 실패를 확인하였다.
  • 세 가지 데이터 증강 전략을 설계: 제약 없는 무작위 단어 교체, 정서 극성 기반 제약 있는 교체, 어휘 사전을 활용한 정서 특화 단어 교체.
  • 문맥 인식 텍스트 생성을 위해 BART 언어 모델을 활용하여 증강 샘플의 의미 일관성과 정서 일관성을 확보하였다.
  • 증강을 통해 훈련 데이터 크기를 10배로 증가시킨 후, 세 정서 분류기를 증강된 데이터로 미세조정하여 성능 향상 여부를 평가하였다.
  • 전체 데이터셋을 80%-20%로 전략적 분할하고, 주요 평가 지표로 마이크로 F1 스코어를 사용하였으며, 인식자 간 일致도가 0.8 초과를 확보하여 주석 신뢰도를 보장하였다.

실험 결과

연구 질문

  • RQ1기존 정서 분류기(ESEM-E, EMTk, SEntiMoji)는 GitHub 커멘트에서 정서를 탐지하는 데 얼마나 효과적인가? 가장 흔한 오류 유형은 무엇인가?
  • RQ2현행 SE 정서 인식 도구에서 어휘적 신호 및 정서 극성과 관련하여 잘못된 분류의 주요 원인은 무엇인가?
  • RQ3데이터 증강 기법은 기존 SE 커뮤니케이션 정서 분류기의 성능 향상에 기여할 수 있는가? 어떤 증강 전략이 가장 뛰어난 성능을 낼 수 있는가?
  • RQ4일반적인 또는 정서 특화 증강 전략보다 정서 극성 기반 증강(예: 긍정/부정 정서 단어 교체)이 F1 스코어 향상에 더 효과적인가?

주요 결과

  • 세 기존 정서 분류기(ESEM-E, EMTk, SEntiMoji)는 원래 평가 데이터셋 대비 GitHub 커멘트에서 성능이 유의미하게 떨어졌으며, 이는 도메인 이동 문제를 시사한다.
  • 오류 분석 결과 대부분의 잘못된 분류가 암시적 또는 복잡한 정서 표현이 아닌, 명확한 어휘적 신호를 인식하지 못하는 데 기인해 있음을 확인하였다.
  • 정서 극성 기반 데이터 증강(예: 기쁨에 대해 긍정적 단어, 분노에 대해 부정적 단어로 교체)이 가장 높은 성능 향상을 이끌어냈다.
  • 이 방법은 세 도구 평균으로 마이크로 F1 스코어를 9.3% 향상시켰으며, 이는 목표 지향적 증강이 일반적 또는 정서 특화 방법보다 더 효과적임을 입증한다.
  • 가장 뛰어난 성능을 낸 증강 전략은 대규모 SE 전용 정서 어휘 사전에 의존하지 않았으며, 이는 사전 학습된 모델(BART 등)을 활용한 극성 인지 생성이 충분하고 확장 가능함을 시사한다.
  • 결과는 데이터 증강이 데이터 부족과 도메인 이동 문제를 효과적으로 완화할 수 있으며, 재학습 없이도 기존 도구의 성능 향상에 실용적인 길을 제시함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.