Skip to main content
QUICK REVIEW

[논문 리뷰] Assessment of SE-specific Sentiment Analysis Tools: An Extended Replication Study.

Nicole Novielli, Fabio Calefato|arXiv (Cornell University)|2020. 10. 20.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 연구는 GitHub 및 Stack Overflow의 토론을 대상으로 한 이전 연구를 재현하고 확장하여 SE 전용 감성 분석 도구의 성능을 평가한다. 연구 결과, 표준 제품으로 제공되는 SE 도구들은 세분화된 수준에서 종종 모순된 결과를 도출함을 확인하였으며, 이는 SE 실험 연구에서 타당한 결론을 이끌기 위해 플랫폼에 맞는 튜닝 또는 재학습이 필수적임을 시사한다.

ABSTRACT

Sentiment analysis methods have become popular for investigating human communication, including discussions related to software projects. Since general-purpose sentiment analysis tools do not fit well with the information exchanged by software developers, new tools, specific for software engineering (SE), have been developed. We investigate to what extent SE-specific tools for sentiment analysis mitigate the threats to conclusion validity of empirical studies in software engineering, highlighted by previous research. First, we replicate two studies addressing the role of sentiment in security discussions on GitHub and in question-writing on Stack Overflow. Then, we extend the previous studies by assessing to what extent the tools agree with each other and with the manual annotation on a gold standard of 600 documents. We find that different SE-specific sentiment analysis tools might lead to contradictory results at a fine-grain level, when used 'off-the-shelf'. Conversely, platform-specific tuning or retraining might be needed to take into account differences in platform conventions, jargon, or document lengths.

연구 동기 및 목표

  • SE 전용 감성 분석 도구가 실험적 SE 연구에서 결론의 타당성을 향상시키는지 평가하는 것.
  • GitHub 보안 토론과 Stack Overflow 질문 작성에 관한 두 이전 연구를 재현하는 것.
  • 600건의 문서로 구성된 골드 표준 데이터셋에서 다수의 도구 간 일치도와 수동 주석과의 일치 정도를 평가하는 것.
  • 표준 제품으로 제공되는 SE 도구가 GitHub 및 Stack Overflow와 같은 다양한 SE 플랫폼 간에 일관된 결과를 도출하는지 조사하는 것.

제안 방법

  • GitHub 보안 토론과 Stack Overflow 질문 작성에 관한 감성 분석에 중점을 둔 두 이전 연구의 재현.
  • 감성에 대해 수동 주석이 내려진 600건의 문서로 구성된 골드 표준 데이터셋 구축.
  • 동일한 데이터셋에 대해 다수의 SE 전용 감성 분석 도구를 적용하여 결과를 비교.
  • 수정자 간 일치도 측정 지표를 활용한 도구 간 일치도의 정량적 평가 및 수동 주석과의 비교.
  • 플랫폼 관례, 전문 용어, 문서 길이의 차이 등과 같은 원인을 규명하기 위해 불일치 사례 분석.
  • 플랫폼에 맞는 튜닝 또는 재학습이 도구 성능과 일관성에 미치는 영향 평가.

실험 결과

연구 질문

  • RQ1SE 전용 감성 분석 도구들이 SE 전용 텍스트에 적용되었을 때 얼마나 높은 일치도를 보이는가?
  • RQ2골드 표준 데이터셋에서 SE 전용 도구들이 수동 감성 주석과 얼마나 잘 일치하는가?
  • RQ3GitHub 및 Stack Overflow와 같은 다양한 SE 플랫폼 간에 표준 제품으로 제공되는 SE 도구들이 일관된 결과를 도출하는가?
  • RQ4SE 도구 간 감성 분류의 불일치를 초래하는 요인은 무엇인가?
  • RQ5SE 맥락에서 신뢰할 수 있는 감성 분석을 달성하기 위해 플랫폼에 맞는 튜닝 또는 재학습이 필수적인가?

주요 결과

  • 표준 제품으로 제공되는 SE 전용 감성 분석 도구들은 세분화된 SE 텍스트에 적용되었을 때 자주 모순된 감성 분류 결과를 도출한다.
  • 도구 간 일치도가 낮아, 동일한 SE 텍스트에 적용되었을 때도 도구 간 심각한 일관성 부족이 나타난다.
  • SE 도구들이 수동 주석과의 일치도가 제한적으로 나타나, 실험적 SE 연구에서 신뢰성 문제가 발생할 수 있음을 시사한다.
  • 불일치의 원인 중 일부는 플랫폼 간 관례의 차이, 도메인 전문 용어의 차이, 문서 길이의 차이 등에 기인한다.
  • 본 연구는 플랫폼에 맞는 튜닝 또는 재학습이 도구의 일관성과 타당성을 향상시키는 데 필수적임을 입증한다.
  • 맥락적 및 언어적 변별 특성이 존재하므로, 표준 제품으로 제공되는 SE 도구들은 특정 SE 플랫폼에 맞게 적응하지 않고서는 신뢰할 수 없음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.