[논문 리뷰] Fit or Unfit : Analysis and Prediction of 'Closed Questions' on Stack Overflow
이 연구는 2008–2012년 기간 동안의 340만 개의 질문을 바탕으로 스택 오버플로우에서 '닫힌' 질문을 분석하고 예측한다. 사용자, 콘텐츠, 커뮤니티 기능을 포함한 기계학습 모델을 활용하여 질문 폐쇄를 73%의 정확도로 예측했으며, URL 참조와 코드 스니펫 길이가 가장 높은 예측 기능으로 나타났다.
Stack Overflow is widely regarded as the most popular Community driven Question Answering (CQA) website for programmers. Questions posted on Stack Overflow which are not related to programming topics, are marked as 'closed' by experienced users and community moderators. A question can be 'closed' for five reasons - duplicate, off-topic, subjective, not a real question and too localized. In this work, we present the first study of 'closed' questions in Stack Overflow. We download 4 years of publicly available data which contains 3.4 Million questions. We first analyze and characterize the complete set of 0.1 Million 'closed' questions. Next, we use a machine learning framework and build a predictive model to identify a 'closed' question at the time of question creation. One of our key findings is that despite being marked as 'closed', subjective questions contain high information value and are very popular with the users. We observe an increasing trend in the percentage of closed questions over time and find that this increase is positively correlated to the number of newly registered users. In addition, we also see a decrease in community participation to mark a 'closed' question which has led to an increase in moderation job time. We also find that questions closed with the Duplicate and Off Topic labels are relatively more prone to reputation gaming. For the 'closed' question prediction task, we make use of multiple genres of feature sets based on - user profile, community process, textual style and question content. We use a state-of-art machine learning classifier based on an ensemble learning technique and achieve an overall accuracy of 73%. To the best of our knowledge, this is the first experimental study to analyze and predict 'closed' questions on Stack Overflow.
연구 동기 및 목표
- 스택 오버플로우에서 '닫힌' 질문의 특성을 분석하고자 하며, 이는 중복, 비관련, 주관적 콘텐츠 등의 이유로 Q&A 형식에 맞지 않다고 판단되어 표시된 질문들이다.
- 시간에 따른 질문 폐쇄 추세를 조사하고, 폐쇄 비율 증가와 모더레이션 참여도 감소와 같은 경향을 분석하고자 한다.
- 기계학습을 활용하여 질문 생성 시점에 폐쇄 여부를 예측하는 모델을 개발하고자 한다.
- 특히 중복 및 비관련 질문에 대해 명예 점수 게임이 미치는 영향을 평가하고자 한다.
- 앙상블 학습 분류기로 예측 기능의 중요도를 분석하여 폐쇄 예측에 가장 유용한 특징을 규명하고자 한다.
제안 방법
- 2008년 8월부터 2012년 8월까지의 스택 오버플로우에서 공개된 340만 개 질문을 수집하고 분석하였다. 이 중 101,691개는 폐쇄된 질문으로 분류되었다.
- 폐쇄된 질문을 다섯 가지 레이블로 분류하였다: 중복, 비관련, 주관적, 실질적인 질문이 아님, 너무 국한됨.
- 사용자 프로필, 커뮤니티 프로세스, 텍스트 스타일, 질문 콘텐츠의 네 가지 특징 세트를 사용하여 확률적 경사 부스팅 트리(SGBT) 기반 예측 모델을 구축하였다.
- 10번 교차검증과 70%-30% 훈련-테스트 분할을 적용하여 성능을 평가하였으며, 정확도, F1 점수, AUC를 사용하였다.
- SGBT에서의 특징 중요도 분석을 통해 URL, 코드 스니펫 길이, 제목 길이, 게시 점수, 계정 연령 등 주요 예측 변수를 규명하였다.
- 특징 추가의 순차적 분석을 통해 각 특징 세트가 모델 성능에 기여하는 정도를 평가하였다.
실험 결과
연구 질문
- RQ14년 간의 기간 동안 스택 오버플로우에서 '닫힌' 질문의 유형과 빈도에 대한 핵심 특성과 추세는 무엇인가?
- RQ2특히 주관적 질문의 경우, 폐쇄 이유에 따라 질문의 인기와 정보가치는 어떻게 달라지며, 어떤가?
- RQ3시간이 지남에 따라 질문 폐쇄 비율이 증가하는 원인은 무엇이며, 사용자 증가와 모더레이션 작업 부담과의 상관관계는 어떠한가?
- RQ4사용자, 콘텐츠, 커뮤니티 기능을 기반으로 기계학습을 통해 질문 폐쇄를 게시 시점에 얼마나 정확하게 예측할 수 있는가?
- RQ5질문 폐쇄 예측에 가장 유용한 특징는 무엇이며, 폐쇄 유형에 따라 이 특징들은 어떻게 다를까?
주요 결과
- 폐쇄된 주관적 질문들 역시 높은 정보가치를 지니며 사용자들 사이에서 높은 인기를 끌었으며, 이는 폐쇄된 질문이 저품질이라는 전제를 뒤집는 결과였다.
- 폐쇄된 질문 비율은 시간이 지남에 따라 증가했으며, 이는 신규 등록 사용자 수와 정확히 상관관계가 있었다.
- 질문 폐쇄 표시에 대한 커뮤니티의 참여도는 점점 감소하였고, 이는 모더레이션 작업 소요 시간 증가로 이어졌다.
- '중복'과 '비관련'으로 폐쇄된 질문들은 명예 점수 게임에 더 취약했으며, 이는 투표 시스템의 오용 가능성을 시사했다.
- 예측 모델은 총 정확도 73%를 달성하였으며, F1 점수와 AUC는 특징 세트를 추가할수록 점차 향상되었다.
- 가장 중요한 예측 특징은 스택 오버플로우 URL 존재 여부, 코드 스니펫 길이, 제목 길이, 게시 점수, 계정 연령였으며, 짧은 제목과 낮은 점수는 폐쇄 가능성을 높이는 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.