[논문 리뷰] Automated Analysis and Prediction of Job Interview Performance
이 논문은 구술, 억양, 얼굴 표정 특징을 자동으로 분석하여 취업 면접 영상의 면접 성과 평가를 예측하는 다중모달 계산 프레임워크를 제시한다. 138명의 MIT 학부생 면접 영상을 기반으로 훈련된 시스템은 관련성, 친근함과 같은 핵심 특성들을 0.75 이상의 상관계수로 예측하며, 말하기 유창성, 필러 어휘 감소, 미소 증가 등 성공 요인을 특정한다.
We present a computational framework for automatically quantifying verbal and nonverbal behaviors in the context of job interviews. The proposed framework is trained by analyzing the videos of 138 interview sessions with 69 internship-seeking undergraduates at the Massachusetts Institute of Technology (MIT). Our automated analysis includes facial expressions (e.g., smiles, head gestures, facial tracking points), language (e.g., word counts, topic modeling), and prosodic information (e.g., pitch, intonation, and pauses) of the interviewees. The ground truth labels are derived by taking a weighted average over the ratings of 9 independent judges. Our framework can automatically predict the ratings for interview traits such as excitement, friendliness, and engagement with correlation coefficients of 0.75 or higher, and can quantify the relative importance of prosody, language, and facial expressions. By analyzing the relative feature weights learned by the regression models, our framework recommends to speak more fluently, use less filler words, speak as "we" (vs. "I"), use more unique words, and smile more. We also find that the students who were rated highly while answering the first interview question were also rated highly overall (i.e., first impression matters). Finally, our MIT Interview dataset will be made available to other researchers to further validate and expand our findings.
연구 동기 및 목표
- 면접에서의 구어 및 비언어적 행동을 정량화하는 자동화되고 확장 가능한 프레임워크 개발.
- 다중모달 음성-영상 데이터를 사용하여 총 면접 평가 및 특정 사회적 특성(예: 흥분, 친근함) 예측.
- 면접 평가에 영향을 주는 언어, 억양, 얼굴 표정의 상대적 중요도 규명.
- 데이터 기반 통찰을 바탕으로 면접 성과 향상을 위한 실질적인 권고 사항 도출.
- 향후 연구를 지원하기 위해 MIT 면접 데이터셋 공개.
제안 방법
- 전문 직업 상담사와의 면접을 통해 69명의 MIT 학부생으로부터 138개의 면접 영상 수집.
- 다중모달 특징 추출: 어휘적(단어 수, 토픽 모델링), 억양(음고, 억양, 휴지), 얼굴(미소, 머리 동작, 얼굴 추적점).
- Mechanical Turk 작업자(영상당 9명)를 통해 기준값 평가 생성, 작업자 신뢰도를 고려해 EM 알고리즘으로 집계.
- 전체 및 특성별 평가 예측을 위해 선형, 이차, 삼차, 가우시안 커널을 사용한 서포트 벡터 회귀(SVR) 모델 훈련.
- 회귀 모델에서 학습된 특징 가중치 분석을 통해 상대적 중요도 추론 및 성과 향상 권고 도출.
- 기준 모델(AUC = 0.50) 대비 상관계수(r) 및 AUC 점수를 사용해 모델 성능 평가.
실험 결과
연구 질문
- RQ1말하기 및 비언어적 행동을 자동으로 정량화하고, 총 면접 평가에 미치는 영향을 평가할 수 있는가?
- RQ2음성-영상 기록에서 총 면접 평가를 예측할 수 있는 계산 프레임워크를 구축할 수 있는가?
- RQ3언어, 억양, 얼굴 표정이 면접 성과 예측에 미치는 상대적 중요도는 무엇인가?
- RQ4흥분, 친근함, 참여도와 같은 사회적 특성을 향상시키기 위한 자동화된 데이터 기반 권고를 도출할 수 있는가?
주요 결과
- 프레임워크는 총 면접 평가를 상관계수 r = 0.80로 예측하여 기준 AUC 0.50을 뚜렷이 뛰어넘음.
- 참여도, 흥분, 친근함과 같은 핵심 특성은 상관계수 r ≥ 0.75 및 AUC > 0.85로 예측됨.
- 시스템은 더 유창하게 말하기, 필러 어휘를 줄이기, '나' 대신 '우리'를 사용하기, 더 많은 고유어 사용하기, 더 자주 미소 지으기를 향상 성과를 위한 최우선 권고로 특정함.
- 첫 번째 질문에서 높은 점수를 받은 면접자는 일관되게 총점에서 높은 평가를 받았으며, 이는 첫인상의 강력한 영향을 시사함.
- 선형 커널 SVR가 비선형 커널보다 성능이 뛰어나, 특징들이 복잡한 상호작용을 보이기보다는 상대적으로 단순한 선형 관계를 띠고 있음을 시사함.
- 138개 면접 세션을 포함하는 MIT 면접 데이터셋은 다중모달 면접 분석 분야의 향후 연구를 지원하기 위해 공개됨.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.