[논문 리뷰] A Comprehensive Survey on Affective Computing; Challenges, Trends, Applications, and Future Directions
이 종합적 서베이는 기계학습(ML)과 혼합현실(XR)을 활용한 정서계산 분야의 최신 기법을 통합하여 텍스트, 음성, 시각적, 생리적 데이터를 포함한 다중모odal 정서 인식에 초점을 맞춘다. 데이터 부족, 레이블 불일치, 모델 해석 가능성 등의 주요 과제를 밝히며, 향후 연구 방향으로는 다중모달 데이터베이스, 제로샷 러닝, 지능형 인간-컴퓨터 상호작용을 위한 개인화된 정서 모델을 제안한다.
As the name suggests, affective computing aims to recognize human emotions, sentiments, and feelings. There is a wide range of fields that study affective computing, including languages, sociology, psychology, computer science, and physiology. However, no research has ever been done to determine how machine learning (ML) and mixed reality (XR) interact together. This paper discusses the significance of affective computing, as well as its ideas, conceptions, methods, and outcomes. By using approaches of ML and XR, we survey and discuss recent methodologies in affective computing. We survey the state-of-the-art approaches along with current affective data resources. Further, we discuss various applications where affective computing has a significant impact, which will aid future scholars in gaining a better understanding of its significance and practical relevance.
연구 동기 및 목표
- 기계학습 및 혼합현실(XR) 기술을 통합한 정서계산 방법론에 대한 종합적 리뷰를 제공하기 위해.
- 정서 인식 분야의 핵심 과제인 데이터 부족, 레이블 불일치, 모델 해석 가능성 등을 식별하고 분석하기 위해.
- 단모달 및 다중모달 정서계산 분야의 최신 데이터셋, 모델, 평가 기법을 조사하기 위해.
- 제로샷 러닝, 개인화된 정서 모델링, 강력한 융합 전략과 같은 향후 연구 방향을 제시하기 위해.
- 현재의 진전과 열린 문제를 통합하여 정서지능을 갖춘 시스템 개발을 지원하기 위해.
제안 방법
- 기계학습 및 혼합현실(XR) 기법을 활용한 정서계산 연구에 대한 체계적 서베이.
- 정서계산 방법을 시각적, 청각적, 텍스트 기반, 생리적 정서 인식(VER, AER/SER, PER)으로 분류.
- 정서 인식 성능 향상을 위한 딥러닝 및 통계적 방법을 포함한 다중모달 융합 전략 분석.
- RAF-PhD, AffectNet, CREMA-D, IEMOCAP 등의 벤치마크 데이터베이스 평가를 통해 정서 모델의 학습 및 테스트 수행.
- 장기적 단기 기억(LSTM) 네트워크를 이중채널 아키텍처에 적용하여 음성-시각적 정서 신호 모델링.
- 정서 인식 및 조절 모델링을 위한 프레임 오브 레퍼런스 인터모달 어텐션 프레임워크의 활용.

실험 결과
연구 질문
- RQ1기계학습과 혼합현실이 어떻게 효과적으로 통합되어 정서계산 시스템의 성능을 향상시킬 수 있는가?
- RQ2정서계산 데이터셋의 현재 한계는 무엇이며, 새로운 데이터 수집 및 레이블링 전략을 통해 어떻게 보완할 수 있는가?
- RQ3다중모달 융합 기법은 실생활 응용에서 정서 인식의 정확성과 내구성을 어떻게 향상시킬 수 있는가?
- RQ4해석 가능하고 일반화 가능한 정서 인식 모델 달성에 있어 핵심 과제는 무엇인가?
- RQ5개인적 차이와 동적인 정서 상태를 고려하여 개인화되고 적응 가능한 정서 인식 모델은 어떻게 개발할 수 있는가?
주요 결과
- 딥러닝 및 융합 기법을 활용한 다중모달 정서계산 시스템은 복잡한 정서 상태에서 단모달 접근보다 높은 정확도를 달성한다.
- AffectNet 및 RAF-PhD와 같은 기존 데이터셋은 널리 사용되지만, 문화 및 개인 간의 다양성 부족과 레이블 불일치 문제가 존재한다.
- LSTM 기반 이중채널 모델은 음성 및 시각적 정서 신호를 효과적으로 처리하여 음악 및 얼굴 정서 인식 작업의 성능을 향상시킨다.
- 표준화된 정서 레이블링 체계의 부재는 연구 간 비교 및 다양한 인구 집단에 대한 모델 일반화를 방해한다.
- 딥 네트워크의 블랙박스 성향은 신뢰도 및 정밀 조정을 제한하며, 이는 정서계산 분야에서 더 해석 가능하고 강력한 기계학습 모델의 필요성을 강조한다.
- 향후 연구는 자원이 부족하거나 편향된 데이터 환경에서 모델 안정성을 향상시키기 위해 제로샷 및 자기지도 학습을 우선시해야 한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.