[논문 리뷰] Self context-aware emotion perception on human-robot interaction
이 논문은 장기적 인간-로봇 상호작용을 위한 새로운 접근법인 자기 맥락 인식 모델(Self Context-Aware Model, SCAM)을 제안한다. 이 모델은 정황 감정 지속성과 밸런스-도전도 프레임워크를 통합하여 정서 인식 성능을 햖थ한다. SCAM은 맥락 인식 손실과 특징 유지 메커니즘을 통해 청각에서 9.36%, 시각에서 3.79%, 다중모달 설정에서 1.45% 향상된 정확도를 달성하여 IEMOCAP 데이터셋에서 최신 기술 수준의 성능을 달성한다.
Emotion recognition plays a crucial role in various domains of human-robot interaction. In long-term interactions with humans, robots need to respond continuously and accurately, however, the mainstream emotion recognition methods mostly focus on short-term emotion recognition, disregarding the context in which emotions are perceived. Humans consider that contextual information and different contexts can lead to completely different emotional expressions. In this paper, we introduce self context-aware model (SCAM) that employs a two-dimensional emotion coordinate system for anchoring and re-labeling distinct emotions. Simultaneously, it incorporates its distinctive information retention structure and contextual loss. This approach has yielded significant improvements across audio, video, and multimodal. In the auditory modality, there has been a notable enhancement in accuracy, rising from 63.10% to 72.46%. Similarly, the visual modality has demonstrated improved accuracy, increasing from 77.03% to 80.82%. In the multimodal, accuracy has experienced an elevation from 77.48% to 78.93%. In the future, we will validate the reliability and usability of SCAM on robots through psychology experiments.
연구 동기 및 목표
- 기존 정서 인식 모델이 장기적 인간-로봇 상호작용에서 정서 지속성을 忽略하는 한계를 해결하기 위해.
- 로봇 자신의 정서적 맥락과 이전 정서 상태를 통합함으로써 정서 인식 정확도를 향상시키기 위해.
- 정서를 정량적 밸런스-도전도 공간에 기반하여 정착시켜 시간적 일관성을 향상시키기 위해 이산적 및 연속적 정서 모델을 융합하기 위해.
- 맥락 기반 손실과 특징 유지 기법이 다중모달 정서 인식 향상에 기여하는지 검증하기 위해.
- 향후 실제 로봇 시스템에서 SCAM의 심리적 검증을 위한 기초를 마련하기 위해.
제안 방법
- SCAM은 기본 정서와 비기본 정서 간의 관계를 학습할 수 있도록, 정서를 정착시키고 재라벨링하기 위해 이차원적 밸런스-도전도 좌표계를 활용한다.
- 모델은 이전 세그먼트의 정서를 예측하도록 유도하는 새로운 맥락 기반 손실을 도입하여 정서 경향의 지속성을 포착한다.
- 예측 과정에서 이전 정서 맥락의 관련 특징를 유지하고 통합하기 위해 전용 정보 유지 구조를 사용한다.
- 정서 분류, 밸런스 및 도전도 예측을 동시에 최적화하기 위해 다중임무 손실을 활용하여 단모달 및 다중모달 학습을 통합한다.
- 밸런스와 도전도 기반 재라벨링을 통해 정서 표현을 정교화하고 다양한 모odal 간 일반화 능력을 향상시킨다.
- 학습 및 평가를 위해 청각, 시각 및 다중모달 구성에서 IEMOCAP 데이터셋을 활용한다.

실험 결과
연구 질문
- RQ1이전 상호작용의 정서 맥락을 통합함으로써 인간-로봇 상호작용에서 장기적 정서 인식 성능을 유의미하게 향상시킬 수 있는가?
- RQ2밸런스와 도전도를 통한 정서 지속성 모델링이 다양한 모달에서 정확도 향상에 기여하는가?
- RQ3제안된 맥락 기반 손실이 시간에 따라 정서 경향을 예측하는 데 모델의 능력을 얼마나 향상시키는가?
- RQ4SCAM은 모순되거나 모호한 다중모달 신호를 처리하는 데 기존 기준 모델보다 우수한가?
- RQ5연속적 및 이산적 정서 모델링의 통합이 더 견고하고 정확한 정서 인식을 가능하게 하는가?
주요 결과
- 청각 모달리티에서 SCAM은 정확도를 63.10%에서 72.46%로 9.36% 향상시켰다.
- 시각 모달리티에서는 정확도가 77.03%에서 80.82%로 3.79% 향상되었다.
- 다중모달 설정에서는 정확도가 77.48%에서 78.93%로 1.45% 향상되었다.
- 맥락 손실 성분은 학습 내내 일관되게 감소하여 정서 지속성 학습이 효과적으로 이루어졌음을 시사했으며, 총 테스트 손실의 변동에도 불구하고 유의미했다.
- 시각화 결과 SCAM은 정서 맥락이 지속적으로 변화하더라도 정확한 정서 예측을 유지함을 확인했으며, 이는 레이블 일관성과 독립적임을 입증했다.
- 오류 분석 결과 청각 및 시각 모달리티는 상호 보완적인 오류를 보였으며, 특히 '행복'과 '중립' 정서를 식별하는 데서 시각 모달리티가 청각 모달리티를 능가했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.