[논문 리뷰] Bias and Fairness on Multimodal Emotion Detection Algorithms
이 연구는 음성, 텍스트, 영상 모odal을 사용한 다중모달 정서 인식 시스템에서의 성별 편향을 조사한다. 텍스트 전용 모델이 성능과 공정성의 최적 균형을 달성하는 반면, 다중모달 융합—특히 영상 융합—는 정확도 향상이 미미함에도 불구하고 편향을 크게 증가시켜 모델 설계 선택에 윤리적 우려를 제기한다.
Numerous studies have shown that machine learning algorithms can latch onto protected attributes such as race and gender and generate predictions that systematically discriminate against one or more groups. To date the majority of bias and fairness research has been on unimodal models. In this work, we explore the biases that exist in emotion recognition systems in relationship to the modalities utilized, and study how multimodal approaches affect system bias and fairness. We consider audio, text, and video modalities, as well as all possible multimodal combinations of those, and find that text alone has the least bias, and accounts for the majority of the models' performances, raising doubts about the worthiness of multimodal emotion recognition systems when bias and fairness are desired alongside model performance.
연구 동기 및 목표
- 음성, 텍스트, 영상 모달을 사용한 단모달 및 다중모달 정서 인식 모델에서 성별 편향이 어떻게 변화하는지 조사하기 위해.
- 보호된 속성(성별)에 대한 조건부 확률 독립성에 기반하여 통계적 평등성 및 기회 평등성과 같은 공정성 지표를 다양한 모달 조합에서 평가하기 위해.
- 다중모달 융합이 성능을 향상시키면서도 성별 기반 격차를 악화시키지 않는지 확인하기 위해.
- 텍스트, 음성, 영상 모달 중 어느 것이 정서 인식 시스템에서 편향에 더 크게 기여하는지 규명하기 위해.
- 다중모달 모델에 영상 및 음성을 포함시키는 것이 정확도 향상이 미미함에도 불구하고 공정성 희생을 감수할 만한 가치가 있는지 평가하기 위해.
제안 방법
- 연구는 IEMOCAP 데이터셋을 사용하며, 저신뢰도 및 희귀 정서 레이블을 제거하여 성별 50/50 비율로 균형 잡힌 7,380개 샘플의 데이터셋을 구성한다.
- 학습-검증-테스트 분할을 적용하여 세션 1~4를 학습용으로, 세션 5는 짝수 문장(검증)과 홀수 문장(테스트)으로 나누어 80/10/10 비율을 확보한다.
- 공정성은 통계적 평등성 차이(SP)와 기회 평등성 차이(EO) 두 가지 지표로 측정하며, 이는 보호된 속성(성별)에 대한 조건부 확률 독립성에 기반한다.
- 모델은 단모달(음성, 텍스트, 영상) 및 다중모달(이중모달 및 삼중모달) 구성에서 전이학습을 통해 훈련된다.
- 성능 평가에는 성별 간 F1-score 차이를 사용하며, 낮을수록 더 나은 공정성을 의미한다.
- 통계적 평등성과 기회 평등성은 각 정서 및 모델 구성별로 계산되어 다양한 모달 간 편향 추세를 분석한다.
실험 결과
연구 질문
- RQ1음성, 텍스트, 영상 모달을 사용한 단모달 정서 인식 모델에서 성별 편향은 어떻게 변화하는가?
- RQ2음성, 텍스트, 영상 모달을 다중모달 융합했을 때 단모달 모델에 비해 성별 편향은 감소하는가, 아니면 악화되는가?
- RQ3모달을 융합함에 있어 성능(F1-score)과 공정성(SP 및 EO) 간의 교환 관계는 어떠한가?
- RQ4왜 텍스트를 포함한 모델은 남성과 여성 간 분노 정서 예측에서 항상 약 10%의 F1-score 격차를 보이는가?
- RQ5영상 데이터 포함이 정확도 향상이 미미함에도 불구하고 공정성에 얼마나 심각하게 악영향을 미치는가?
주요 결과
- 텍스트 전용 모델은 가장 낮은 편향을 보이며, 통계적 평등성 차이(SP)는 2.0, 기회 평등성 차이(EO)는 1.43을 기록하여 모든 다른 모달보다 공정성 면에서 뛰어나다.
- 영상 전용 모델은 가장 높은 편향을 보이며, SP는 3.0, EO는 2.32로 성별 간 예측 빈도의 심각한 격차를 나타낸다.
- 음성 전용 모델은 영상보다 덜 편향되지만 텍스트보다 더 편향이 심하며, SP는 1.0, EO는 1.82를 기록한다.
- 음성 + 영상 이중모달 융합은 단모달 음성 모델보다 편향이 증가하며, SP는 2.0으로 상승하고 EO는 2.22로 증가하지만, F1 성능 향상은 미미하다.
- 텍스트 + 영상 융합은 가장 열악한 공정성을 보이며, SP는 6.0, EO는 3.24로 성별 간 예측 격차가 뚜렷하게 드러난다.
- 음성 + 텍스트 + 영상 삼중모달 모델은 텍스트 전용 모델과 유사한 공정성 지표(SP: 2.0, EO: 2.68)를 달성하지만, 텍스트 전용 모델 대비 F1-score 향상은 미미하여 융합의 추가적 이점이 없다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.