Multimodal Emotion Recognition in Conversations via Class-Wise Adaptive Modality Fusion and Affective Geometry
A multimodal emotion recognition model relying on video, speech, and text in conversations that proposes a class-wise adaptive modality fusion, and a valence-arousal prior for affective transitions.