VR情绪识别新突破:融合面部图像与肌电信号破解头显遮挡难题
实验采用PICO Neo 3头显
(映维网Nweon 2026年09月07日)VR头显在提供沉浸体验的同时,也遮挡了用户的上半张脸。这给基于面部表情的情绪识别带来了根本性挑战。来自德国弗劳恩霍夫海因里希·赫兹研究所和柏林洪堡大学的研究团队提出了一种创新的多模态融合方法,通过结合下半脸视频与上半脸肌电信号(EMG),在头显遮挡条件下实现了对七种情绪的有效分类。

研究团队构建了首个同步多模态数据集,包含20名参与者(10名女性,平均年龄27.4岁)在VR环境下观看情绪刺激素材时采集的下半脸三视角视频和七通道上半脸面部EMG信号。
实验采用PICO Neo 3头显,配备EmtecPRO开放式面罩同步记录七组面部肌肉的肌电信号(包括双侧额肌、眼轮匝肌、颧大肌和中央皱眉肌),同时用三台工业单色相机从0°和±30°位置拍摄下半脸视频。
结果显示,在受试者独立测试中,提出的晚期融合架构(ResNet-50视觉编码器结合RBF核EMG表示)取得了51%的宏平均F1分数,显著优于纯图像(41%)和纯EMG(43%)的基线表现。
研究特别比较了两种EMG特征表示方式:直接后处理的28维RMS特征与经过RBF核化处理的784维表示。结果表明,核化EMG表示在多模态融合中效果更优,而直接特征在单模态设置中表现更稳定。最佳配置下,多模态融合相比纯图像基线带来了10个百分点的宏平均F1提升。
从具体情绪类别看,上半脸EMG的补充信息效果尤为明显:惊讶类识别准确率从65%提升至84%(+19个百分点),悲伤类从17%提升至49%(+32个百分点)。而快乐等主要依赖下半脸口部特征的情绪提升相对较小(从64%至75%),这印证了EMG主要弥补了头显遮挡导致的视觉信息缺失。
值得注意的是,验证集与测试集之间存在明显性能差距。多模态模型在验证集上F1接近0.95,但在保留的两个测试受试者上仅为0.50左右。研究团队分析认为,这反映了跨受试者泛化的固有难度,包括数据集规模有限(35k样本,20人)、受试者内一致性较高导致过拟合,以及实验室诱发表情与真实VR交互中自发表达之间的差异。
相关论文:Occlusion-Robust Multimodal Emotion Recognition in VR via Fusion of Facial Images and EMG
另外,两名测试受试者间也存在显著个体差异:最佳模型在一个受试者上F1达0.66,而另一名仅为0.36,进一步凸显了个体差异对跨身份泛化的影响。

