基于Transformer的OpenXR实时手势识别方法:静态手势准确率达93.7%

PICO 4 Ultra

查看引用/信息源请点击:映维网Nweon

静态手势准确率达93.7%

(映维网Nweon 2026年09月28日)滑铁卢大学和毕索大学的研究人员将Transformer模型用于OpenXR手部追踪数据,并进行实时手势识别。结果显示,静态手势准确率可以达到93.7%。

基于Transformer的OpenXR实时手势识别方法:静态手势准确率达93.7%

手势识别是人机交互的重要,可服务于虚拟现实等场景。传统方法主要使用CNN或RNN,但RNN存在梯度消失、难以捕捉长期依赖等问题。Transformer通过注意力机制学习序列内部的全局关系,可用于手势识别,并用于检测手势之间的运动流。

在数据采集方面,研究使用Unity的OpenXR框架,采集21个手部关节的3D位置和手腕旋转角度(俯仰、偏航、滚转)。每个关节用立方体可视化,并按局部X、Y、Z轴颜色编码。数据以手掌为参考进行归一化,以适应不同手部尺寸。采集时以张开手为基线,关节从手腕到手掌并沿各手指标记。数据集覆盖多样手部朝向和旋转。

预处理中,关节位置相对手掌归一化,并按手腕到手掌距离缩放;手腕旋转同时用欧拉角和“向上”“左转”“中性滚转”等标签描述;手势序列分割为30帧重叠窗口。

模型方面,Transformer处理短序列并分类手势。输入嵌入将每个时间步的位置和旋转数据嵌入高维空间;位置编码用于保留时间信息;Transformer层包含多头自注意力和前馈网络;输出层用softmax预测手势标签。训练使用Adam优化器和分类交叉熵损失,数据按80%训练、20%测试划分,以分类准确率和F1分数衡量性能。

团队指出,模型在静态手势上达到93.7%的分类准确率,优于基线RNN和CNN模型。模型能区分形状和朝向相似的手势,例如“Point”和“Gun”;在“Like”手势中,单根手指张开或闭合仍能正确预测,直到越过阈值,例如三根手指张开时过渡到“OK”。加入手腕旋转角度后,系统可区分“向上”的“Point”和“中性滚转”的“Point”。数据根据玩家旋转进行归一化和本地化,使玩家整体旋转不影响识别。当然,特定手部姿态的手腕朝向估计更困难,依赖朝向的手势比朝向不变的手势对追踪噪点更敏感。

研究人员认为,在短帧窗口内建模时间依赖比单帧分类更稳定,而这种序列能力也是未来运动流检测的基础。当然,他们同时指出了局限性,包括自定义数据集规模适中,以及尚未进行公开基准评估。

相关论文:Real-Time Hand Gesture Recognition for OpenXR Using Transformer-Based Machine Learning

展望未来,他们计划使用ONNX和Barracuda进行实时优化,以便在Unity中低延迟部署;同时,将模型从孤立手势分类扩展到检测手势之间的过渡和连续运动,以及纳入手部速度和加速度等多模态输入等等。

本文链接:https://news.nweon.com/143271
转载须知:转载摘编需注明来源映维网并保留本文链接
素材版权:除额外说明,文章所用图片、视频均来自文章关联个人、企业实体等提供
QQ交流群:苹果Vision  |  Meta Quest  |  AR/VR开发者  |  映维粉丝读者
XR Research Wechat Group/微信群

您可能还喜欢...

资讯