SysMocap:不用动捕服,普通摄像头也能把 3D 角色“拽起来”
我看 SysMocap,第一眼没先看它的界面多漂亮,而是盯住了两个东西:摄像头输入,和骨骼映射。
啧,这俩才是虚拟人动捕最容易翻车的地方。 以前折腾小 Demo,最烦的不是模型能不能动一下,是脸能动、身体也能动,但手一进来就开始飘;FBX 换一个来源,骨骼名字又对不上,半天都耗在 Hips、Spine、UpperArm 这些节点上。
SysMocap 做的事很直接:用视频画面驱动 3D 虚拟角色,面向 VTuber、直播、AR/VR 这类场景,项目 README 里写的是“实时视频驱动动作捕捉及 3D 虚拟形象生成系统”。它支持面部、半身、半身加手、全身这些捕捉展示,不是只给你一个“能点头”的玩具。
这就有点现实了。
模型这块也不是只认一种格式。SysMocap 支持 VRM 0.x、VRM 1.0,以及 Mixamo 格式 FBX 的自动骨骼检测;碰到别的 FBX、GLB、GLTF,也可以手动做骨骼映射和坐标转换。
老鬼看这种工具,一般会先问:换个模型会不会直接废?它至少把这口锅留了个手动兜底。
当然,别急着吹成“人人都能零成本动捕棚”。实时动捕这东西,光照、摄像头角度、身体遮挡、机器性能,都会影响结果。尤其全身和手部,演示能跑是一回事,直播里稳不稳又是另一回事。
项目底层依赖里提到了 MediaPipe Holistic 和 Kalidokit,这条路线很熟,优点是门槛低,问题是复杂姿态下别指望它像专业动捕设备一样老实。
我比较喜欢的是它没有只停在“动起来”。README 里还写了 OBS 直播使用、动作数据转发、WebXR API,不过 WebXR 那块明确是 HTTPS only。
这类小字很重要,直播、AR/VR 一接链路,端口、证书、转发服务就开始找你麻烦。
再看维护痕迹,仓库现在大概 3.1k stars,最新 Release 是 v0.8.0,页面显示发布于 2026 年 6 月 10 日。这个版本修了不少脏活:比如模型编辑不持久、手部检测导致 VRM hand rig 某帧崩、转发 Web Server 启停泄漏 worker thread,还把 FBX/glTF rig 的骨骼查找从每帧线性扫描改成一次性映射。
这些不性感,但是真有用。
SysMocap 更适合想快速做虚拟主播、小型直播形象、AR/VR 原型的人先扫一眼。你不用上来就买动捕服,也不用先把模型管线搭成工程灾难。先用普通摄像头把角色驱起来,看看效果够不够用。
GitHub地址:xianfei/SysMocap