SysMocap:普通摄像头实时驱动 3D 角色,狠点不在“动捕”,在少折腾一堆设备
老鬼看这种项目,第一眼一般不看宣传图,先看它要不要你买一堆硬件。
SysMocap 这点挺直接:普通视频画面驱动,目标就是实时动捕和 3D 虚拟角色渲染,面向 VTuber、直播、AR/VR 这些场景。说白了,不是先让你上全套动捕服,也不是拿手机绑半天,而是先用摄像头把脸、身体、手这些动作吃进去,再映射到角色身上。
这就很现实。
以前做虚拟人 Demo,最烦的不是“模型能不能动”,而是设备、驱动、OBS、骨骼、推流,一层套一层。跑起来那一刻很爽,第二天换台电脑,摄像头权限、模型骨骼、直播窗口捕获,又开始闹脾气。
SysMocap 比较抓人的地方,是它把几个脏活往 GUI 里塞了。README 里写得很清楚:支持拖拽导入 3D 模型,有模型查看器,还带骨骼和服装控制;VRM 0.x、VRM 1.0 以及 Mixamo 格式 FBX 可以自动识别骨骼,不匹配的骨骼也支持手动映射。
别小看自动骨骼识别。
很多虚拟人小工具死就死在这里:模型看着挺好,导进去肩膀飞了,手腕拧了,头跟身体分家。你要真让普通主播去调骨骼节点,那基本等于劝退。SysMocap 还没有把这事变成“零成本”,但至少它知道坑在哪里。
动捕模式也不是只盯一张脸。它支持面部、半身、带手半身、全身这些演示形态,还能做 OBS 直播输出;WebXR 转发也有,但 README 特意写了 WebXR API 需要 HTTPS。
啧,这种限制说明我反而喜欢。
因为 WebXR、摄像头权限、浏览器安全策略这些东西,吹的时候没人讲,真接设备的时候全是坑。SysMocap 还支持动捕数据转发,HTTP 和 HTTPS 共用同一个端口,这类细节看着不起眼,接 AR/VR 或自写前端时会直接影响你怎么部署。
当然,先别急着吹满。
这种摄像头动捕,光线、镜头角度、遮挡、手部丢失,肯定都会影响效果。全身捕捉听起来香,但要稳定拿来直播,还是得看你房间环境、摄像头位置,还有电脑性能。项目最近 v0.8.0 还修了不少 MediaPipe 参数绑定、模型编辑持久化、手部 rig 崩帧、转发 web server worker 泄漏之类的问题,说明作者确实在啃工程毛刺,但也说明这东西不是“装上就完美”。
我会怎么用?
小团队做虚拟主播 Demo、独立开发者搞 AR/VR 角色交互、或者想把 3D 形象接进 OBS 直播的人,可以扫一眼。别把它当电影级动捕设备替代品,当成一个普通摄像头起步、能接模型、能进直播链路的开源动捕工作台,会更靠谱。
GitHub地址:xianfei/SysMocap