程序员老鬼

Open-LLM-VTuber:本地离线跑的 AI 语音伴侣,重点不是“陪聊”,是少一层不放心

老鬼看这种 AI 伴侣项目,第一眼一般不看形象多可爱,先看它到底把麦克风、摄像头、聊天记录这些东西往哪儿送。

所以 Open-LLM-VTuber 让我停了一下。它在 README 里写得很直接:可以在电脑上完全离线运行,带实时语音对话、视觉感知和 Live2D 形象,Windows、macOS、Linux 都支持。不是又套一个网页聊天框,而是想把“能说话、能看见、能动”的那套东西塞回本地。

这点挺现实。

Image

以前折腾语音 Demo,最烦的不是模型不聪明,是链路太碎:ASR 一套,TTS 一套,LLM 一套,中间还要管延迟、打断、回声、摄像头权限。Open-LLM-VTuber 把这几块都模块化了,后端能接 Ollama、OpenAI 兼容接口、Gemini 这类模型,语音识别和合成也给了不少选择。你不一定全用,但至少不是只能绑死某一家。

真正有意思的是桌面宠物模式。

透明背景、置顶、鼠标穿透、能拖到屏幕任意位置,这东西听着像小功能,但长期挂在电脑上时很关键。不然一个 AI 伴侣天天挡窗口、抢焦点,三天就想卸。再加上语音打断、触摸反馈、摄像头/截图/屏幕感知,还有“内心想法”显示,它更像一个本地 AI Vtuber 框架,而不是普通聊天机器人。

不过先别急着吹。

Image

README 也提醒了,项目还在早期,v2.0 正在重写规划里;而且如果你想远程访问,不是在 localhost 上跑,还得处理 https,因为前端麦克风需要安全上下文。啧,坑一般就在这里。域名、证书、反代,配一圈下来,热情会掉一半。

外观、性格、声音都能改,Live2D 模型可以导入,Prompt 能塑造人设,甚至支持语音克隆。但这块我得泼点冷水:声音别乱克隆,授权和隐私要先想清楚。好玩归好玩,不代表没有边界。

我会把 Open-LLM-VTuber 看成一个“本地 AI 伴侣实验台”。想做桌面陪聊、AI 看板、虚拟主播原型,或者只是想要一个能说话、能看屏幕、还能挂在桌面的角色,值得折腾。

目前 GitHub 显示约 9.6k stars。

GitHub地址:Open-LLM-VTuber/Open-LLM-VTuber。