Python技术迷

Open-LLM-VTuber:把 AI 语音伴侣塞回本地,顺手还带了个 Live2D 桌宠

老鬼看这种 AI 伴侣项目,第一眼一般不看“陪伴感”这种词,先看它到底要不要联网、摄像头数据往哪儿跑、出了问题是不是又要折腾一堆 API Key。

Open-LLM-VTuber 这点挺抓人:它主打本地完全离线运行,一个带 Live2D 形象的语音交互 AI 伴侣,支持 Windows、macOS、Linux,还能走网页或桌面客户端。桌面端有个透明背景的桌宠模式,可以全局置顶、拖到屏幕任意位置,甚至支持鼠标穿透,不挡你正常点东西。啧,这个细节比功能列表更像真有人在用。

更有意思的是,它不是只会“你一句我一句”。README 里写了视觉感知、语音打断、触摸反馈、Live2D 表情映射、AI 内心 OS、聊天记录持久化这些东西。摄像头、屏幕录制、截图都能接进来,让角色不只是听你说话,还能“看见”当前环境。

Image

但先别急着吹。

这类东西最烦的不是跑起来,是第二天你发现 ASR、TTS、LLM、Live2D、麦克风权限、浏览器安全策略全在互相甩锅。项目自己也提醒了,如果你想远程跑服务端、在手机或其他设备访问,因为前端麦克风只在 HTTPS 或 localhost 这类安全环境下可用,就得自己配反向代理和 HTTPS。坑一般就在这里。

它的好处也很现实:后端可以接 Ollama、OpenAI、Gemini、Claude、DeepSeek 这类模型,语音识别和合成也有多套方案。你想省事,可以走云 API;你更在意隐私,就尽量把 LLM、ASR、TTS 都压到本地。别小看这个选择权,很多所谓 AI 伴侣,最后卡死在“必须把声音和对话交出去”。

还有个小点我挺喜欢:TTS 翻译。比如你用中文聊天,让角色用日语声音说出来。不是刚需,但对于想做虚拟主播、桌面角色、二次元陪聊 Demo 的人,这玩意儿很容易把氛围拉起来。

Image

不过边界也要看清楚。项目还处在早期活跃开发阶段,v2.0 正在规划重写,v1 主要继续修 bug、处理已有 PR。也就是说,它值得折腾,但不太适合拿来当“装完就稳定养老”的工具。

老鬼会把它放进“周末能玩、Demo 能改、想做本地 AI 桌宠可以试”的那一类。想要一个能说话、能看屏幕、能挂桌面上,又不想所有数据都丢到云端的 AI 虚拟伴侣,Open-LLM-VTuber 可以扫一眼。

GitHub地址:Open-LLM-VTuber/Open-LLM-VTuber。