程序员老鬼

GitHub 爆火的 Curses ,让 OBS 实时字幕、语音转文字变好看又好用

前两天在 GitHub 上瞎逛,突然翻到一个项目——Curses。

就是专门给 OBS、VRChat、Twitch、Discord 做语音转文字字幕的“全能挂件”,还支持反向文字转语音,关键是——自定义程度夸张到有点变态。

大部分人的诉求很简单:我说话→自动生成字幕→塞进 OBS。 Curses 直接给你做成“字幕中枢”:语音进来,它负责听;文字出去,可以进 OBS、VRChat、Twitch、Discord,甚至再用 TTS 念出来,变成一个会说话的字幕君,玩法一下就打开了。Image

语音识别这块,它不是自己造轮子,而是把主流引擎几乎全打通了: 微软 Azure、Speechly、Deepgram,还有浏览器自带的 WebSpeech API(Chrome、Edge 都能用)。 你是偏稳定的云服务党,还是想走“浏览器白嫖流”,基本都能接上。

更好玩的是,Curses 不只是“把字打出来那么无聊”。 它给字幕样式塞满了选项:颜色、字体、阴影、背景纹理、打字机动画、音效、粒子特效,甚至直接让你上 CSS。 简单点说——你平时想在 PPT 里乱加的骚操作,现在都可以堆在字幕上。Image

字体这块也没抠门,直接对接 Google Fonts 上千种免费字体。 你想搞日系二次元、科技赛博风、手写弹幕感,随便挑,调好之后保存成一个“场景”,下次一键切换,直播间画风想怎么变就怎么变。

如果你在 Twitch 混,那 Curses 的“聊天室联动”大概会戳到你。 它不仅能把语音识别结果发到 Twitch 聊天,还能反向把聊天消息当字幕来源,再加上 7TV / FFZ / BTTV 的表情包显示,整条弹幕直接变成一行行会冒表情的小字幕,看起来既热闹又不乱。

Discord 这边也没被冷落。 你可以把语音转文字结果丢进指定频道,等于给语音频道加了一个“自动会议纪要+字幕助手”,开线上会议、录播节目时,后期整理内容会轻松很多。 VRChat 党也有照顾到,支持 KillFrenzy Avatar text 和官方 chatbox,这对虚拟主播、社恐玩家都挺友好。

让我觉得最像“专业工具”的,是它自带的场景系统。 你可以为不同节目段落做几套完全不同的字幕风格:比如开场就整点粒子特效+音效,正片用简洁白字黑底,K 歌环节再换成糖果色渐变字体。 配合 OBS 的场景切换,借助 obs-websocket,Curses 能在你切场景时自动换字幕方案,做到视觉风格跟内容同步变化,这味儿就上来了。

实话讲,对比市面上常见的字幕工具,Curses 这个思路还挺清爽的。 很多“傻瓜工具”优点是要啥都有现成的,但样式死板、扩展性差,一到你真想玩点花活,就立刻原形毕露。 Curses 则是典型的“给你一整盒乐高”:入门可能麻烦一点,但你肯花时间堆,出来的东西就是别人套模板永远弄不出的味道。

当然,它也不是完美无坑。 毕竟是 GitHub 上的开源项目,英文页面、插件配置、与 OBS / VRChat / Twitch / Discord 的串联,都需要一点折腾能力; 再加上你要搞 Azure、Speechly、Deepgram 这些服务,多多少少要过一遍文档、申请个 key,对纯小白来说门槛不算低。

但反过来看,这种开源工具的好处也很明显: 不用被某个订阅制平台套牢,想改样式就改、想搬机器就搬,只要你熟悉自己的直播/录制链路,Curses 就是个可以慢慢打磨的“私有字幕工作站”,越用越顺手的那种。

GitHub地址:github.com/mmpneo/curses